实验 15:在 HAMi GPU 共享资源上运行 SGLang
在 GPU 集群上安装 HAMi,并使用 GPU 切分资源调度 SGLang 推理服务。
在 GPU 集群上安装 HAMi,并使用 GPU 切分资源调度 SGLang 推理服务。
将模型打包为 KitOps ModelKit,通过 initContainer 从 Jozu Hub 拉取,并使用 SGLang(可选 vLLM)在 HAMi GPU 共享资源上从本地提供服务。
在已有 GPU 集群上安装 HAMi,并用 GPU 切分能力调度 vLLM 推理服务。