实验 11: 使用 HAMi DRA 共享 GPU 运行 KServe 推理服务
部署 KServe Standard vLLM 服务,并通过 HAMi 原生 DRA Claim 让两个 Predictor 副本共享一张 NVIDIA GPU。
部署 KServe Standard vLLM 服务,并通过 HAMi 原生 DRA Claim 让两个 Predictor 副本共享一张 NVIDIA GPU。
将模型打包为 KitOps ModelKit,通过 initContainer 从 Jozu Hub 拉取,并使用 SGLang(可选 vLLM)在 HAMi GPU 共享资源上从本地提供服务。
在已有 GPU 集群上安装 HAMi,并用 GPU 切分能力调度 vLLM 推理服务。