国产卡上的大模型推理

需要在国产卡上部署大模型推理服务、查各卡对应推理镜像时阅读

部署安装 / GPU与异构算力
国产算力大模型推理vLLMMindIEOllamaTriton昇腾Ascend海光DCU寒武纪MLU沐曦MetaXDTKINFERNENCE_IMAGES

国产卡上的大模型推理

CubeStudio 把推理框架抽象为服务类型 service_type,每种类型对应一组镜像(INFERNENCE_IMAGESinstall/docker/config.py:1277)。国产卡推理「换镜像不换流程」:选 service_type + 卡适配镜像 + 卡资源即可。

一、服务类型(INFERNENCE_IMAGES 的 key)

service_type 用途
ml-server 平台通用推理
tfserving / torch-server / triton-server TF Serving / TorchServe / Triton(多版本)
vllm / vllm-distributed vLLM 单机 / 多机
ollama Ollama
mindie / mindie-distributed 昇腾 MindIE 单机 / 多机
triton-llm TensorRT-LLM

ENABLE_INFERENCEconfig.py:1276)控开放范围,默认 [] 全开放。

二、各国产卡推理镜像(示例,以实际为准)

框架 镜像
昇腾(Atlas 800I-A3/A2、300I-Duo) MindIE swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:2.3.0-800I-A3-py311-openeuler24.03-lts(及 A2 / 300I-Duo)
海光 DCU vLLM image.sourcefind.cn:5000/dcu/admin/base/vllm:0.8.5-ubuntu22.04-dtk25.04.1-py3.10
寒武纪 MLU vLLM ccr.ccs.tencentyun.com/cube-studio/vllm:v0.11.2-mlu
昇腾 / 沐曦 LLaMA-Factory(含推理) ccr.ccs.tencentyun.com/cube-studio/llama-factory:20250601
NVIDIA vLLM / Triton-LLM / Ollama vllm/vllm-openaitensorrt-llm/releaseollama/ollama
  • 昇腾走 MindIE,按 Atlas 硬件型号分版本、基于 openEuler;多机 mindie-distributed 自动生成 rank table 组网(见 昇腾大模型训练与推理全链路)。
  • 海光 vLLM 带 DTK 版本号(sourcefind 官方仓库);寒武纪 vLLM 带 -mlu 后缀。

三、deploy-service 部署参数

deploy-service 算子(job-template/job/deploy-service/)在 Pipeline 中一键创建/更新推理服务并发布。核心参数:

分组 参数
模型信息 --project_name(须已存在)、--model_name+--model_version(唯一标识服务)、--model_path--label
类型镜像 --service_type--images
资源副本 --resource_cpu/memory/gpu--replicas--hpa
网络高级 --host(空则自动域名)、--ports--volume_mountpvc名(pvc):/路径)、--inference_config(挂载到 /config/)、--metrics8080:/metrics)、--health8080:/health

上线逻辑(launcher):①校验项目组存在;②按 model_name+model_version 查服务——不存在则 POST 新建、已存在则 PUT 更新;③成功后调部署接口发布到生产。

四、部署流程(统一)

  1. 模型放分布式存储;2. 新建推理服务,选 service_type 与卡适配镜像;3. 申请卡资源(1(npu910)/1(dcu)/1(mlu370));4. 配 model_path 与并发/显存/inference_config;5. 部署到 K8s,多机由 Volcano 编排组网;6. 纳入流量网关对外 API。

五、统一纳管

弹性伸缩(--hpa)、多机推理(vllm-distributed/mindie-distributed)、流量网关 + JWT、监控告警(--metrics QPS/时延接入 Grafana)、健康检查(--health)、计量计费——对所有卡一致。

最后更新 2026-08-24完整文档以官方仓库为准:GitHub Wiki