寒武纪 MLU 适配(Cambricon)
本篇说明如何在 CubeStudio 平台上接入寒武纪 MLU(Cambricon,型号 MLU370)算力卡,覆盖主机驱动运行时、k8s device plugin、节点可用卡数查询、Pod 占用测试与整体资源查看。
部署步骤来自
install/kubernetes/gpu/mlu/readme.md(含原始操作截图)。
平台资源名配置
寒武纪在平台中对应的 GPU 资源 key 为 mlu370,映射到 k8s 资源名 cambricon.com/mlu370(install/docker/config.py:1197 的 GPU_RESOURCE):
"mlu370": "cambricon.com/mlu370", # 寒武纪370
在 Notebook / 推理服务 / 任务流的「GPU」字段中填写格式为 数量(型号key),例如申请 1 张寒武纪卡填 1(mlu370)。括号里的 key 会被平台解析后映射到对应的 k8s 资源名(解析逻辑见 myapp/utils/core.py:1622 的 get_gpu)。
大模型推理:寒武纪可用平台提供的 vLLM MLU 镜像
ccr.ccs.tencentyun.com/cube-studio/vllm:v0.11.2-mlu(install/docker/config.py:1277注释)。
补充能力:
- 分布式训练:分布式任务模板侧同样内置
mlu370 → cambricon.com/mlu370映射(job-template/job/pkgs/k8s/py_k8s.py:40),TF / PyTorch 等分布式训练任务可直接申请寒武纪卡; - vMLU 虚拟化预置:平台部署的 HAMi 调度配置已预置寒武纪虚拟化资源段——
cambricon.com/vmlu(数量)与cambricon.com/mlu.smlu.vmemory(sMLU 显存切分,install/kubernetes/gpu/vgpu/vgpu.yaml:507-509),如需 MLU 切分共享可按 HAMi 官方文档启用。
一、主机驱动和运行时
主机正常安装寒武纪驱动与运行时。

二、安装 k8s 相关组件
在 k8s 中安装寒武纪相关组件,包含 device plugin 等。

三、查询机器可用卡数
通过 kubectl describe node 查看寒武纪节点上报的可用卡数:
kubectl describe node xx.xx.xx.xx
# xx.xx.xx.xx 是寒武纪节点 ip

四、Pod 占用寒武纪卡测试
在 Pod 内部查看占用的卡。

五、整体资源查看
在平台上查看寒武纪卡的整体资源占用情况。
