昆仑芯 XPU 适配

在 CubeStudio 上接入百度昆仑芯 XPU 卡(驱动、k8s device plugin、节点资源、Notebook、推理服务部署 DeepSeek)时读这篇

02-部署安装 / GPU与异构算力
昆仑芯kunlunkunlunxinXPUxpuxpu-smi百度昆仑kunlunxin.com/xpudevice pluginexporter国产GPU异构算力DeepSeekxtrtllm推理服务

昆仑芯 XPU 适配(百度昆仑芯)

本篇说明如何在 CubeStudio 平台上接入百度昆仑芯(kunlunxin / XPU)算力卡,覆盖主机驱动、k8s device plugin、节点资源识别、Notebook 与推理服务使用。

部署步骤来自 install/kubernetes/gpu/kunlun/readme.md(含原始操作截图)。

平台资源名配置

昆仑芯在平台中对应的 GPU 资源 key 为 xpu,映射到 k8s 资源名 kunlunxin.com/xpuinstall/docker/config.py:1202GPU_RESOURCE):

"xpu": "kunlunxin.com/xpu",    # 百度昆仑芯

在 Notebook / 推理服务 / 任务流的「GPU」字段中填写格式为 数量(型号key),例如申请 1 张昆仑芯卡填 1(xpu)。括号里的 key 会被平台解析后映射到对应的 k8s 资源名(解析逻辑见 myapp/utils/core.py:1622get_gpu)。

补充能力:

  • 分布式训练:分布式任务模板侧同样内置 xpu → kunlunxin.com/xpu 映射(job-template/job/pkgs/k8s/py_k8s.py:46),TF / PyTorch 等分布式训练任务可直接申请昆仑芯卡;
  • vXPU 虚拟化预置:平台部署的 HAMi 调度配置已预置昆仑芯虚拟化资源——kunlunxin.com/vxpu(切分数量)与 kunlunxin.com/vxpu-memory(显存切分,install/kubernetes/gpu/vgpu/vgpu.yaml:117-125),如需单卡多任务共享可按 HAMi 官方文档启用;
  • 飞桨开发镜像:Notebook 可参考 config 中整理的昆仑芯 Paddle 镜像 ccr.ccs.tencentyun.com/cube-studio/paddle-xpu:ubuntu20-x86_64-gcc84-py310install/docker/config.py:973 注释)。

一、主机 xpu-smi

主机驱动正常安装后,使用 xpu-smi 查看卡信息。

xpu-smi 查看卡

二、K8S device plugin / exporter

在 k8s 中部署昆仑芯的 device plugin 与 exporter 组件。下载地址(外部 OSS):

部署 device plugin

三、节点资源

device plugin 部署完成后,k8s 节点上会上报昆仑芯卡资源。

节点资源

四、Notebook 使用

在 Notebook 中申请昆仑芯卡(GPU 字段填 数量(xpu)),进入容器后即可使用昆仑芯算力。

Notebook 1 Notebook 2 Notebook 3

五、推理服务(部署 DeepSeek)

在推理服务中使用昆仑芯卡部署 DeepSeek 模型。

推理服务 1 推理服务 2 推理服务 3

  • 镜像:ccr.ccs.tencentyun.com/cube-studio/xtrtllm_ubuntu_2004_x86_64_deepseek-v3:v20

镜像与挂载

  • 挂载目录:kubeflow-user-workspace(pvc):/mnt/mnt/model(hostpath):/workspace
  • /mnt/model 内容放在文件夹 model

挂载目录

  • 启动命令:
source /home/pt201/bin/activate && export LD_LIBRARY_PATH=/usr/local/xpu/so:$LD_LIBRARY_PATH && bash /workspace/deepseek_server/run_server.sh /workspace/DeepSeek-R1-tokenizer /workspace/DeepSeek-R1-0528-BF16-engine r1

六、测试

部署完成后测试推理接口。

测试

最后更新 2026-07-15完整文档以官方仓库为准:GitHub Wiki