FAQ 中心

CubeStudio 常见问题

认识平台、技术选型、部署上手、日常使用、故障排查、运维与生态——常见问题都在这里。

认识平台16 个问题

平台是什么、开源协议、技术栈、与同类对比、开源版与商业版差异。

QCubeStudio 是什么?

CubeStudio 是一款国产化一站式开源机器学习与大模型平台(MLOps / MaaS / 算力调度),开源协议 MIT,开源免费商用,开源版本已有数千家企业私有化部署。 它基于 Kubernetes 构建,覆盖算力纳管调度、数据标注、Notebook 在线开发、Pipeline 拖拉拽编排、多机多卡分布式训练、超参搜索、AutoML、推理服务部署、大模型微调与推理、AI 模型市场等完整工作流;其中部分高级能力(如 ARM64/国产 NPU 调度、大模型一键微调、AIHub)为商业版特性,仅商业版功能收费。 详见平台知识库《项目简介》与《商业版与开源版功能清单》。

更新于 2026-07-13
QCubeStudio 采用什么开源协议?可以商用吗?

结论:CubeStudio 开源版采用 MIT 开源协议,允许免费商用,涵盖生产环境的商业项目。 MIT 是最宽松的开源协议之一,允许自由修改、二次分发与私有化部署,仅需保留版权与许可声明,无需对外开源你的业务代码。 商业版另支持源码交付与商业授权:授权后可改造加工成自己的产品,没有 license 部署个数和时长限制,可对外出售,详见「商业版 · 商务合作」。

更新于 2026-07-13
QCubeStudio 与 Kubeflow、MLflow 有什么区别?

一句话:MLflow 偏「实验/模型管理库」,Kubeflow 偏「K8s 上的 ML 工具集」,CubeStudio 是「面向国产化的一站式 MLOps 平台」。 - 形态:MLflow 是轻量库;Kubeflow 是组件拼装;CubeStudio 开箱即用、Web 全流程。 - 部署:三者都跑在 Kubernetes 上,但 CubeStudio 提供从单机到多集群的成套部署脚本与内网离线安装方案。 - 国产化:CubeStudio 配置层内置昇腾 / 海光 / 寒武纪 / 昆仑芯 / 沐曦 / 摩尔线程等国产卡的 K8s 资源名映射(国产算力调度为商业版能力),Kubeflow / MLflow 需自行适配。 详见「竞品对比」页的多维表格。

更新于 2026-07-13
QCubeStudio 是基于 Kubeflow 开发的吗?

不是。CubeStudio 与 Kubeflow 生态目前没有太多关系:项目最初基于 Kubeflow 开发,现在只使用了 Kubeflow 的 train-operator 组件。 Pipeline 也不是原生 KFP——训练任务流的底层调度是 Argo(云原生 workflow 引擎,实例存储于 etcd)。 详见平台知识库《基础组件介绍》。

更新于 2026-07-13
QCubeStudio 的技术栈是什么?

CubeStudio 自身代码:前端 React,后端 Python(基于 FAB 框架),没有 Go 代码;依赖的 K8s 基础组件(istio、argo、prometheus 等)为 Go 编写的开源组件。 平台自底向上四层:机器标准化 → 分布式存储 + K8s 集群 + 监控体系(Prometheus/Grafana)→ 分布式训练/超参搜索基础能力(tf / pytorch / volcano / ray / nni)→ Web 平台层(权限、在线开发、编排、推理服务管理)。 详见平台知识库《基础组件介绍》《平台架构-Kubernetes基础》。

更新于 2026-07-13
Q开源版和商业版的主要区别是什么?

开源版即可完整运行平台主流程:项目组与 RBAC 多租户、Notebook(JupyterLab/VSCode)、在线构建镜像、Pipeline 拖拉拽编排与定时调度、tf/pytorch 分布式训练、单机超参搜索、推理服务(自定义镜像及 tfserving/torchserve/triton)、Prometheus/Grafana 监控。 商业版特有能力主要包括:ARM64 与国产 NPU/DCU 算力调度、GPU 独占/共享/vGPU 模式、多 K8s 集群、HTTPS 与 SSO 对接、计量计费、数据标注平台与自动化标注、AIHub 模型市场(400+ 预训练模型)、大模型一键微调与 vLLM/MindIE 推理、私有知识库、边缘集群等。 仅商业版功能收费,支持只采购部分功能。完整对照见平台知识库《商业版与开源版功能清单》。

更新于 2026-07-13
QCubeStudio 支持大模型(LLM)吗?

支持,大模型全链路能力集中在商业版: - 微调:llama-factory 一键微调,支持 deepseek / qwen2 / chatglm4 / baichuan2 等 LoRA 微调,且有 NPU(昇腾)适配版本。 - 推理:vLLM 推理加速 + 流式 OpenAI 接口、分布式多机多卡 vLLM 推理、昇腾 MindIE 推理服务(支持 910b / 310p)。 - 分布式加速:deepspeed / megatron / colossalai / horovod 等多机多卡训练框架。 - 配套:智能对话、私有知识库(支持微信公众号 / 企业微信 / 钉钉机器人对接)。 开源版可用自定义推理镜像自行部署大模型服务。详见平台知识库《任务模板-大模型》《推理服务-大模型LLM》。

更新于 2026-07-13
QCubeStudio 是否符合信创与等保合规要求?

CubeStudio 面向信创环境设计:配置层内置国产芯片(昇腾/海光/寒武纪/昆仑芯/沐曦/摩尔线程等)资源名映射,元数据库支持达梦(DM),支持完全内网离线私有化部署,数据与模型不出域。 平台提供 RBAC 权限、多租户隔离、加密与安全加固等能力支撑合规建设;其中 HTTPS、SSO 对接、操作历史记录等增强项为商业版特性。 具体合规结论需结合用户单位的等保测评范围确认。详见平台知识库《加密与安全加固》《多租户隔离》。

更新于 2026-07-13
Q有公共体验环境(Demo)吗?

有。社区用 docker-compose 部署了开源版 Demo 体验环境(www.data-master.net),但该环境没有 K8s 集群,与 K8s 相关的功能(训练调度、推理部署等)无法在公共环境中体验。 想体验完整开源版或商业版功能,可联系社区管理员,或用 k3s 在单台机器上自行部署一套(见「部署上手」分类)。

更新于 2026-07-13
QAIHub 模型市场是什么?

AIHub 是 CubeStudio 提供的开源模型仓库(商业版特性):集成大量可商用开源 AI 模型,覆盖计算机视觉(分类/检测/生成/人脸)、自然语言处理(分类/情感/翻译/对话)、语音(识别/合成/声纹)与多模态(图文理解/生成/视频分析)。 支持模型的快速部署(一键「部署Web」)、在线推理(同步/异步 HTTP API)、自动化标注、微调训练与二次开发。总览口径为 400+ 可商用模型,实际数量随版本与上架情况变化,以平台页面为准。 详见平台知识库《AIHub模型市场》。

更新于 2026-07-13
Q私有知识库是什么?工作原理是怎样的?

私有知识库(商业版)是平台内置的 RAG 问答能力:先配置一个大的先验知识库(upload_url),用户提问时按 query 召回最相关的先验知识(recall_url,可用于调试召回效果),再把召回内容拼进提示词模板与问题一起提给大模型。 支持:多轮对话(传入 history/query 并限制上下文长度)、两种服务类型(openai 对话接口 / aihub 接口——文生图 AIGC 走后者)、微信与钉钉智能聊天对接(配置 AppID/秘钥/Token),另支持企业微信群机器人与微信公众号。 详见平台知识库《私有知识库》《GPT知识库实现原理》。

更新于 2026-07-13
QCubeStudio 的机器/算力租赁是什么功能?

租赁是一个独立的算力售卖模块:用户以「租赁实例」形式按量或按天租用一段算力(含 GPU),每个租赁实例是独立于 Notebook 的独立 Pod,通过泛域名访问。 关键属性:租赁类型(单卡 single_gpu / 整机 whole_machine)、计费方式(按量 on_demand 按时长×每小时单价 / 按天 daily 走账单表)、镜像类目(在线 IDE / 开发 / 模型市场应用 / 推理 / 自定义)、可选自动续费。 默认关闭,管理员在 config.py 配置 ENABLE_RENTAL=True 开启;费用与计量计费体系打通。详见平台知识库《机器租赁》《计量计费》。

更新于 2026-07-13
QCubeStudio 和腾讯是什么关系?主仓库在哪里?

项目起源于腾讯音乐时期,旧仓库为 tencentmusic/cube-studio;现已迁移至 data-infra/cube-studio 并由开源社区维护,旧仓库已停止维护,请勿再引用。 现行主仓库、Wiki 文档与开源社区均以 GitHub data-infra/cube-studio 为准;Gitee 有国内镜像仓库便于克隆,但文档以 GitHub 维护更好。

更新于 2026-07-13
QCubeStudio 支持 HPC(高性能计算)场景吗?

HPC 任务模板目前仅商业版支持。 开源版可覆盖常规的多机多卡分布式训练(tf/pytorch 模板)与 volcano 成组调度场景;对 RDMA/IB 高速网络的资源占用同样为商业版能力(网络驱动部署文档开源可用)。

更新于 2026-07-13
QCubeStudio 支持数据血缘吗?

血缘链路为商业版功能。 对接公司数据中台时,血缘关系是拼图之一(其余为计算引擎 SQLLab、调度引擎数据 ETL、元数据库表/指标/维表);二次开发文档提供了通用血缘链路接口参考。 详见平台知识库《通用血缘链路接口》。

更新于 2026-07-13
QCubeStudio 的流量入口架构是怎样的?各功能走什么路径?

平台对外统一通过 istio ingress gateway 暴露服务:浏览器所有请求打到网关 80 端口,再按 URL 路径前缀分发到各命名空间的后端。 gateway.yaml 决定哪些流量能进来(端口/host),virtual.yaml(VirtualService)决定进来的流量怎么分发。 主要路径前缀:/backend(后端接口,前端 nginx strip 前缀后转给 Flask)、/frontend(前端 SPA)、/static(静态资源);/grafana/(监控,monitoring 命名空间)、/labelstudio/(标注平台)、/k8s/dashboard/*(K8s 看板,高/低权限两套)——这几条需带登录 cookie;notebook 与 AIHub 应用在部署时由后端动态创建 /notebook/jupyter/$name/、/aihub/$name 路由。 详见平台知识库《流量代理与网关》。

更新于 2026-07-13

技术选型20 个问题

国产芯片 / ARM / 操作系统 / 数据库支持、K8s 版本、机器规格、内网部署、多集群。

QCubeStudio 支持哪些国产芯片(GPU/NPU)?

平台配置层(config.py 的 GPU_RESOURCE)已内置多家国产算力卡的 K8s 资源名映射:华为昇腾 310 / 310P / 910、海光 DCU、寒武纪 MLU370、沐曦、昆仑芯 XPU、摩尔线程、江原 GCU 等。 注意版本边界:国产 NPU / DCU 的算力调度为商业版能力;开源版面向 NVIDIA GPU(T4 / V100 / A100 等卡型)。 任意一款国产卡接入平台走统一 8 步流程:装驱动 → 容器运行时适配 → 部署厂商 device-plugin → 明确资源占用约定 → 接入监控 → 配置 GPU_RESOURCE → 配置环境镜像 → 安装框架包。 详见平台知识库《国产GPU与ARM64适配总览》及昇腾/海光/寒武纪等各厂商子篇。

更新于 2026-07-13
QCubeStudio 支持 ARM64 架构(鲲鹏/飞腾服务器)吗?

分版本:开源版支持 amd64(x86_64);商业版同时支持 arm64 和 amd64——前后端镜像、平台底层组件、任务模板、超参搜索均有 ARM 适配,AIHub 应用约 70% 支持 ARM。 ARM64 部署要点:K8s 底座部署方式与 x86 相同;平台镜像需使用 arm64 版本(notebook 的 arm64 镜像目前支持 vscode 和 jupyter),部分任务模板镜像需在 ARM 机器上重新构建(docker buildx 支持多架构构建)。 详见平台知识库《国产GPU与ARM64适配总览》。

更新于 2026-07-13
Q使用 CubeStudio 必须要有 Kubernetes 吗?支持哪些 K8s 版本?

是的,完整平台需要 Kubernetes:训练、推理、Pipeline 等都以容器任务调度在 K8s 上。支持 K8s 1.25 ~ 1.31,建议 1.28。 - 单机 / 试用:用 k3s 等轻量级 K8s 在一台机器上即可拉起完整平台。 - 生产:多节点 K8s 集群,获得弹性调度、多租户与高可用。 - docker-compose(install/docker)仅用于本地一键启动前后端做开发调试,很多功能仍需连接远程 K8s 才能正常运行,不能替代 K8s 跑完整平台。 详见平台知识库《部署总览与前置要求》。

更新于 2026-07-13
QCubeStudio 支持哪些 Kubernetes 部署方式?

平台知识库为每种 K8s 底座提供了成套部署文档: - 单机:k3s 单机部署(轻量,快速体验)、单机 K8s 部署。 - 多机:kubeadm、kubekey(含离线部署与高可用)、KubeSphere 多机、Rancher RKE、RKE2。 - 特殊场景:Windows 部署(WSL2)、KubeEdge 边缘集群(边缘节点开发/训练/推理,商业版)。 K8s 底座就绪后统一用 start.sh 部署 CubeStudio 平台本体。详见平台知识库《部署方式》目录。

更新于 2026-07-13
QCubeStudio 能否在内网离线环境部署?

可以,离线部署分两种场景,文档均有成套步骤: 1. 完全无法联网:在联网机器上下载好全部镜像、模型与依赖包,拷入内网,配合内网 Harbor 私有镜像仓库完成部署(提供 push_harbor/pull_harbor 脚本与离线安装包)。 2. 内网有一台可联网的出口机:用 nginx/iptables + coredns 把出口机做成代理,其余内网机器走代理拉取。 同时需把镜像拉取策略 IMAGE_PULL_POLICY 从 Always 改为 IfNotPresent,避免运行期反复外拉。适配涉密/政企内网与信创环境,数据与模型全程不出域。 详见平台知识库《离线部署》《私有镜像仓库Harbor》。

更新于 2026-07-13
QCubeStudio 部署的机器配置要求是多少?

按文档《部署总览与前置要求》: - 基础依赖:docker >= 1.19(存储目录 > 1T);K8s 1.25~1.31(建议 1.28);所有机器磁盘 >= 1T。 - 控制端机器:CPU >= 16 核、内存 >= 32G,至少 1 台;生产建议 32 核 64G × 2。 - 任务端机器按场景配置:机器学习选 CPU 机器(> 32 核 64G × 2);深度学习训练选 V100、推理选 T4;大模型训练选 H800、推理选 A100;每张 GPU 卡建议配 > 20 核 CPU。 - 共享存储(NFS/Ceph,多机时):挂载到每台机器 /data/k8s/,起步建议 SSD 5T;单机可忽略。 - 建议同时配置纯 CPU 服务器,不要只有 GPU 训练机器。

更新于 2026-07-13
QCubeStudio 支持哪些操作系统?

服务器操作系统:Ubuntu 20.04 / 22.04 / 24.04,或 CentOS 7.9 / CentOS 8。 Windows 机器可基于 WSL2 部署(有专篇文档),但注意 WSL2 只能开 GPU docker、用不了 nvidia k8s plugins,仅适合本地体验。 国产操作系统适配随商业版 ARM64/信创方案提供,选型前建议联系管理员确认具体版本。 详见平台知识库《部署总览与前置要求》《Windows部署》。

更新于 2026-07-13
QCubeStudio 元数据库支持哪些数据库?支持达梦吗?

支持三类元数据库,由环境变量控制切换:MySQL 8+(主选,开源版)、PostgreSQL 11+(商业版)、达梦 DamengDB(信创场景,有专篇部署与迁移文档)。 对应环境变量:MYSQL_SERVICE / POSTGRESQL_SERVICE / DM_SERVICE。没有外部数据库时可直接使用平台自带的 MySQL。 详见平台知识库《元数据库配置》《达梦数据库部署与迁移》。

更新于 2026-07-13
Q支持 GPU 虚拟化(vGPU)、混合算力与多集群管理吗?

支持,注意版本边界: - 多资源组:开源版支持,可按项目组划分算力资源池。 - 多 K8s 集群统一纳管、IPVS 网络模式、containerd 运行时:商业版。 - GPU 占用模式(独占 / 共享 / vGPU / 指定卡序号 / 虚拟化显存设定):商业版;CubeStudio 的 vGPU 能力不需要额外授权 license。 - 混合算力:CPU / NVIDIA GPU 开源可调度;国产 NPU / DCU 调度为商业版。 详见平台知识库《多机多集群多资源组》《vGPU虚拟化》。

更新于 2026-07-13
QCubeStudio 支持 RDMA / InfiniBand 高速网络吗?

支持。平台通过 k8s-rdma-shared-dev-plugin 把宿主机 RDMA 网卡以 rdma/hca 资源的形式暴露给 Pod,服务于多机多卡分布式训练的 NCCL 通信与高性能存储。 支持两种链路层:InfiniBand(ibv_devinfo 显示 Link layer: InfiniBand)与 RoCE(以太网承载 RDMA);文档覆盖 Mellanox OFED 驱动安装、ib_read_bw 压测与 device plugin 部署 YAML。 训练任务的 RDMA 资源占用与 IB 流量监控为商业版能力。详见平台知识库《RDMA高速网络》《RDMA网络与分布式训练》。

更新于 2026-07-13
Q多机部署需要什么共享存储?支持哪些分布式存储?

多机部署要求每台机器的 /data/k8s/ 目录是同一份共享存储(pipeline 工作目录、数据集、用户工作空间都落在其下),起步建议 SSD 5T;单机部署直接用本机目录即可。 选型:NFS 最简单(中小规模/测试环境,有在线与离线安装文档);对一致性、吞吐要求更高用 Ceph 或对象存储;JuiceFS 本身就是分布式文件存储,无需再套底层存储。 商业版支持 Web 界面添加存储盘并绑定项目组,可挂载 NFS / CFS / OSS / NAS / COS / GlusterFS / CephFS / S3(MinIO)。 详见平台知识库《NFS共享存储》《分布式存储目录》《算力统筹与分布式存储》。

更新于 2026-07-13
QCubeStudio 支持边缘计算 / 边缘集群吗?

商业版支持 KubeEdge 边缘集群模式:云端部署 CloudCore 与平台,边缘节点接入后支持在边缘侧开发、训练、推理。 文档提供完整落地系列:原理与适用场景、一键脚本部署、云端环境准备(K8s 与 NFS)、边缘节点接入与项目组配置、验证与最大坑(label 硬编码)、踩坑速查。 车机/手机端部署目前暂无案例。详见平台知识库《边缘集群部署-KubeEdge》子目录(8 篇)。

更新于 2026-07-13
Q支持 serverless 弹性集群吗?

商业版支持腾讯云与阿里云的 serverless 集群模式,notebook / pipeline / 推理服务三个模块均可运行其上。 适合不想维护固定 GPU 节点、希望按需弹性付费的场景;与自建 K8s 集群可通过多集群能力(商业版)统一纳管。

更新于 2026-07-13
QWindows 机器能部署 CubeStudio 吗?

可以基于 WSL2 部署,有专篇文档,适合本地体验与开发调试。 已知限制:WSL2 只能开 GPU docker、无法使用 nvidia k8s plugins;有 CPU 长期打满的已知问题(可扩内存或改用 SSD 缓解)。 生产环境请使用 Linux(Ubuntu 20.04/22.04/24.04 或 CentOS 7.9/8)。详见平台知识库《Windows部署》。

更新于 2026-07-13
QCubeStudio 支持哪些 NVIDIA GPU 卡型?怎么选卡?

T4 / V100 / A100 / A10 等主流卡型均支持,提供 cuda11 GPU 镜像。机器以 gpu-type 节点标签标注卡型(标签值必须大写,如 gpu-type=V100),任务配置算力时可指定卡型(如「2(T4)」表示 2 张 T4)。 官方选型建议:深度学习训练选 V100、推理选 T4;大模型训练选 H800、推理选 A100;每张 GPU 卡配 > 20 核 CPU(4 卡服务器建议 > 80 核),并同时配置纯 CPU 服务器。 详见平台知识库《部署总览与前置要求》《GPU节点接入与初始化》。

更新于 2026-07-13
Q支持 NVIDIA Jetson 边缘 GPU 盒子吗?

支持接入。Jetson(Orin NX / Xavier 等)是 arm64 架构、基于 L4T(Linux for Tegra)的边缘 GPU 设备,接入方式与常规 x86 GPU 服务器不同:不需要单独装显卡驱动(随 Jetpack 刷机自带),但容器运行时与镜像有专门要求。 - Jetpack 6.2:刷机后环境完好,可直接加入 K8s 集群; - Jetpack 5.1:需按文档安装 NVIDIA 容器运行时(nvidia-container-toolkit)并验证 GPU(jetson_release / jtop / tegrastats 查看环境); - 镜像需使用 L4T 系列(l4t-pytorch / l4t-cuda)。 详见平台知识库《Jetson节点初始化》。

更新于 2026-07-13
Q平台部署在内网没有公网 IP,公网用户怎么访问?

用 FRP 内网穿透方案:只需一台带公网 IP 的云服务器(最低 1C2G,任意云厂商),云服务器运行 frps 服务端(监听 7000 与业务端口),内网机器运行 frpc 主动发起反向长连接(token 鉴权,可选 TLS),即可把 Web 控制台、Notebook、推理服务、内部服务端口、SSH 全部对外暴露。 方案纯网络层端口转发,不修改平台任何业务代码;配置样例(frps.ini / frpc.ini / 启动脚本)在仓库 install/kubernetes/frp/ 目录。 商业版另支持反向代理与内网穿透访问方式。详见平台知识库《FRP内网穿透》。

更新于 2026-07-13
Q想把现有 x86 + NVIDIA 的 AI 平台替换成国产算力(信创国产化替代),CubeStudio 怎么落地?

结论:CubeStudio 面向信创设计,国产化替代可按「一套平台 + 全内网部署 + 逐环节替换」推进,无需换平台。 1. 算力层:按《国产GPU与ARM64适配总览》的 8 步通用流程接入目标国产卡(驱动 → 容器运行时 → K8s device-plugin → 资源占用约定 → 监控 → config.py 的 GPU_RESOURCE 配置 → 环境镜像 → 框架包);已适配昇腾/海光/寒武纪/沐曦/昆仑芯/摩尔线程/壁仞等。 2. 架构层:鲲鹏/飞腾 ARM64 主机用 docker buildx 构建 arm64 版镜像,替换无 arm64 版本的组件与模板镜像。 3. 系统层:部署在麒麟/统信 UOS 等国产 OS。 4. 部署形态:内网离线/信创私有化部署,数据与模型不出域。 5. 数据层:元数据库可选达梦 DamengDB。 注意版本边界:国产 NPU/DCU 调度、ARM64 支持为商业版能力。 详见平台知识库《国产算力选型与信创适配速查》《国产GPU与ARM64适配总览》《离线部署》。

更新于 2026-08-20
Q国产 GPU/NPU 支持单卡多租户共享切分吗?和英伟达的 vGPU 有什么区别?

支持,按卡分方案(均为商业版能力): - 海光 DCU:两条路线——HAMi 动态切分(vdcu,用 hygon.com/dcumem、hygon.com/dcucores 指定显存/算力规格)与驱动层静态切分(vdcu1,可与整卡在同节点混用)。 - 昇腾 NPU:静态 vNPU(npu-smi 按模板切分,如 vir05_1c_16g;限制是一个 Pod 只能占一张 vNPU),也可用 MindX DL 动态虚拟化。 - 对照 NVIDIA:平台用第四范式 HAMi 做 vGPU(申请 0.5 这类小数卡,按百分比切显存+算力),另有物理层的 MIG。 注意:海光开启 MIG 后 vDCU 不可用,且 MIG 即将弃用。 详见平台知识库《GPU多租户共享实操对比》《海光DCU》《昇腾vNPU虚拟化》《vGPU虚拟化》。

更新于 2026-08-20
Q信创环境下能用国产卡(昇腾/海光)跑大模型微调和推理吗?

可以,大模型全链路能力为商业版: - 昇腾 NPU:llama-factory 及 deepseek/qwen2/chatglm4/baichuan2 的 LoRA 微调模板均有昇腾适配版;推理支持昇腾 MindIE 分布式推理服务(910b/310p)。 - 海光 DCU:提供 vLLM 推理镜像,可在 DCU 上部署 DeepSeek 等大模型的在线推理,并支持 Pipeline 分布式多机多卡训练。 开源版可用自定义推理镜像在国产卡上自行部署大模型服务。 详见平台知识库《任务模板-大模型》《华为昇腾NPU · MindIE分布式推理》《海光DCU》。

更新于 2026-08-20

部署上手10 个问题

部署流程、单机快速体验、本地开发、GPU/NPU 节点接入、部署验证、卸载。

QCubeStudio 完整的部署流程是怎样的?

三步:先部署 K8s 集群 → 再部署 CubeStudio 平台 → 最后把其余机器加入集群。 1. 选一种方式搭 K8s 底座(k3s 单机 / kubeadm / kubekey / KubeSphere / Rancher 等,见《部署方式》)。 2. 在控制端机器执行 start.sh 部署平台:脚本会拉取镜像与基础软件、按步骤安装云原生基础组件、最后配置 istio ingressgateway 代理。 3. worker 节点不需要跑 start.sh,只需加入 K8s 集群、拉好镜像并打上调度标签(cpu=true / gpu=true / train=true / notebook=true / service=true 等)。 建议使用最新 release 版本而非 master 分支。详见平台知识库《部署方式》目录。

更新于 2026-07-13
Q单台机器怎么快速体验完整平台?

推荐 k3s 单机部署:k3s 是轻量级 Kubernetes 发行版,单台机器既当 master 也跑工作负载,即可拉起完整 CubeStudio。 要点:关闭防火墙并清空 iptables 规则;用国内镜像源加速安装 k3s(--disable=traefik,平台用 istio 做网关);k3s 就绪后执行 start.sh 部署平台。 机器建议 16 核 32G 起(部署基础组件需要较多资源)。详见平台知识库《k3s单机部署》。

更新于 2026-07-13
Q本地如何用 Docker Compose 开发调试 CubeStudio 前后端?

install/docker 目录提供了本地一键启动的 docker-compose,用于前后端开发调试: 1. 准备安装了 Docker 与 Docker Compose 的机器; 2. 拉取仓库 data-infra/cube-studio,进入 install/docker; 3. docker compose up -d 启动前后端,浏览器访问本机地址进入控制台(默认账号 admin/admin)。 注意:平台很多功能以 K8s 为基底,本地 compose 启动后与 K8s 相关的功能(训练/推理调度)需连接远程 K8s 集群才能正常运行;多集群或本地调试时把各集群 kubeconfig 按「$ENVIRONMENT-kubeconfig」规范放入 kubeconfig 目录。 另外注意 host.docker.internal 仅在 Mac/Windows 可用,Linux 上配置数据库地址请用内网 IP(不要用 127.0.0.1)。 详见平台知识库《docker-compose本地部署》《本地开发与调试》。

更新于 2026-07-13
Q部署后的默认账号密码是什么?

默认管理员账号密码为 admin / admin。系统默认开启新用户自动注册(打开页面注册即自动登录)。 忘记密码可联系管理员修改,或直接进入元数据库修改。商业版另支持强密码、登录频率限制、密码密文传输等安全增强。

更新于 2026-07-13
QGPU 机器如何接入集群并被平台调度?

五步: 1. 机器上安装对应厂商 GPU 驱动; 2. 将机器加入 K8s 集群; 3. 给节点打标签:gpu=true,并用 gpu-type 标注卡型(如 gpu-type=V100、gpu-type=T4,注意卡型标签必须大写); 4. 在 K8s 中安装对应 device-plugin 驱动插件; 5. 业务镜像中安装驱动调用库(如 CUDA),任务配置算力时可写「2(T4)」表示 2 张 T4 卡。 机器全部通过 label 管理调度:train=true / notebook=true / service=true 区分用途,org=xx 区分项目组(默认 org=public)。 详见平台知识库《GPU节点接入与初始化》。

更新于 2026-07-13
Q华为昇腾 NPU 怎么接入 CubeStudio?

昇腾接入流程(商业版能力): 1. 安装 NPU 驱动与 Ascend Docker Runtime; 2. 将 NPU device 适配到云原生,使 K8s 可识别 NPU; 3. 在 config.py 的 GPU_RESOURCE 中添加资源名(npu910 → huawei.com/Ascend910,310/310P 同理); 4. 部署 npu-exporter,配置 NPU 监控看板; 5. 构建 NPU 基础镜像(开发/调试/推理)与 MindIE 推理镜像。 接入后支持 NPU 上的训练与 MindIE 大模型分布式推理(910b / 310p)。详见平台知识库《华为昇腾NPU》子目录(基础部署 / vNPU虚拟化 / MindIE分布式推理)。

更新于 2026-07-13
Q部署完成后如何验证平台功能正常?

按官方《部署后初步验证》清单冒烟测试: 1. Pipeline:admin/admin 登录首页,运行「深度学习:目标识别训练部署」示例 pipeline,等待运行成功; 2. Notebook:在线开发 → 代码开发 → notebook,点示例的 reset,状态变 Running 后能打开界面即可; 3. 推理服务:第 1 步的 pipeline 跑完会自动生成名为 yolo26 的推理服务,点「部署生产」,成功后能通过 ip:端口 进入服务界面(内外网环境需先在项目分组配置「内网ip|外网ip」服务代理); 4. 超参搜索:模型训练 → AutoML → 超参搜索,运行后能打开描述链接的界面即可。 商业版另需验证 AIHub、数据智能与标注平台。详见平台知识库《部署验证》。

更新于 2026-07-13
Q部署完成后 pipeline / service / jupyter 等命名空间没有 Pod,正常吗?

正常。pipeline、service、jupyter、automl 这些命名空间是预留给用户任务的:跑训练任务、起 notebook、部署推理服务后才会有 Pod,刚部署完为空属正常现象,不是部署失败。 系统组件分布在 infra / kube-system / kubeflow / istio-system / monitoring / volcano-system 等命名空间,验证部署状态应看这些命名空间的 Pod 是否 Running。

更新于 2026-07-13
Q怎么卸载 CubeStudio?

仓库 install/kubernetes/rancher 中提供 reset_docker.sh 脚本,可快速卸载 K8s 集群(连同其上的平台)。 如果只是平台部署异常想重来:先删除主机 /data/k8s/infra/mysql 下的 MySQL 存储(新集群场景),再重新执行 start.sh 部署即可;start.sh 支持重复多次执行。

更新于 2026-07-13
Q开始部署前需要准备哪些镜像?

两类镜像:K8s 底座(如 rancher)镜像 + CubeStudio 平台镜像,可用部署文档中的 all_image.py 脚本一次性生成完整镜像清单。 要点: - 所有节点(含 worker)都要提前把镜像拉取好——能显著加快节点加入集群与平台部署速度,多数「部署卡住」问题都源于镜像未预拉; - rancher 相关是 docker hub 官方镜像,拉取失败多为限频,docker login 后重试即可,不需要换源; - 内网环境把清单内镜像统一导入私有 Harbor。

更新于 2026-07-13

日常使用28 个问题

Notebook、Pipeline、分布式训练、推理部署、超参搜索、大模型微调、数据 ETL 与标注。

QCubeStudio 的 Notebook 在线开发支持哪些环境?

基于开源 JupyterLab / VSCode 提供在线交互式开发,支持选择资源类型(CPU/GPU/内存),并提供机器学习、深度学习、大数据三类版本镜像: - 只有 GPU 版本的 jupyter 能调用 GPU,其他版本均为 CPU 版; - 大数据版本配置 Hadoop/Spark 集群信息后可直接查询大数据平台做 ETL 与分析; - 深度学习版本集成了 TensorBoard:先在左侧文件目录打开训练日志目录,再点 TensorBoard 图标即可查看训练曲线; - 支持 SSH remote 远程开发对接、notebook 自动清理与续期。 商业版另支持 MATLAB/RStudio、多语言环境(R/Julia/多版本 Python)、自定义 notebook 镜像、GPU 共享占用等。 详见平台知识库《新人用户使用指南》《在线IDE》。

更新于 2026-07-13
Q如何在 CubeStudio 中编排 Pipeline 任务流?

在「模型训练 → 任务流」中以拖拉拽方式编排:把数据处理、训练、评估、部署等步骤定义为任务节点,按依赖连成有向图,配置各节点镜像、启动命令、算力与挂载后一键运行,逐节点查看日志与产物。 开源版支持:单任务调试、定时调度、补录、并发限制、超时重试、实例依赖;任务流底层由 Argo 调度;运行结束的实例容器约 3 小时后自动清理(非立即删除)。 商业版另支持:任务输入输出与全局变量传递、结果可视化(文本/图片/ECharts)、workflow 暂停恢复、任务流优先级。 详见平台知识库《任务流》《pipeline配置调试定时》。

更新于 2026-07-13
QPipeline 任务之间可以传递变量吗?

开源版不提供任务之间输入输出参数变量的传递,只有商业版支持(任务输入输出 + 任务流全局变量)。 开源版的常用替代做法:上游任务把中间结果写入共享的分布式存储目录(/data/k8s/ 挂载),下游任务按约定路径读取。

更新于 2026-07-13
QCubeStudio 如何进行多机多卡分布式训练?

通过分布式训练任务模板声明副本数与算力,平台自动在 K8s 上拉起多个训练 Pod 并完成通信编排: - 开源版:TensorFlow / PyTorch 分布式训练模板,以及 volcanojob / ray 分布式数据处理。 - 商业版:mxnet / horovod / paddlejob / mindspore 分布式训练,deepspeed / megatron / colossalai / mpi 等大模型加速框架,且支持 RDMA 资源占用与 GPU 型号透传。 需要现场组建分布式集群的任务可使用 volcano 模板,由 volcano-controller 负责成组调度。 详见平台知识库《平台架构-分布式训练与加速》《任务模板-深度学习》。

更新于 2026-07-13
Q训练好的模型如何部署成在线推理服务?

流程:模型管理中注册模型版本 → 推理服务中配置推理镜像与算力 → 设置副本数与访问方式 → 一键发布(支持调试/测试/生产环境)。 开源版支持:tfserving、torchserve、triton 等推理框架或自定义推理镜像;CPU/内存弹性伸缩;流量分流与复制、泛域名、配置文件挂载、健康检查;多版本滚动升级和回滚;服务负载指标监控。 商业版另支持:ml/tf/pytorch/tensorrt/onnx 常规模型 0 代码发布、GPU 弹性伸缩、vGPU 占用、定时伸缩容、JWT 认证、大模型分布式推理。 注意:服务配置里的「端口」是业务代码的监听端口,客户端实际访问端口由平台自动生成并转发,不要改成 80(会与平台入口冲突)。 详见平台知识库《模型服务》《推理服务-triton》等各框架专篇。

更新于 2026-07-13
Q如何在 CubeStudio 上微调大模型(LLM)?

商业版提供大模型一键微调: 1. 上传/挂载训练语料数据集(支持 HuggingFace / 魔搭数据集导入模板); 2. 选择微调方式:llama-factory 大模型微调,或 deepseek / qwen2 / chatglm4 / baichuan2 的 LoRA 微调模板(均有昇腾 NPU 适配版); 3. 配置 GPU/NPU 算力与超参,微调链路自动串联「示例数据下载 → 微调 → 模型注册 → 模型部署」; 4. 微调完成后一键发布为推理服务(vLLM 加速 + 流式 OpenAI 接口)。 开源版可在 notebook / pipeline 中自行运行微调代码(如 HuggingFace 模型按其官方微调方式)。 详见平台知识库《任务模板-大模型》。

更新于 2026-07-13
QCubeStudio 的超参搜索 / AutoML 怎么用?

在「模型训练 → AutoML → 超参搜索」中创建搜索任务(基于 NNI / Ray):定义搜索空间与目标指标后运行,点击「描述」链接打开搜索界面查看各组试验结果。 开源版支持单机超参搜索;分布式超参搜索为商业版能力。 AutoML 面向非算法背景用户:选择场景、上传训练数据即可自动训练与部署。 详见平台知识库《超参搜索》《nni超参搜索》。

更新于 2026-07-13
Q数据 ETL 模块开源版能直接用吗?

开源版的数据 ETL 提供「算子模板化 + 拖拉拽编排」能力(定义任务上下游逻辑关系),但没有定义底层调度引擎——需要二次开发对接你们公司自己的调度系统后才能实际运行。 对接数据中台的完整拼图:计算引擎(SQLLab,开源支持 MySQL,商业版支持 PostgreSQL/ClickHouse/Hive/Presto)、调度引擎(数据 ETL 二开对接)、元数据(库表/指标/维表)、血缘链路(商业版)。 大数据任务(hive/spark 提交)可用 pipeline 的 hadoop 模板(商业版)实现定时调度。 详见平台知识库《数据ETL》《数据ETL调度引擎对接》《SQLLab计算引擎对接》。

更新于 2026-07-13
QCubeStudio 的数据标注平台怎么用?支持自动化标注吗?

数据标注平台整体为商业版特性(基于 LabelStudio 深度整合):支持图 / 文 / 音 / 多模态各类型标注、分布式存储打通、项目组权限控制、中文汉化。 自动化标注(需配合 AIHub):目标识别、边界识别、多目标视频跟踪、遮罩识别、图片分类、图片描述、OCR、关键点检测;大模型自动标注支持文本分类、翻译、命名实体识别、阅读理解、问答、摘要提取。 详见平台知识库《标注平台》子目录(功能与操作流程 / 数据导入格式 / 内置LLM自动标注后端)。

更新于 2026-07-13
Q如何自定义 Pipeline 算子 / 任务模板?

通过 Web 界面把自定义算法代码镜像注册为可被他人复用的 pipeline 算子:准备镜像(务必配置启动命令,否则容器会报 executable file not found)→ 在任务模板管理中注册镜像、定义参数 → 在任务流中拖拽使用。 注意:修改已有模板需要配合镜像一起改才能生效。参数类型上开源版支持 str 等基础类型,商业版额外支持 int/float/list/bool/json 与 workdir/image 子类型。 详见平台知识库《开发任务模板》《模板使用》系列。

更新于 2026-07-13
QCubeStudio 的数据集管理怎么用?

在「数据资产 → 数据集」中随时上传样本集(图片、音频、文本等),供 notebook 与 pipeline 挂载使用;数据落在共享存储 /data/k8s/ 的 dataset 目录下。 商业版另支持:通过 Python SDK 对接数据集(搜索/上传/下载,支持加解密与解压缩)、数据集一键探索。 详见平台知识库《数据集》《SDK使用》。

更新于 2026-07-13
Q不熟悉 Docker / 不会写 Dockerfile,怎么构建自己的镜像?

用平台的在线构建镜像功能:「在线开发 → 镜像构建」,在 docker 记录上点「调试」进入 Web Shell,像在 Linux 上一样用 pip 等命令安装环境,点「保存」后平台自动把容器 commit 成镜像并推送到仓库——全程不写 Dockerfile。 也支持传统方式:镜像管理中填入 Dockerfile 后点「在线构建」。 平台基础镜像刻意只封装 cuda / python 基础环境,上层依赖在任务运行时现场安装(模板保留自定义初始化命令)。 注意:调试容器只用于装环境,不要跑业务代码;调试 Pod 每天 23:30 会被定时任务自动清理,当天记得保存镜像。 详见平台知识库《镜像在线构建和管理》。

更新于 2026-07-13
Q有 Python SDK 吗?怎么用代码对接平台?

有。平台提供 cubestudio Python SDK(随 notebook 等平台镜像内置),可用代码方式自动化操作数据集、任务流、推理服务、notebook 等模块。 用法:init(host, username, token) 初始化全局连接(token 与用户名需匹配,SDK 会向 /users/api/ 验证),之后用 Client 与 Dataset 等类操作。 注意 notebook 中的多内核环境:需先 source activate 对应环境(base / python36~310 / CubeStudio 等,conda info --envs 可查)再 pip 安装依赖,才装到正确的虚拟环境。 详见平台知识库《SDK使用》与二次开发《API参考》系列。

更新于 2026-07-13
Q内部服务是什么?和推理服务有什么区别?

内部服务用于一键部署开发/运维工具类应用:内置 mysql-web、postgresql-web、mongo-web、redis-web、neo4j、rstudio 等开源工具(商业版另支持 ollama / xinference 大模型推理);推理服务则专门承载模型的在线推理(多版本、伸缩、监控)。 端口规则不同:内部服务访问端口 = 30000+2×实例ID,推理服务 = 20000+2×实例ID,均由平台自动生成并转发到容器业务端口。 详见平台知识库《内部服务》《端口使用情况》。

更新于 2026-07-13
QPipeline 怎么配置定时调度?

在任务流设置中配置 crontab 定时表达式即可;支持补录、并发限制、超时、失败重试与实例依赖。 实现机制:平台后台任务 make_timerun_config 每 5 分钟生成一次定时调度配置,使定时任务流按时触发(依赖 Celery beat + worker 正常运行)。 商业版另支持定时调度的最大保留实例数与任务流优先级。详见平台知识库《任务流》《定时任务与自动清理》。

更新于 2026-07-13
Q训练过程和结果怎么可视化(TensorBoard)?

开源版做法:TensorBoard 已集成在深度学习版 jupyter 中——先在左侧文件目录打开训练日志目录,再点击 TensorBoard 图标按钮,即可查看实时/离线训练曲线。 商业版另提供:TensorBoard 作业(独立实时/离线观察)、任务结果可视化(文本/图片/ECharts 格式)、模型指标可视化。 详见平台知识库《任务可视化echart数据格式》。

更新于 2026-07-13
Q怎么使用 HuggingFace / 魔搭上的开源模型做训练?

开源版:在 notebook 或 pipeline 中按模型介绍页说明的微调方式运行你的代码即可(增量训练同理);配置文件类输入(如 datax 的 job.json)不需要打进镜像,放在共享存储中由任务引用路径即可。 商业版:数据同步模板原生支持 HuggingFace / 魔搭的数据集导入与模型导入;AIHub 提供模型一键开发(转 notebook)、一键微调(转 pipeline 链路)与一键部署。 详见平台知识库《任务模板-数据导入导出》《AIHub模型市场》。

更新于 2026-07-13
Q怎么在平台提交 Hive / Spark 大数据任务?

两条路径: 1. Pipeline 定时调度:使用 hadoop 任务模板(商业版)提交 HDFS / Hive / Spark 命令,纳入任务流编排; 2. 交互式分析:使用大数据版本 notebook,配置 Hadoop 与 Spark 集群信息后直接查询大数据平台做 ETL 与数据分析(本地 Jupyter 对接 Hadoop 生态有 Spark / Flink 配置与 Dockerfile 集成专篇,共 5 篇)。 详见平台知识库《本地Jupyter对接Hadoop生态》《任务模板-数据处理》。

更新于 2026-07-13
QSQLLab 交互式数据查询怎么用?支持哪些引擎?

SQLLab 是数据资产模块的交互式 SQL 查询工具:开源版支持 MySQL 计算引擎;商业版支持 PostgreSQL、ClickHouse、Hive、Presto 等。 要对接公司自己的计算引擎,走二次开发(有专篇《SQLLab计算引擎对接》说明扩展方式)。 详见平台知识库《SQLLab》。

更新于 2026-07-13
QAIHub 里的模型怎么部署和调用?

(商业版)流程:导航栏进入 AIHub → 按分类/搜索/标签筛选模型 → 点击「部署Web」→ 等 Pod 状态变 Running(镜像拉取+健康检查约 1-3 分钟)→ 点模型图片进入 Web 界面体验。 部署成功后自动提供 HTTP API 推理接口,支持同步与异步推理(异步基于 Celery 队列)。 资源管理:不再使用的模型点「卸载Web」释放资源;部署失败先检查集群资源是否充足,可释放闲置应用后重试。 详见平台知识库《AIHub模型市场》。

更新于 2026-07-13
QCubeStudio 内置了哪些任务模板(算子)?

任务模板(算子)是 pipeline 中可拖拽编排的最小执行单元(每个是独立镜像+入口脚本,经 init-job-template.json 注册),按家族分为: - 数据导入导出:datax 异构数据同步、dataset / model-download(支持 HuggingFace / 魔搭下载)、label-studio-import(导出标注数据为 JSON/COCO/YOLO); - 数据处理:data-process(CSV 去重/填充/降维/异常检测)、hadoop / spark / ray / volcano 分布式、nlp-process(文本清洗/脱敏/质量过滤/Markdown转QA)、feature-process 特征工程; - 机器学习:sklearn 全家族(adaboost / arima / 决策树 / gbdt / kmeans / knn / lightgbm / lr / 随机森林 / xgb 等)、ray-sklearn 分布式; - 深度学习:tfjob、pytorchjob、deep-learning-framework 多框架分布式; - 大模型:llama-factory 等 7 类(见大模型工具链条目); - 另有模型服务化、多媒体 CV/语音、超参搜索家族。 详见平台知识库《任务模板/算子总览》与 05-任务模板目录。

更新于 2026-07-13
Q除了训练和推理,大模型还有哪些配套工具(评测/量化/蒸馏/剪枝)?

大模型任务模板家族提供全套工程化工具,均以 pipeline 算子形式编排使用: - llama-factory:大模型训练 / SFT / PPO / reward / eval; - llm-benchmark:推理性能压测; - llm-distillation:知识蒸馏; - llm-prune:基于 LLM-Pruner 的模型剪枝; - llm-quantization:模型量化; - llm-safety-eval:安全性 / 越狱评估; - opencompass:基于 OpenCompass 的大模型评测。 详见平台知识库《任务模板-大模型》。

更新于 2026-07-13
QNotebook 里能用 Claude Code 这类 AI 编程助手吗?

能。平台官方 Notebook / Theia 镜像已内置 Claude Code 原生二进制与 claude-wrapper.sh 包装脚本:首次启动时引导配置私有大模型端点,可接入任何 Anthropic 兼容协议(/v1/messages)的模型(如 DeepSeek、Qwen),通过 ANTHROPIC_BASE_URL / ANTHROPIC_AUTH_TOKEN 与默认模型环境变量完成配置。 自定义镜像可按文档的 Dockerfile 配方自行安装(含 sha256 校验和验证与多架构支持)。 详见平台知识库《notebook部署ClaudeCode》。

更新于 2026-07-13
Q大模型服务网关(Token 中转站)是什么?怎么配认证和限流?

大模型服务网关用于把多个 OpenAI 兼容接口统一代理,对外暴露 OpenAI 兼容接口(/llm/api/<网关id>/v1/chat/completions),在代理层实现认证、限流、输入输出修正与监控: - 认证方式:不认证 / 秘钥完全匹配 / 正则匹配 / JWT(HS256); - 秘钥位置:可从 header / 请求体 / URL 参数读取(默认 header:Authorization); - 管控项:网关过期时间、token 总额度 quota(默认不限,设限时最小 10000)、限流限速、白名单/黑名单、提示词模板改写、参数值映射与固定、联网搜索与内容安全。 详见平台知识库《服务网关》。

更新于 2026-07-13
Q平台的数据地图(库表 / 维表 / 指标)是做什么的?

数据地图是数据资产模块的元数据管理层,包含三类:库表(元数据库表管理)、维表、指标,配合 SQLLab 交互查询与数据 ETL 编排,构成对接公司数据中台的元数据部分(其余拼图:计算引擎、调度引擎、血缘链路)。 详见平台知识库《库表》《维表》《指标》。

更新于 2026-07-13
Q任务和 Notebook 的数据放在哪里?怎么共享和挂载存储?

平台约定分布式存储统一挂载在每台机器的 /data/k8s/ 目录下:pipeline 工作目录、数据集(dataset)、用户工作空间等均落在其中;notebook / pipeline / 推理服务的 Pod 挂载对应子目录,上游任务写入、下游按约定路径读取即可共享数据(这也是开源版任务间传数据的标准做法)。 商业版支持 Web 界面添加存储盘并绑定项目组,可在 Pod 中直接挂载 NFS / CFS / OSS / NAS / COS / GlusterFS / CephFS / S3(MinIO) 等外部分布式存储。 详见平台知识库《分布式存储目录》《存储资源配置》。

更新于 2026-07-13
QCubeStudio 有 REST API 吗?怎么认证?

有。后端提供标准化 REST 接口:标准 CRUD(增删改查、操作、图表、收藏)、文件上传下载、菜单与导航、数据集预览、通用血缘链路等,并提供 Python 客户端示例。 认证方式:以用户 token 作为 Authorization 请求头(SDK 初始化时会向 /users/api/ 验证 token 与用户名匹配)。 完整参考见平台知识库二次开发《API参考》系列:标准化接口(6 篇)、标准化接口参数详情(9 篇)、特殊接口详情(9 篇)、接口总览。

更新于 2026-07-13
Q怎么开发自己的 AIHub 算法应用?

(商业版)AIHub 提供模型应用管理方案:基于 cube-studio SDK 按模型开发规范封装自己的模型(加载与推理逻辑),注册后以卡片形式在 AIHub 模型市场展示,支持一键部署 Web/API(同步/异步推理)、一键转 notebook 开发与一键转 pipeline 微调。 配套提供多个 Python CUDA 版本的基础镜像与数据集/notebook/pipeline/推理服务四类 SDK。 详见平台知识库《AIHub算法应用开发》《SDK使用》。

更新于 2026-07-13

故障排查16 个问题

502 / 301、登录失败、任务 Pending、镜像拉取失败、GPU 调用失败、服务访问不了。

Q访问 CubeStudio 页面出现 502 Bad Gateway 怎么办?

要点:CubeStudio 只有前端镜像内使用 nginx,看到 nginx 的 502 报错页说明前端已通、后端 Pod 异常。 排查步骤: 1. kubectl get pods 查看 infra 命名空间下后端(kubeflow-dashboard)Pod 是否 Running; 2. 查看后端日志定位启动报错(常见:数据库连不上、配置文件错误); 3. 如果报错的 nginx 版本不是前端镜像里的,说明是你自己额外加的 nginx 代理导致,检查其 upstream 配置。 数据库连不上且伴随域名无法解析时,多为机器防火墙问题,见「数据库/DNS 解析失败」条目。

更新于 2026-07-13
Q访问平台返回 301 重定向是什么问题?

301 是重定向,一般是用户没有登录,被重定向到登录地址,属正常行为,登录即可。 另注意:平台是 http 协议(开源版),如果之前访问过同一 IP 的 https 服务(如 rancher 界面),浏览器会记住协议自动跳 https 导致打不开,需手动输入 http://ip 访问。

更新于 2026-07-13
Q登录失败或登录后报 Internal Server Error 怎么办?

依次尝试: 1. 点右上角退出按钮,重新进入登录界面再登录; 2. 默认账号密码 admin/admin;系统默认自动注册新用户,可注册新账号验证是否个别账号问题; 3. 忘记密码联系管理员修改或进数据库改; 4. 仍失败则查看后端 Pod 日志(数据库连接、session 配置)。 注意:登录验证无法去除——大量界面需要验证用户后才能获取数据,去掉验证这些界面将无法访问。

更新于 2026-07-13
Q部署后报数据库连不上 / service 域名无法解析(coredns 异常)?

典型原因是机器防火墙拦截了集群内通信。放开防火墙: iptables -P FORWARD ACCEPT;iptables -P INPUT ACCEPT;iptables -P OUTPUT ACCEPT 注意:部分公司网络策略会定时自动恢复防火墙规则,建议把上述放开命令设为定时任务。 另一个常见坑:K8s 集群网络 IP 段与主机内网 IP 段重叠会导致节点互通异常,需修改集群的 cluster-cidr / service-cidr 配置。

更新于 2026-07-13
Q提交的训练任务一直处于 Pending 状态?

排查步骤: 1. kubectl describe pod <name> 查看 Events; 2. 常见原因:算力不足(GPU/NPU 无可用资源)、节点标签不匹配(任务类型需要 train=true、卡型需要 gpu-type 标签,且卡型标签必须大写)、org 项目组标签不匹配(默认 org=public)、PVC 未绑定、镜像拉取中; 3. 检查资源配额:普通用户单任务上限默认 CPU 50 核 / 内存 100G / GPU 8 卡,超出需管理员配置。 解决:补充算力、修正节点标签或调低任务资源声明。

更新于 2026-07-13
Q镜像拉取失败(ImagePullBackOff)怎么处理?

按优先级排查五个常见原因: 1. 镜像名/标签写错,或镜像在仓库中不存在; 2. 镜像未设为 public 且没配拉取账号密码(imagePullSecret); 3. docker hub 限频——rancher 等官方镜像拉取失败多为此因,先 docker login 再多试几次; 4. 架构不匹配——ARM 机器拉到 x86 镜像会报 exec format error,需用 arm64 镜像; 5. 内网环境镜像未预先导入——先在主机上把镜像拉好,或导入内网 Harbor 并配好凭证,同时把 IMAGE_PULL_POLICY 改为 IfNotPresent。

更新于 2026-07-13
QNotebook 打不开 / 显示 unknown / 提示 no healthy upstream?

按状态分别处理: - unknown:说明 notebook 没有运行,点击记录后面的 reset 按钮重启; - no healthy upstream:Pod 未就绪,管理员可从状态按钮进入 K8s dashboard 查看 Pod 镜像拉取与运行状态; - reset 后 404:多出现在多域名或域名与 IP 混用场景,建议只用一个入口,并在 config 文件中配置好域名; - notebook 调不了 GPU:只有 GPU 版本的 jupyter 镜像能调用 GPU,换用 gpu 版镜像。

更新于 2026-07-13
Q推理服务 / 内部服务部署后访问不了怎么排查?

按此顺序排查四个原因: 1. Pod 没有正常启动(先看 Pod 状态与日志); 2. 端口配置错误——服务配置里填的是业务代码监听端口,客户端访问端口由平台自动生成转发,两者不要混淆,且不要把业务端口改成 80(与平台入口冲突); 3. IP/端口被网络限制(云上安全组、内网防火墙); 4. 域名和 IP 混用——内外网环境需在项目分组的「服务代理」配置「内网ip|外网ip」,再清理服务重新部署。 详见平台知识库《端口使用情况》《内部服务》。

更新于 2026-07-13
Q80 端口被占用,平台入口能换端口吗?

可以。把 istio-system 命名空间下 istio-ingressgateway 服务的类型改为 NodePort 模式,即可用其他端口访问平台。 注意 NodePort 模式下曾出现服务 ExternalIP 指到 master IP 导致端口冲突的案例,配置后留意端口占用。商业版另支持反向代理与内网穿透方式访问。

更新于 2026-07-13
Q没有运行任务但机器 CPU 居高不下,怎么定位?

三步定位: 1. 进入 K8s dashboard 的主机界面,查看该主机上跑了哪些 Pod; 2. 在 Prometheus/Grafana 中查看所有 Pod 的 CPU/内存/GPU 占用排行; 3. 如果不是 Pod 占用,登录机器用系统命令查看进程。 另注意 pipeline 实例运行结束后容器约 3 小时后才清理,短时间内看到残留容器属正常。

更新于 2026-07-13
QRancher 部署卡住或 Web 界面打不开怎么办?

绝大多数是资源不足或镜像未预拉: 1. 准备至少 16 核的机器,并提前拉取好镜像——「Waiting to register with Kubernetes」「cluster agent is not ready」「etcd-fix-perm 后卡住」都属此类; 2. 部署失败用 reset_docker 脚本重置 docker 并重启机器后重新部署; 3. rancher server 是第一个启动的容器,刚部署完需等待片刻,浏览器打开时要跳过 https 证书提示; 4. 机器或 docker 重启后 rancher 打不开是已知 bug,需按文档配置 rancher 单机高可用。 版本参考:老版本组合 rancher 2.6.2 + K8s 1.21 最稳。详见平台知识库《rancher-RKE部署》系列。

更新于 2026-07-13
Q执行 start.sh 部署平台报错怎么办?

分三类处理: 1. 报「删除对象不存在」:可忽略(首次部署没有旧对象可删); 2. 报「api server 服务不可达」:检查 kubeconfig 文件是否正常、kubectl 是否能正常下载; 3. 组件缺失 / connection refused:start.sh 支持重复执行,提前拉好镜像后多跑几次即可补齐。 注意:脚本开头会把 kubeconfig 目录创建为 configmap,该目录必须存在(内容可为空),否则报「找不到 kubernetes-config」。 start.sh 的执行顺序:拉镜像与基础软件 → 安装云原生基础组件 → 配置 istio ingressgateway 代理。

更新于 2026-07-13
Q构建前端 / 基础镜像失败怎么办?

多为网络问题: - 基础环境镜像(Dockerfile-base)构建失败:配置国内 apt / 软件源后多构建几次,或直接基于官方 base 镜像再构建自己的环境层; - 前端(vision)构建失败:添加国内 node 源后重试; - 镜像太大传不上 docker hub:自建内网 Harbor 私有仓库,或精简镜像层。

更新于 2026-07-13
QK8s 集群里 PVC 删不掉怎么办?

PVC 删不掉一般是因为还有 Pod 挂载着它:先用 kubectl describe pvc 或按命名空间检索找到挂载该 PVC 的 Pod,删除 Pod 后 PVC 即可正常删除。 同理,存储目录报「no such file or directory」(如 /data/k8s/kubeflow/pipeline/workspace)时,先确保主机目录存在,且 kubelet 容器内也能看到该目录。

更新于 2026-07-13
Q服务器 IP 变了 / 内外网双网卡环境怎么处理?

IP 更换:部署了 rancher server 的机器换 IP,需按文档「部署 rancher」章节更换 master 服务器。 双网卡(内外网)环境三原则: 1. 部署时统一使用内网 IP,浏览器访问使用外网 IP; 2. 云上安全组放开对应端口; 3. 先保证所有 Pod 正常 Running,再排查外网访问问题。 项目配置的 expand 字段配一个内网 IP 即可,有公网 IP 或域名时才配置公网地址。

更新于 2026-07-13
Q服务器重启后大量 Pod 异常、apiserver 报 token is not valid yet?

这是典型的集群时间回拨故障。常见诱因:双系统(Windows+Linux)或 BIOS 用本地时间存 RTC,Linux 默认按 UTC 读取,开机时系统时间快 8 小时;Docker/K8s 在错误时间下启动,NTP 修正后 token 变成「未来签发」被 apiserver 拒绝认证。 典型现象:docker ps 显示控制面容器「Up Less than a second」反复重启。 根治(执行一次即可):timedatectl set-local-rtc 1,告诉 Linux 硬件时钟存的是本地时间。 恢复步骤:用 RKE kubeconfig 确认集群状态 → 备份 k8s_ 容器列表 → 停 kubelet → 清理 k8s_ 容器 → 启 kubelet。 详见平台知识库《故障恢复-集群时间回拨》。

更新于 2026-07-13

运维与生态18 个问题

配置文件、镜像拉取策略、SSO、HTTPS、监控告警、版本升级、资源配额、多租户。

QCubeStudio 的配置文件在哪里?改了怎么生效?

两处配置文件:本地开发用 install/docker/config.py;线上(K8s 部署)用 install/kubernetes/cube/overlays/config/config.py。 线上生效方式:配置以 configmap 形式挂载——直接修改 infra 命名空间下的 kubeflow-dashboard-config 这个 configmap,然后重启后端 Pod 即可生效。 常用配置项:IMAGE_PULL_POLICY(镜像拉取策略)、COOKIE_DOMAIN(嵌入其他平台时的 cookie 作用域)、NOTEBOOK_IMAGES(notebook 镜像列表)、GPU_RESOURCE(算力卡资源名映射)。 详见平台知识库《配置文件管理》《配置项速查》。

更新于 2026-07-13
Q内网环境如何避免容器每次启动都重新拉取镜像?

修改配置文件中的 IMAGE_PULL_POLICY 参数:默认 Always(每次调度都拉取),内网/隔离环境改为 IfNotPresent(本地有镜像就不拉)。 配套动作:把所需镜像预先导入内网机器(最好配一套内网 Harbor 镜像仓库),修改后更新 configmap 并重启后端使配置生效。 详见平台知识库《私有镜像仓库Harbor》《配置文件管理》。

更新于 2026-07-13
QCubeStudio 如何对接企业 LDAP / SSO 单点登录?

平台支持 AUTH_OID(OpenID)/ AUTH_LDAP / AUTH_REMOTE_USER 等登录注册方式;对接公司账号体系为商业版能力(开源版为账号密码注册自动登录)。 对接后用户使用企业账号登录,并按 RBAC 角色分配平台权限;商业版另支持消息推送(企业微信/钉钉/飞书)、登录验证、强密码、登录频率限制等安全增强。 详见平台知识库《认证与单点登录配置》《登录认证与消息推送扩展》。

更新于 2026-07-13
Q平台支持 HTTPS 访问吗?

开源版仅支持 http 协议(代码层有限制,外加 https 反代会出现 login 跳转回 http 的问题);HTTPS 为商业版能力。 有 HTTPS 合规要求的环境:采用商业版方案,或参考知识库《平台HTTPS配置》评估自行改造成本。 相关坑:浏览器会记住同 IP 的 https 协议(如 rancher),导致平台打不开时需手动输入 http:// 前缀。

更新于 2026-07-13
Q如何对 CubeStudio 做监控与告警?

平台内置 Prometheus + Grafana + Prometheus Operator 监控体系(monitoring 命名空间):覆盖所有机器的 GPU/CPU/内存/网络 IO/磁盘 IO、所有 Pod 的资源负载、推理服务的 QPS 与吞吐。 自定义指标可通过 pushgateway 推送;告警经 Alertmanager 配置阈值规则。商业版另支持 IB 流量监控、vGPU/NPU 监控与企业微信/钉钉/飞书群消息推送。 Grafana 打不开先查 monitoring 命名空间 Pod 状态与 http 协议;指标异常则进 Prometheus 手动查询确认采集是否正常。 详见平台知识库《监控体系》系列(6 篇)与《监控部署与看板》。

更新于 2026-07-13
QCubeStudio 如何升级版本?如何回滚?

官方升级方式:每个版本发布可能涉及架构变更,统一做法是把原平台的元数据库导出,在新数据库的基础上部署新版本平台(而非原地覆盖),验证后切换。 建议:使用最新 release 版本(比 master 分支更稳);升级前完整备份元数据库;先在测试环境演练。 回滚:保留旧版本数据库备份与镜像即可随时回退。详见平台知识库《版本升级》。

更新于 2026-07-13
Q平台如何限制用户的资源使用量?

开源版内置任务级上限:普通用户单任务最高可配置 CPU 50 核、内存 100G、GPU 8 卡(config.py 的 MAX_TASK_CPU / MAX_TASK_MEM / MAX_TASK_GPU),更高配置只有管理员可设置。 商业版提供完整计量计费体系:项目组/租户/任务/个人多级资源限制(覆盖 notebook、构建、pipeline、超参搜索、内部服务、推理服务),统一资源监控分析,自定义计费模式与日结账单。 详见平台知识库《计量计费》《机器资源配置》。

更新于 2026-07-13
QCubeStudio 支持多租户和权限管理吗?

支持。平台通过「项目组」划分:任务/服务的挂载、资源组、集群、服务代理均按项目组配置,配合 RBAC 权限体系与项目组内角色实现多租户隔离;机器按 org=xx 标签划分给不同项目组(默认 org=public)。 商业版另支持菜单级权限控制与操作历史记录。 注意:KubeSphere / Rancher 等容器平台的账号体系与 CubeStudio 相互独立,互不打通。 详见平台知识库《项目空间》《用户和角色》《多租户隔离》。

更新于 2026-07-13
QCubeStudio 支持高可用部署与备份恢复吗?

支持。高可用:生产建议控制端 32 核 64G × 2 台起,K8s 层的节点扩缩容与高可用有专篇文档(kubekey 部署系列);核心组件多副本 + K8s 自愈。 备份恢复:重点备份两块——元数据库(MySQL/PostgreSQL/达梦)与分布式存储目录(/data/k8s/);升级前必须先备份元数据库。 特殊故障:集群时间回拨等场景的恢复有专篇《故障恢复-集群时间回拨》。 详见平台知识库《节点扩缩容与高可用》《运维注意事项》。

更新于 2026-07-13
Q想基于 CubeStudio 做二次开发,从哪里入手?

知识库的「二次开发」目录提供成套资料: - 代码结构与模块地图、FAB 后端开发框架说明; - API 参考:标准化 CRUD 接口、各模块接口参数详情、Python 客户端示例; - 数据库结构:8 篇分模块表结构文档; - 常见二开点:更换 Logo 与水印、新增视图页面与数据库升级、登录认证与消息推送扩展、自定义 Notebook 镜像、SQLLab 计算引擎对接、数据 ETL 调度引擎对接。 MIT 协议允许自由二开与商用;也可采购商业版获得源码交付与二开咨询服务。详见平台知识库《二次开发》目录与《参考速查》。

更新于 2026-07-13
Q平台各功能占用哪些端口?环境只能开有限端口怎么办?

端口规则(可在 config.py 的 NOTEBOOK_PORT / INFERENCE_PORT / SERVICE_PORT 中修改): - 443:rancher 管理端口(https);80:平台前后端入口;8080:服务代理端口; - notebook SSH:10000+2×实例ID;推理服务:20000+2×实例ID;内部服务:30000+2×实例ID; - 端口黑名单 BLACK_PORT 默认含 10250(kubelet),分配时自动跳过。 只能开有限端口时的收敛方案:notebook SSH 用 ssh 隧道做单端口代理;推理服务与内部服务用(泛)域名代理。 详见平台知识库《端口使用情况》。

更新于 2026-07-13
Q为什么调试 Pod / 旧数据半夜被自动清理了?

这是平台 Celery beat 定时任务的正常行为,不是故障。默认启用的清理任务: - 镜像调试 debug pod:每天 23:30 清理(当天记得保存镜像); - 旧 Argo workflow 记录:每小时清理;数据库旧数据:每天 01:01; - 卡在 terminating 的 Pod:每 30 分钟处理;每日账单:03:10 生成; - pipeline 实例运行结束后约 3 小时清理容器;低负载 Pod 每天 11:10 推送提醒。 默认禁用可按需开启:每天 04:01 定时停止 notebook、GPU 使用推送、多项目组节点资源均衡等(在 config.py 的 beat_schedule 取消注释)。 详见平台知识库《定时任务与自动清理》。

更新于 2026-07-13
Q公司已有 istio / Prometheus / MySQL,平台能直接复用吗?

可以,逐项处理: - istio:平台默认部署 istio 1.15.0 做统一入口(代理 web/notebook/pipeline/服务,需暴露 80、8080),已有 istio 时在 start.sh 中注释掉「部署istio」段; - Prometheus:可基于已有 prometheus-operator 创建平台所需实例;node-exporter 无法重复部署,修改 node-exporter-sm.yml 的 namespaceSelector 指向已有部署的命名空间; - 元数据库:MYSQL_SERVICE / POSTGRESQL_SERVICE / DM_SERVICE 环境变量指向自有数据库;Redis 有哨兵部署专篇。 详见平台知识库《替换基础组件》《元数据库配置》《Redis哨兵部署》。

更新于 2026-07-13
Q可以把平台换成自己公司的 Logo 和品牌吗(白标/OEM)?

可以,MIT 协议允许品牌定制。步骤: 1. 替换 dev/common/ 下的 logo.ico、logo.png、logo.svg; 2. 编辑 dev/common/build.sh,改成自己的目标镜像名、网页标题与水印文案; 3. 项目根目录执行 sh dev/common/build.sh,自动替换素材并构建推送前端镜像(buildx 多架构); 4. 把 infra 命名空间下 kubeflow-dashboard-frontend deployment 的镜像改为新镜像,Pod 自动重启后强刷浏览器生效。 商业版另支持:采购前免费换 Logo 做演示;授权后可贴牌加工成自己的产品对外出售。详见平台知识库《更换Logo与水印》。

更新于 2026-07-13
Q怎么把 CubeStudio 嵌入公司门户并共享登录态?

两个层面: 1. Cookie 共享:在 config.py 配置 COOKIE_DOMAIN 为要共享给其他平台的域名后缀,实现跨子域登录态共享(嵌入其他云平台的典型做法); 2. 账号打通:对接公司账号体系走 AUTH_OID / AUTH_LDAP / AUTH_REMOTE_USER(商业版),二开层面另有《登录认证与消息推送扩展》专篇。 详见平台知识库《配置文件管理》。

更新于 2026-07-13
Q内网 Harbor 私有镜像仓库怎么搭建?

文档提供三种安装方式,安装文件在仓库 install/kubernetes/harbor/: 1. docker + http 离线安装:有 docker/docker-compose 环境时最常用,仓库走 http; 2. nerdctl 离线安装:containerd 环境(无 docker)用 nerdctl 替代; 3. https 安装:自签证书走 https,含开机自启配置。 amd64 / arm64 均有对应离线安装包。 安全注意:Harbor 安装后 admin 默认密码为 Harbor12345,正式使用前务必在 harbor.yml 中修改 harbor_admin_password。 详见平台知识库《私有镜像仓库Harbor》。

更新于 2026-07-13
Q私有化交付前需要做哪些安全加固?

文档提供交付加固清单(商业化/内网交付前逐项收尾): 1. 用加密后的代码构建业务镜像,容器内读不到明文源码; 2. 对关键镜像(labelstudio / jupyter / vscode 及 encryption 后缀镜像)做 containerd 镜像存储加密(imgcrypt / ocicrypt,ctr-enc 工具); 3. 收紧通道与权限:不配置外网仓库账号密码、仅下发有限权限 token、去除 cluster 级 K8s dashboard; 4. 清理收尾:docker logout 官方镜像仓库、清空 shell 历史(history -c)、删除 kubeconfig 与本机源码。 详见平台知识库《加密与安全加固》。

更新于 2026-07-13
Q管理员怎么规划机器标签调度体系?

机器全部通过 K8s label 调度(由平台控制,用户不直接控制),分两层规划: - 业务机器:按算力类型 cpu=true / gpu=true / vgpu=true;按用途 train=true / notebook=true / service=true;按项目组 org=xx(默认 org=public);按卡型 gpu-type=V100(值必须大写); - 控制面机器:mysql=true、redis=true、kubeflow-dashboard=true(平台服务)、kubeflow=true、istio=true、monitoring=true、logging=true,各对应一类控制组件,可按需拆分到不同机器。 默认调度选择器:notebook 为 cpu=true,notebook=true;pipeline 任务为 cpu=true,train=true,org=public。 详见平台知识库《管理员操作指南》《多机多集群多资源组》。

更新于 2026-07-13