跳到主要内容

NPU 训练配置

这个功能解决什么问题

部分企业用华为昇腾硬件做国产算力替代,没法直接用 NVIDIA GPU。VortLab 支持把训练任务跑在华为昇腾 NPU 上,配置比 GPU 更简单:选好设备,按需设个内存上限就能开训。本页讲怎么选 NPU、怎么设内存限制,以及什么时候该选 NPU。

前置条件

昇腾 NPU 环境要求

NPU 训练仅在 Linux 环境下可用,且需要:

  • 已安装华为昇腾驱动和 CANN 软件包
  • 已安装 torch_npu 和 ACL 相关依赖
  • 如果设备类型下拉里「华为昇腾NPU」显示「华为昇腾NPU(不可用)」并且选不了,说明上面的环境没就绪

驱动、CANN、torch_npu 的安装属于部署范畴,不在本文范围内。

设备选择

在训练创建对话框的「硬件配置」区,先选设备类型:

字段类型必填默认值说明
deviceType下拉必填cpu训练硬件。选择「华为昇腾 NPU」来启用 NPU 训练。当前环境没有可用昇腾设备时,该选项会显示「华为昇腾NPU(不可用)」并被禁用。
NPU 设备选择
图1:设备类型下拉选择华为昇腾 NPU

NPU 配置选项

选了「华为昇腾 NPU」之后,下方只多出一个配置项:

字段类型必填默认值说明
memoryLimit数字可选4096NPU 内存限制(MB)。默认 4096。

操作步骤

  1. 打开训练创建对话框

    在项目工作区点左侧「训练」,再点右上角「训练新模型」,弹出训练创建对话框。找到「硬件配置」区。

  2. 选择华为昇腾 NPU

    把「设备类型」下拉选成「华为昇腾 NPU」。如果该选项带「(不可用)」并且选不了,说明当前环境没有可用昇腾设备,请先按前置条件检查环境。

  3. (可选)设置 NPU 内存限制

    下方会出现「NPU 内存限制 (MB)」输入框,默认 4096。需要的话调整这个数值,单位是 MB。不确定就用默认值。

  4. 点击开始训练

    配置完成后点底部的「开始训练」,任务进入等待队列。

适用场景

昇腾 NPU 适合什么时候用
  • 适合有华为昇腾硬件的企业环境,或国产化算力替代场景
  • 训练速度通常优于 CPU,但具体性能取决于 NPU 型号
  • 支持 YOLO 系列模型的训练(检测、分割、旋转框、姿态等任务类型)
  • 如果同一台机器上既有 GPU 又有 NPU,优先用 GPU

版本匹配

版本必须匹配

昇腾这套环境对版本一致性要求很高:

  • 昇腾驱动、CANN、torch_npu、Python 版本必须互相匹配
  • 版本不匹配会导致训练失败,或者性能明显下降
  • 安装和升级时请参考华为官方文档确认版本兼容性,不要混装不同大版本的组件

这是 NPU 环境最常见的坑,出问题先查版本对不对得上。

NPU 还是 GPU

NPU 与 GPU 怎么选

如果同时有 GPU 和 NPU 可选,优先用 GPU。NVIDIA 的 CUDA 生态更成熟,PyTorch 支持更完整,性能通常也更好,遇到问题排查资料也多。

NPU 更适合这两种情况:有国产化或信创合规要求,或者手头已经有昇腾硬件、不想额外采购 GPU。