跳到主要内容

训练日志与排错

这个功能解决什么问题

训练出错时,光看一个「失败」状态徽章是定位不了问题的。你需要看到完整的训练过程输出——参数配置、每轮指标、以及最后的错误堆栈。训练日志就是这部分信息的事实来源。

本页介绍如何查看和下载训练日志,并给出常见训练问题的排查思路。

查看训练日志

训练日志以终端样式的弹窗展示,绿色等宽字体、支持滚动。训练进行中时会自动刷新,你也可以随时手动刷新或下载完整日志。

  1. 打开日志弹窗

    在训练监控页(项目工作区训练菜单或全局训练总览)的任务行里,点击「查看日志」按钮,打开「训练日志」弹窗。

  2. 浏览日志内容

    弹窗采用终端样式(绿色等宽字体),自动滚动到最新位置。正在加载时会显示「正在加载日志...」,没有日志时显示「暂无日志」。

  3. 等待自动刷新

    训练进行中时,日志弹窗每 5 秒自动拉取一次最新内容,无需手动操作。

  4. 手动刷新

    如果不想等待,可以点击「刷新日志」按钮立即拉取最新内容(刷新中按钮会显示「刷新中...」)。

  5. 下载日志

    点击「下载日志」按钮,可以把完整日志保存为文本文件,文件名格式为 training_logs_任务ID.txt,方便归档或转发给技术支持。

训练日志弹窗
图1:训练日志弹窗,终端样式,支持刷新和下载

日志操作

字段类型必填默认值说明
查看日志操作可选训练中、已完成、失败、已停止等打开终端样式日志弹窗;训练进行中时每 5 秒自动刷新
刷新日志操作可选手动拉取最新日志内容
下载日志操作可选保存完整日志为文本文件,文件名格式:training_logs_任务ID.txt

常见问题与排查

GPU 不识别

如果在创建训练任务时,设备类型下拉框里 GPU 显示为「GPU(不可用)」,说明 GPU 环境未就绪,请按顺序排查:

  • 显卡驱动是否正常安装,nvidia-smi 命令能否正常输出。
  • CUDA、PyTorch、Python 版本是否匹配,推荐组合是 CUDA 12.6 + Python 3.12。
  • Docker 部署时是否安装了 NVIDIA Container Toolkit,否则容器内无法访问宿主机 GPU。
  • 同理,昇腾 NPU 不可用时下拉框会显示「华为昇腾NPU(不可用)」,需确认相关驱动和运行时已就绪。
显存不足(OOM)

这是最常见的训练失败原因,日志里通常会出现 CUDA out of memory 类错误。显存占用大致与批次大小成正比、与图像尺寸的平方成正比,优先按以下顺序调整:

  • 减小批次大小(batch size),例如从 16 改到 8 或 4。
  • 减小图像尺寸(image size),例如从 640 改到 512 或 416。
  • 减少 GPU 卡数,排除多卡通信或显存分配异常。 调整后重新创建训练任务即可。
训练失败

训练进入「失败」状态时,详情面板和日志弹窗会显示错误信息。常见原因:

  • 数据集格式错误:标签文件不符合当前任务类型要求(检测、分割、旋转框、关键点的标签格式各不相同,不能混用)。
  • 类别不匹配:标签里的类别编号与数据集 classes.txt 对不上。
  • 权重下载失败:网络问题导致预训练权重下载中断,可重试或检查网络。 根据日志中的具体错误堆栈定位后,修正数据或环境再重新训练。
从断点恢复训练

训练失败或被停止后,可以对处于「失败」或「已停止」状态的任务点「继续训练」,从上次保存的断点恢复,而不必从头开始。系统会检测训练输出目录里是否存在可恢复的训练产物:

  • 如果存在,则从断点继续训练,已完成的轮数不会重跑。
  • 如果没有可恢复的产物(例如输出目录为空、任务从未成功启动过),系统会提示原因,此时请重新创建训练任务并先成功启动一次。
善用日志下载

遇到难以定位的问题时,把训练日志下载下来发给技术支持,可以显著加快排查速度。日志文件包含完整的训练过程输出:参数配置、每轮的指标、以及出错时的完整堆栈。配合「训练指标解读」里的指标含义一起看,往往能快速锁定问题方向。