训练日志与排错
这个功能解决什么问题
训练出错时,光看一个「失败」状态徽章是定位不了问题的。你需要看到完整的训练过程输出——参数配置、每轮指标、以及最后的错误堆栈。训练日志就是这部分信息的事实来源。
本页介绍如何查看和下载训练日志,并给出常见训练问题的排查思路。
查看训练日志
训练日志以终端样式的弹窗展示,绿色等宽字体、支持滚动。训练进行中时会自动刷新,你也可以随时手动刷新或下载完整日志。
打开日志弹窗
在训练监控页(项目工作区训练菜单或全局训练总览)的任务行里,点击「查看日志」按钮,打开「训练日志」弹窗。
浏览日志内容
弹窗采用终端样式(绿色等宽字体),自动滚动到最新位置。正在加载时会显示「正在加载日志...」,没有日志时显示「暂无日志」。
等待自动刷新
训练进行中时,日志弹窗每 5 秒自动拉取一次最新内容,无需手动操作。
手动刷新
如果不想等待,可以点击「刷新日志」按钮立即拉取最新内容(刷新中按钮会显示「刷新中...」)。
下载日志
点击「下载日志」按钮,可以把完整日志保存为文本文件,文件名格式为
training_logs_任务ID.txt,方便归档或转发给技术支持。

日志操作
| 字段 | 类型 | 必填 | 默认值 | 说明 |
|---|---|---|---|---|
查看日志 | 操作 | 可选 | 训练中、已完成、失败、已停止等 | 打开终端样式日志弹窗;训练进行中时每 5 秒自动刷新 |
刷新日志 | 操作 | 可选 | — | 手动拉取最新日志内容 |
下载日志 | 操作 | 可选 | — | 保存完整日志为文本文件,文件名格式:training_logs_任务ID.txt |
常见问题与排查
如果在创建训练任务时,设备类型下拉框里 GPU 显示为「GPU(不可用)」,说明 GPU 环境未就绪,请按顺序排查:
- 显卡驱动是否正常安装,
nvidia-smi命令能否正常输出。 - CUDA、PyTorch、Python 版本是否匹配,推荐组合是 CUDA 12.6 + Python 3.12。
- Docker 部署时是否安装了 NVIDIA Container Toolkit,否则容器内无法访问宿主机 GPU。
- 同理,昇腾 NPU 不可用时下拉框会显示「华为昇腾NPU(不可用)」,需确认相关驱动和运行时已就绪。
这是最常见的训练失败原因,日志里通常会出现 CUDA out of memory 类错误。显存占用大致与批次大小成正比、与图像尺寸的平方成正比,优先按以下顺序调整:
- 减小批次大小(batch size),例如从 16 改到 8 或 4。
- 减小图像尺寸(image size),例如从 640 改到 512 或 416。
- 减少 GPU 卡数,排除多卡通信或显存分配异常。 调整后重新创建训练任务即可。
训练进入「失败」状态时,详情面板和日志弹窗会显示错误信息。常见原因:
- 数据集格式错误:标签文件不符合当前任务类型要求(检测、分割、旋转框、关键点的标签格式各不相同,不能混用)。
- 类别不匹配:标签里的类别编号与数据集
classes.txt对不上。 - 权重下载失败:网络问题导致预训练权重下载中断,可重试或检查网络。 根据日志中的具体错误堆栈定位后,修正数据或环境再重新训练。
训练失败或被停止后,可以对处于「失败」或「已停止」状态的任务点「继续训练」,从上次保存的断点恢复,而不必从头开始。系统会检测训练输出目录里是否存在可恢复的训练产物:
- 如果存在,则从断点继续训练,已完成的轮数不会重跑。
- 如果没有可恢复的产物(例如输出目录为空、任务从未成功启动过),系统会提示原因,此时请重新创建训练任务并先成功启动一次。
遇到难以定位的问题时,把训练日志下载下来发给技术支持,可以显著加快排查速度。日志文件包含完整的训练过程输出:参数配置、每轮的指标、以及出错时的完整堆栈。配合「训练指标解读」里的指标含义一起看,往往能快速锁定问题方向。