在微调Qwen3-Omni-30B-A3B-Instruct模型时,我们原计划用12小时GPU预算跑完1624步训练;但在第1000步时预算耗尽,训练被迫中断。当时损失仍在下降,完整的检查点、优化器状态和调度器都已安全保存在私有云存储中,所以重启没有技术障碍。真正的变化来自完成训练本身。 重启并跑完全程后,60探针文本知识评估的成绩提升了5个百分点(在相同堆栈上重复测试,结果差异为0个百分点);广播音频评测得分也几乎翻倍。两个指标指向同一结论:把训练计划执行到第162

打开网易新闻 查看精彩图片