一篇针对大量公开后训练轨迹的新论文揭示了一个尴尬现实:智能体在自我训练的第一步就锁定了策略,剩余预算全部用于局部微调,无法实现真正的递归自我改进。
三种升级方案,两种见效但未破局
打开网易新闻 查看精彩图片
研究者尝试了三种升级路径。其中,经验驱动脚手架方案表现最为亮眼:在GSM8K数据集上提升12.6分,在HumanEval上提升40.8分。但即便成绩显著,策略本身依然处于冻结状态,未能跳出初始框架。
另外两种方案——人类引导和额外推理算力——均未能触及问题根源。
核心症结:缺乏“重新考虑”的能力
论文指出,智能体在执行过程中缺少一个关键机制:重新考虑策略的能力。这导致它一旦选定方向,便再无回头路,只能在同一路径上反复打磨,无法实现质的飞跃。
热门跟贴