表面看,切换档位只是改了句 system prompt。但模型可不是你让它“更努力”它就照办的乖乖学生。

这里头藏着条关键线索:RLVR 训练。模型必须先经过强化学习验证训练,学会把“高/低推理”标签当作真实的计算预算指令来执行。没练过这个,再精致的 prompt 也是空话。

打开网易新闻 查看精彩图片

更有意思的是 标签。你以为它锁住了思考过程,其实更像个装饰性容器——把中间推导打包展示,附带档位标记。档位越高,模型学会往里塞更多 token,但边际收益递减很快。

一句话:位能生效,全靠 prompt 约定遇上匹配的训练配方。还没选对基础模型?三档可能是骗自己的。