过去一段时间,有一种声音认为,大语言模型只是在数学编程这类答案可验证的领域突飞猛进。但最新数据显示,这种说法并不准确。

实际情况是,当模型在可验证任务上表现越来越好时,它们在其他类型的问题解决上也在同步变强。尽管原文没有点明具体的是哪些非可验证任务,但数据透露出一个清晰的信号:模型能力的提升并非被锁死在固定题型里。

打开网易新闻 查看精彩图片

这一发现直接冲击了业界此前对模型“偏科”的悲观想象。如果进步是跨领域的,那么AI的上限或许比普遍预期更高。我们可能需要重新评估模型在创作、复杂推理开放性任务上的潜力。

打开网易新闻 查看精彩图片