给AI模型一段小说开头的文字,它能给你变出一个可以自由探索的3D场景吗?OpenAI联合创始人安德烈·卡帕西最近就提出了这样一个新玩法。

8月2日,卡帕西在X平台上公布了他的AI基准测试新思路。相比于此前业界流行的“鹈鹕骑车图”SVG生成测试,他这次直接让模型挑战更复杂的任务:根据文学文本构建可交互的3D世界。

打开网易新闻 查看精彩图片

测试的具体规则是这样的:向模型输入《指环王》开篇首段文字,最高资源额度为100万tokens,约合10美元的成本。卡帕西选择了Claude Opus 5作为测试对象,要求它使用three.js创建对应的3D场景。

结果如何?在100万tokens的额度内,Claude Opus 5耗时约2小时,最终输出了约5500行代码。生成的3D作品以动画形式呈现了《指环王》的开幕场景,其中包括人们参加比尔博告别宴会的热闹画面,以及一个堆满财宝的洞穴空间。

这个结果当然无法与人工花费数小时精心制作的内容相提并论。但考虑到AI是在约2小时内从零完成全部生成工作,其完成度依然让人眼前一亮。卡帕西的点子背后,反映的是一个很实在的问题:当“生成鹈鹕骑车图”这种简单任务对模型来说已经不在话下时,我们该用什么新标准来评估AI在空间推理、几何逻辑和代码生成上的真实能力?

他的答案是:让模型去干一件需要同时调动代码编写、场景设计和多媒体制作等多项技能的综合性工作。从一段纯文本到一个可交互的3D场景,这一跳,比画一张静态图要远得多。