一份提示词,烧了 6.9 亿 token,花费 423 美元。
Vyom 最后得到了 Wave Racer,一个自带物理引擎的赛艇游戏。
这款游戏基于 Three.js 构建,带有细胞着色渲染风格,赛道是程序生成的无限大海洋,场景里的每一片浪花都是代码实时计算出来的,不依赖任何外部素材包。
代码已经传到了 GitHub,任何人都可以直接在浏览器里玩起来。
体验传送:https://wave-racer.vercel.app/
「一次生成一个游戏」
Claude Opus 5 于 7 月 24 日发布,随后几天,社交媒体上涌现出一批令人侧目的浏览器游戏原型。
AI 投资人 Matt Shumer 发布了一款完全由 Opus 5 构建的第一人称射击游戏,屏幕上所有元素,代码、纹理、物理、敌人行为,全部自行生成,没有使用任何外部素材。
Prompt:I want you to build a first-person shooter at the level of the most recent Call of Duty games. It should be utterly perfect, visually beautiful, with every single thing done at AAA quality—from textures to physics to anything you could think of.
Fan out sub-agents and have sub-agents tackle each one individually so that the game is utterly perfect. You should /loop on each item and have a separate sub-agent check it visually to ensure it looks triple A. That separate sub-agent should be a really harsh critic, and if it doesn't look triple A, it should keep going.
Don't stop until each sub-agent is utterly wowed with the quality when compared with the actual Call of Duty game. It should literally compare them side by side blind and say which one looks better. Do this in ThreeJS. /loop until it's utterly perfect. Fan out sub-agents and ultracode.
如上,Shumer 从未指定过渲染器,也未列出游戏的系统,更未界定「3A 级品质」应包含哪些要素。
他将这种方法称为「挑战循环」(Gauntlet Loop):给代理一个真实且可检查的标准,而不是模糊的指令;让它将任务拆解成小块;并将每块任务提交给评审者,而评审者永远无法看到构建者做出选择时的推理过程。
随后,@mikeluan123 把 Shumer 的提示框架改造成一个类《家园》风格的宇宙级太空即时战略,消耗 6.86 万输入 token 和 460 万输出 token,耗资 632.65 美元。
不过,也有没那么烧钱的玩法。Andrej Karpathy 只用了一个零头不到的预算,就让 AI 渲染出了一整个中土世界。
他把《指环王》第一段的原文递给 Opus 5,给了 1M token 的预算(约 $10 美元),请模型渲染这个故事。
两个小时后,5500 行代码写就,一个程序生成的中土世界在浏览器里跑了起来。他把它传到 karpathy.ai/lotr-movie 上,顺手说:「期待 GTA 霍比特镇在 GTA VI 之前掉落。」
在传统三维开发里,开发者从资产库拼装场景,纹理是图片文件,物理依赖引擎,有点像在搭乐高;
而这些 Opus 5 更像是塑料粒子开始形成积木,几何体是过程式的,纹理通过着色器表示,物理和操控也全部写进同一个 HTML 文件里,一打开就能跑。
2026 年游戏开发者大会的调查显示,52% 的游戏开发者对生成式工具持负面看法,53% 认为这类工具会增加项目的 bug 风险。美中不足之处同样明显:美术指导、叙事深度,以及那种说不清楚但玩家一秒钟就能感知到的「精致感」,依然是明显的弱项。
开发者 Leon Lin 做了一个有趣的对比。他直接写了一份多达 20 个章节的详细设计文档,从布娃娃物理模拟到级联阴影贴图逐项写清楚,然后喂给 Opus 5,生成了「Dust Corridor」,同样跑在浏览器里,看起来很好,在某些维度上比「短提示版本」更稳定。
但那份文档是 Leon 自己写的。他能写出来,因为他知道 AAA 品质意味着什么。模型在他的框架下表现出色,是因为框架本身来自人类多年的积累和经验。
生成只是起点 眼光决定一切
生成的成本在快速趋近于零,这是此刻正在发生的最重要的变化之一。
从更长远的角度看,这会带来一件极度让人兴奋的事情:玩家可以以旁观者 NPC 的身份进入《指环王》的故事,或者扮演其中的角色,「某种按需生成的 GTA X」。
这是游戏真正的未来,可能不再是固定内容的罐头,它可以根据你的偏好、节奏和兴趣,实时生成专属于你的世界体验。每个玩家拥有自己的中土世界,自己的霍比特镇,自己的专属故事。
但「生成」只是起点,它之后的工作,是问题所在。
https://the-decoder.com/claude-opus-5-pushes-prompt-to-game-ai-from-rough-color-blocks-to-full-3d-prototypes-with-physics-and-music/
Karpathy 在《指环王》实验里揭示了一个根本性的技术障碍。Opus 5 在生成渲染代码的过程中,不得不非常缓慢而痛苦地在不同时间点截图,然后依据这些静态截图来推断动态运行时的状态,结果还是出了几次错、制造了一批混乱。
他的结论是:「游戏与世界这个领域揭露了大语言模型的一个弱点,它们难以审计自己的工作,因为它们无法高效地、原生地感知视频,也无法真正参与其中的游戏。」
模型能写出让赛车在水面漂亮漂移的代码,但它自己没办法玩这个游戏,注意不到「连续三个 S 弯之后玩家已经开始烦了」。它靠截图和静态代码分析推断,这种推断的精度和覆盖范围,离真正的游戏评估差得相当远。
这带来了一个推论:当生成几乎免费,能判断输出好坏的眼光,才是真正稀缺的资源。
「这里的物理感觉不对」,「这个关卡的节奏在第五分钟死掉了」,「这段任务说明太模糊,玩家会直接放弃」,这类判断无法从代码量里自动涌现,也不会因为 token 预算变大就自动出现。
懂得检查和批评模型输出的人,此刻拥有更高的价值。
想让模型学会看自己一眼,还差什么
要让大语言模型在这个领域真正好起来,需要改变什么?
现在的模型可以分析单张截图,能理解一帧图像里发生了什么,但「在时间维度上连续感知一个游戏运行」是完全不同的事。
要真正「看见」一个游戏,模型需要追踪帧与帧之间的状态变化,识别「玩家在这里死了三次」这种只有跨帧才能发现的规律,感受「这个段落里玩家的操作节奏开始变乱了,可能某个地方不对劲」。
研究层面可以看到一些务实的工程方向。自动化游戏测试领域已在探索让 LLM 智能体通过多模态感知捕获游戏状态,在执行行动之后进行自我反思,识别卡顿和崩溃,然后调整策略,把「截图→分析→行动」这条链路压缩成接近实时的反馈闭环。
这类方法不等待模型原生「看视频」的能力成熟,先用架构弥补感知短板,是目前最接地气的工程路径。
模型知道怎么写能正确渲染法线贴图的 WebGL 代码,因为这类代码在互联网上大量存在,可以被学习到。
但「玩家在这条走廊里哪个转角会产生压迫感」,「武器后坐力有多重才不会让人感觉失控」,「什么样的奖励节奏让人打完一关还想再来一关」,这类判断并没有被「写成代码」存到网上去供模型学习。
要让模型真正获得这种感知层面的能力,光靠代码语料大概不够。可能需要大量「模型实际玩游戏」所产生的交互数据,在真实的游戏过程里积累关于手感、反馈、节奏和挫败感的判断基准。
这在某种程度上有点像 AlphaGo 的逻辑,它通过海量自我对弈积累棋感以学会下棋。而游戏世界比棋盘复杂太多,感知接口也宽得多,这个路径要长很多。
真正个性化的游戏体验,除了生成一个有无限海洋的赛道,还要知道这个玩家喜欢什么节奏,这个玩家对什么类型的挑战会感到愉悦,这个玩家的审美偏好是什么。
Wave Racer 和 Karpathy 浏览器里的中土世界都很有意思,但至少到 2026 年这个夏天,「一个 Prompt 打穿《使命召唤》」还没有发生。
模型什么时候能真正玩自己制作的的游戏,感受到「第七关的节奏在第二分钟垮了」,从那里学到设计层面的教训?
在那个时刻到来之前,对这件事保持兴奋,同时学会用挑剔的眼光检查那份兴奋,就是现在能做的最有价值的事情了。
我们正在招募伙伴
简历投递邮箱 hr@ifanr.com
✉️ 邮件标题 「姓名+岗位名称」(请随简历附上项目/作品或相关链接)
热门跟贴