8 月 1 日凌晨,一段只有 58 秒的游戏演示视频突然在社区里传开。

打开网易新闻 查看精彩图片

作者 Elshayib 表示,他把 DeepSeek V4 Flash 0731 接入 Hermes Agent,只提交了一条提示词,Hermes 连续执行了 32 分钟,最终花费只有 0.07 美元。

视频里已经能看到第一人称视角、枪械、准星、弹药数量和可移动的三维地图。帖子截图显示,这条内容很快获得了接近 50 万次查看。

作者还给出了一个很抓眼球的判断:

按照这个成本,2 美元甚至可以用上一整天。

“一条提示词”“32 分钟”“7 美分”“做使命召唤”,几个数字放在一起,确实很容易让人产生一种感觉:便宜模型突然追上了昂贵模型,一句话就能做出 3A 游戏。

仅7美分32分钟!一条提示词让AI搞定《使命召唤》
打开网易新闻 查看更多视频
仅7美分32分钟!一条提示词让AI搞定《使命召唤》

我把视频和下面公开的提示词仔细看了一遍,结论稍微冷静一些。

Hermes 没有真正复刻《使命召唤》,它交付的是一个受《使命召唤:黑色行动 2》氛围启发、可以在浏览器运行的第一人称射击游戏原型。

这已经足够有意思。

真正值得关注的地方,在于一个价格极低的模型,配合 Hermes 的持续执行能力,已经可以把一份复杂需求变成能打开、能移动、能开枪的完整交付物。

打开网易新闻 查看精彩图片

一、先看结果:离 3A 游戏很远,但已经不只是网页特效

从作者公布的视频看,最终生成的内容至少具备几个明显元素:

  • 第一人称枪械视角;
  • 鼠标控制方向;
  • 地图移动和跳跃;
  • 准星与弹药数量;
  • 射击反馈;
  • 简单的三维建筑、立柱、掩体和道具;
  • 浏览器内直接运行。

画面精细度与真正的《使命召唤》相差很远。

地图几何结构还比较简单,材质和光照也没有达到“高度写实”的程度,枪械模型、人物动画、物理破坏和环境细节都更接近技术演示。

但这并不影响它的价值。

以前让 AI 写一个网页小游戏,常见结果是一小段代码、几个方块和一个简单按钮。任务稍微复杂一点,模型就容易省略代码

此处省略其他逻辑

或者留下:

后续请自行完善

这次交付的重点,是一个可以运行的单文件三维射击原型。

模型没有只告诉用户“应该怎样做”,而是把项目文件真正写了出来。

打开网易新闻 查看精彩图片

二、“一条提示词”不等于“一次回答”

这次最容易产生误解的地方,是作者所说的“一条提示词”。

从人的操作来看,作者确实只发出了一次要求。

但从 Hermes 的执行过程来看,这通常不等于模型只调用了一次。

Hermes 是一个 Agent。它拿到任务以后,可以围绕同一个目标持续进行模型调用和工具调用。官方文档明确说明,主模型会参与用户消息、工具调用循环和流式响应;模型调用工具后,Hermes 会执行工具,再把结果交回模型继续处理。

这 32 分钟里,可能发生了类似这样的过程:

理解需求→ 规划网页结构→ 编写 HTML、CSS 和 JavaScript→ 保存文件→ 检查代码→ 发现缺失或错误→ 修改代码→ 再次验证→ 输出最终文件

原帖没有公开完整日志,所以我们无法确认它究竟调用了多少轮模型、修复了多少次错误。

可以确定的是,32 分钟已经远远超过普通聊天模型生成一段回答所需的时间。

这更像把任务交给了一个廉价开发员。

用户只说一次,Hermes 在后台不断推进,直到出现可以交付的文件。

所以这次案例里,DeepSeek 提供的是推理和代码能力,Hermes 提供的是持续工作机制。

少了任何一边,效果都可能不同。

打开网易新闻 查看精彩图片

三、DeepSeek V4 Flash 为什么刚好适合这种任务

这个实验发生的时间也很巧。

DeepSeek 在 7 月 31 日刚刚上线 V4 Flash 正式版 API,也就是这次使用的 DeepSeek-V4-Flash-0731。

官方这次重点强化的正是 Agent 能力。

例如:

Terminal Bench 2.1:82.7DeepSWE:54.4Toolathlon verified:70.3DSBench-FullStack:68.7

这些测试关注的内容,不只是“回答一道编程题”,还包括终端操作、工具使用、项目级代码修改和连续任务执行。

V4 Flash 还提供了几个适合长任务的条件:

上下文长度:1M最大输出长度:384K支持工具调用支持思考和非思考模式

1M 上下文意味着 Hermes 在持续工作时,可以携带更长的任务要求、代码内容和工具返回结果。

384K 最大输出也很关键。

一个包含 HTML、CSS、JavaScript、三维场景、物理逻辑和粒子效果的单文件项目,代码量可能非常大。输出上限太小,模型容易写到一半突然停止。

当然,上限高不代表每次都会用满。

它解决的是“允许模型继续写”的问题,最终能不能写好,还要看模型的代码能力、Hermes 的循环方式以及提示词是否清楚。

打开网易新闻 查看精彩图片

四、32 分钟为什么只花了 7 美分

DeepSeek V4 Flash 当前的官方美元 API 价格是:

缓存命中输入:0.0028 美元 / 100 万 Token缓存未命中输入:0.14 美元 / 100 万 Token输出:0.28 美元 / 100 万 Token

输入缓存命中和未命中的价格相差 50 倍。

这可能是长时间 Agent 任务仍然很便宜的重要原因。

Hermes 在多轮执行时,会反复带上相同或相近的内容:

  • 系统指令;
  • 用户最初的任务;
  • 已经生成的项目背景;
  • 前几轮对话;
  • 工具说明。

当这些前缀命中缓存时,重复输入的成本会明显降低。

不过原帖没有公开 Token 明细、缓存命中率和调用次数,因此我们不能断言这 7 美分具体由多少输入和输出组成。

“2 美元可以用一整天”也更适合理解为一种形象说法。

按照这一次实验机械计算:

2 ÷ 0.07 ≈ 28.6 次

每次运行 32 分钟,大约相当于:

28.6 × 32 分钟 ≈ 15.2 小时

覆盖一个很长的工作日确实没有问题,但并不代表所有任务都能以相同价格连续运行 24 小时。

项目越复杂、输出越长、错误越多,费用就可能越高。

打开网易新闻 查看精彩图片

五、这条提示词长,但它没有教模型逐行写代码

作者公开的提示词非常长。

仔细看会发现,它没有告诉模型某个函数应该怎样写,也没有逐步安排“先创建场景,再创建枪械”。

它更像一份工程需求书,主要做了六件事:

第一,规定交付物。

最终只能交付一个完整、独立、可以直接打开的 HTML 文件。

第二,限制依赖。

可以使用 Three.js、第一人称控制器和轻量物理库,但只能通过标准 CDN 引入。

第三,禁止走捷径。

不能使用外部三维模型、图片贴图和现成素材,场景、纹理和材质都要在运行时生成。

第四,列出验收项。

地图、灯光、枪械、射击、后坐力、粒子、物理、后期效果和性能优化,一个都不能只写在说明里。

第五,堵住偷懒出口。

禁止伪代码、代码省略、待办标记和“剩余部分请自行补充”。

第六,明确成功标志。

把文件保存下来后,用现代浏览器打开就应该运行。

这类提示词的关键,不在华丽的形容词,而在于把交付边界写清楚。

打开网易新闻 查看精彩图片

六、我把原提示词整理成了中文版

下面这份不是逐字翻译,而是保留原提示词的核心要求,整理成更适合直接交给 Hermes 的中文版本。

你的任务是生成一个完整、可运行、独立的 HTML 文件。这个文件需要同时包含 HTML、CSS 和现代 JavaScript,并在浏览器中实现一个高质量的三维第一人称射击游戏场景。画面氛围参考现代城市战斗地图,具有写实、紧张、粗粝的视觉风格。这是一次对空间设计、三维渲染、着色器、性能优化和 WebGL 代码执行能力的综合测试。禁止输出伪代码、被截断的代码、待办标记、占位符,以及“其余代码省略”等内容。一、交付与依赖要求1. 所有内容必须放在一个 HTML 文件中。2. 外部依赖只能使用标准 CDN 脚本,例如 Three.js、第一人称鼠标锁定控制器,以及可选的轻量物理库。3. 禁止使用外部三维模型文件和外部图片贴图。4. 地形、纹理、材质、枪械、建筑和道具都必须通过 JavaScript、Canvas 或 WebGL 在运行时生成。二、画面与灯光1. 使用实时动态灯光,包括太阳方向光、柔和动态阴影和局部闪烁灯光。2. 为金属、混凝土、瓷砖和玻璃创建具有粗糙度、法线、金属度和环境遮蔽效果的材质。3. 加入暗角、胶片颗粒、HDR 色调映射、辉光,以及景深或环境光遮蔽效果。三、地图与环境1. 创建一个多层战斗空间,包括楼梯、阳台、立柱、掩体、玻璃框架和嵌入式灯光。2. 使用程序化几何体生成弹药箱、油桶、武器架、植物和其他环境道具。3. 场景需要具备清晰的移动路线、掩体关系和空间层次。四、玩家控制与武器1. 实现鼠标控制视角,以及前后左右移动、奔跑、跳跃和下蹲。2. 玩家移动时需要有平滑惯性和适当的镜头晃动。3. 在第一人称视角中显示一把程序化生成的步枪或冲锋枪。4. 武器需要具备待机摆动、后坐力、右键瞄准和射击反馈。五、物理与特效1. 油桶、靶子和碎片应能对碰撞和射击作出反应。2. 射击时加入枪口火焰、动态闪光、火花、烟雾和命中效果。3. 加入空气尘埃、光束中的颗粒和环境烟雾。六、性能要求1. 尽量使用实例化渲染、视锥裁剪和合理的阴影分辨率。2. 控制内存和对象数量,目标是在普通桌面浏览器中保持流畅运行。3. 不要为了增加细节而让页面无法打开或明显卡死。最终只输出完整的 HTML 代码,不要添加解释、开场白或使用说明。从画布初始化、场景创建、玩家控制、物理更新到后期处理,所有关键部分都必须真实实现。文件保存并打开后,应能直接进入并操作游戏。

这段提示词最值得借鉴的地方,是把“做得炫酷一点”改成了可以检查的具体要求。

打开网易新闻 查看精彩图片

七、视频能证明什么,又不能证明什么

从演示视频来看,这次实验已经证明了三件事。

第一,DeepSeek V4 Flash 可以在 Hermes 中承担持续半小时的复杂代码任务。

第二,Hermes 能把一条需求推进成实际文件,而不只是生成一段建议。

第三,低价模型已经能够承担过去需要高价模型完成的前端原型工作。

但视频暂时无法证明提示词中的所有要求都达标。

例如:

是否稳定达到 60 FPS是否真的使用了完整 PBR 材质是否实现了环境光遮蔽或景深物理破坏是否持续生效弹孔是否会保留烟雾是否采用体积效果不同电脑上是否都能正常运行

这些都需要拿到原始 HTML 文件并实际检查。

从公开视频的画面判断,它更像一个“功能已经跑通的原型”,距离提示词中要求的“高度写实”仍有明显距离。

所以标题里可以说“做使命召唤”,正文里一定要说明:它做的是受使命召唤氛围启发的浏览器枪战原型。

这样既保留了传播力,也不会把结果吹得太过头。

打开网易新闻 查看精彩图片

八、我会怎样在 Hermes 里复现

刚接触的朋友不建议一上来就照搬完整要求。

最稳妥的方式,是先做一次低风险版本。

先新建一个空文件夹:

mkdir hermes-fps-democd hermes-fps-demo

退出当前 Hermes 会话后,在终端运行:

hermes model

通过模型配置向导加入 DeepSeek,填写测试用 API Key,并选择:

deepseek-v4-flash

Hermes 官方区分了两个模型命令:

hermes model

用于添加供应商、输入密钥和完成完整配置;

/model

只能在已经打开的会话里,切换此前配置过的模型。

第一次测试时,可以把要求缩小到:

只做一个房间只放一把枪先实现移动、瞄准和射击不做复杂物理破坏不追求高度写实最终交付一个可直接打开的 index.html

成功标准也很简单:

目录里出现 index.html浏览器打开没有白屏鼠标可以控制视角键盘可以移动点击鼠标可以射击控制台没有持续出现致命错误

这一步跑通,再逐渐加入灯光、粒子、后坐力、动态物体和更复杂的地图。

API Key 最好使用低额度测试密钥,项目也放在独立空目录里。

这样即使模型不断扩张任务、重复修改文件或者生成大量内容,也不会碰到重要资料。

打开网易新闻 查看精彩图片

九、真正的变化,是廉价模型开始“按分钟干活”

过去评价一个便宜模型,常问的是:

它会不会写代码?

现在更值得问的是:

它能不能在 Agent 里连续工作半小时?

单次回答很漂亮,不代表能完成项目。

Agent 任务需要模型反复读取环境、调用工具、处理错误、保持目标,并在多轮执行后留下真实交付物。

这次实验的画面谈不上惊艳,完成度也没有完全达到提示词里的要求。

但 7 美分、32 分钟和一个可运行的三维网页放在一起,已经说明了一件事:

低价模型正在从“便宜的聊天替代品”,变成“可以长时间调用的执行型模型”。

Hermes 的价值也随之变得更清楚。

它没有让 DeepSeek 突然拥有 3A 游戏开发团队的能力,却让一个便宜模型能够持续规划、写代码、落盘、检查和修改。

一条提示词负责说清验收标准。

Hermes 负责一直干。

DeepSeek V4 Flash 负责把每一轮成本压到足够低。

这三个条件放在一起,才是这次 7 美分实验真正值得看的地方。

打开网易新闻 查看精彩图片