如果让你用一句话概括人类全部发明史,你会怎么说?有人把这个问题丢给了一个模型,然后得到了一部3分钟的短片。整个过程没有用任何视频素材,没有版权音乐,也没有调用视频生成模型——画面和配乐,全部由代码实时渲染出来。

这部短片在X和Reddit上传开之后,很多人的第一反应是:这肯定是顶尖动效设计师熬夜肝了半个月的作品。但制作者说,里面没有任何一个像素是手绘的,也没有任何一段音频是录制的。

打开网易新闻 查看精彩图片

把一万年压进24小时

X用户 @imjustnewatai 给模型输入的提示词很简单:一段展现人类全部进步历程的视频,然后延伸到未来30年。模型给出的方案是——把整个人类发明史,压缩成一天中的24小时。

画面中央是一个冷峻的24小时时钟和进度条,配乐由模型自己生成,随着时间推进逐渐变得宏大。然后,是漫长的死寂。在这“一天”的绝大部分时间里,进度条几乎停滞,人类的祖先在荒野中挣扎,工具几无变化。

转折点密集地挤在最后几分钟里:

  • 23:40(约4.5万年前):洞穴壁画与手印艺术出现,字幕打出“艺术——洞穴墙上的一只手。我曾来过这里。”
  • 23:59:09(公元105年):造纸术出现,距离午夜不到1分钟。
  • 23:59:54.7(1825年):铁路出现,工业革命的轰鸣开始加速。
  • 23:59:58.71(1977年):个人电脑出现,画面闪烁着老式绿色终端界面。

时钟最终定格在午夜00:00:00.000(2026年),屏幕上打出三个字:“你在这里。”一个发光的网格球体浮现,象征当下的数字文明。

视频随后无缝切入“第二天”,字幕提示:想象,而非预测。时间线从2031年开始指数级推进——每个孩子拥有专属个人AI导师、出生即可读取全基因组、室温超导体商用。片尾一轮红日从数字地平线升起,标题是“THE SECOND DAY”。底部一行小字解释:2026年之前的日期是真实的,最早的是近似值;之后的一切都是想象。

不止一部“神作”

除了这部人类进化史,这位博主还用同一个模型测试了其他几个项目。

其中一个是一镜到底的缩放:94秒里,镜头从微观世界最底层的三个夸克开始,不断向外拉升,跨越整整42个数量级,穿过原子、细胞、人类、地球、太阳系、银河系,直到可观测宇宙。视觉画面和背景音乐同样全部由代码生成。

另一个测试是让模型在Godot中制作一个关于“SCP基金会”的项目。结果它搭出了一个包含58个SCP异常生物、5种不同结局的交互式文字冒险游戏。玩家扮演D-4137号员工,在Site-19经历三天:第一天Safe级,第二天Euclid级,第三天Keter级,然后是收容失效,每一个决定都会影响结局。

此外还有钢铁侠与蜘蛛侠穿梭不同历史时代的画面,以及一段梳理Altman与Amodei之间恩怨的解说视频,配上了信息图表风格的动画。

“造物”和“做梦”的区别

相比Sora、Runway和Pika,这类代码生成视频的路径到底不同在哪?

Sora等采用的是扩散模型,工作原理是预测像素,因此存在物理规律崩溃、逻辑不可控、没有声音等弱点。而代码生成的方式,是根据提示词自己写一套复杂的程序代码,可能是基于Python、WebGL或其他渲染引擎,然后运行这套代码,把画面“算”出来。背景音乐也是用代码编写MIDI和合成器参数实时生成的。

由此带来的结果是:逻辑严密,没有版权风险,算力成本极低。

在传统影视和动画工业中,制作这样一部短片需要编剧写剧本、导演画分镜、原画师或3D建模师制作资产、动画师K帧、配乐师作曲、后期渲染合成。而现在,这些步骤被压缩成了一次代码生成。当你需要一个产品演示视频、一个宣发短片、甚至一个小游戏时,可以在几分钟内拿到多个带配乐的高清无版权方案。

那部《人类发明史》之所以让人震撼,或许是因为它顺带说清了一件事:人类的历史在绝大部分时间里是平庸且缓慢的,但一旦突破某个奇点——造纸、蒸汽机、电脑——发展速度就会呈几何级数爆炸。视频把镜头停在了午夜交界处,而屏幕外的我们,正站在那个位置上。