我有一个判断:
世界模型生成的内容,未来的主要消费者,可能不是人,是 Agent
爱诗做的通用实时世界模型 PixVerse R1,这次做了一轮大更新。720P 高清实时生成全面开放,画面稳定性提了一档,UGC 创作者社区正式上线,同时面向外部开放世界模型 API 接口(邀请制)
在这里申请:https://aisphere.feishu.cn/share/base/form/shrcnV1ZJhUDBLWJ8vub36t3z4f
可能有些朋友没见过 R1,先说清楚它和现在市面上所有 AI 视频工具的区别
现在的 Sora、可灵、Runway、海螺,逻辑都一样:写一段描述,等渲染,拿到几秒到十几秒的成品视频,想改就重来
R1 做的事不一样。你给它一个起始场景,它会一直往下生成。持续的、没有时间限制的画面。你随时可以打字或者说话来改变剧情,它实时响应
一个跑不停的世界,和一段几秒的视频,根本不是一回事
这些画面都在持续跑着,没有固定的结束时间,角色自己在动,镜头自己在切,剧情自己在往下走
你不说话,它自己演
它编出来的剧情走向,跟人类的叙事直觉经常不一样。人写故事习惯起承转合,有节奏。R1 不管这些,它按自己对世界的理解去推。有时候生成出来的转折,你会觉得这个逻辑好像只有 AI 自己能看懂
看到这里,回到开头那个判断
这些持续生成的画面,到底是给谁看的
聊 AI 视频的时候,大家会不自觉地在一个框架里想问题:画质够不够高,时长够不够长,镜头语言够不够专业,故事够不够打动人
这些考量背后有一个前提——所有的「好不好」,都是按人类的审美、人类的注意力、人类的情绪共鸣来评判的
当你还在想「怎么让 AI 帮人出更好的视频」的时候,思考已经被这个前提限住了
Google 之前做了一个东西,直接把这个前提换掉了
他们有一个 Agent 项目叫 SIMA 2,能在 3D 环境里自己理解目标、自己规划路径、自己执行。关键的一步:他们把 SIMA 2 丢进了 Genie 3(Google 的世界模型)生成的世界里
SIMA 2 在 AI 生成的世界里自己走,自己试错,自己学。失败的任务,几轮自我训练之后就能完成。不需要人类标注数据,不需要人类提供游戏录像
Google 管这个叫「自我改进循环」。Agent 在 AI 生成的世界里试错,Gemini 对行为打分,结果存进经验库,下一代 Agent 在这个基础上继续训练。每一代比上一代强,人不需要介入
世界模型生成世界,Agent 在里面训练自己
训练完的 Agent 能力更强,需要更复杂的世界来继续训练。世界模型和 Agent,互相喂
在这个循环里,世界模型生成的画面、场景、物理规则,全都是给 Agent 消费的。人可以看,但人看不看,不影响循环转下去
Token 的主要消耗者正在从人变成 Agent。一个人可以同时跑 10 个 Agent,每个 Agent 每天调用几千几万次接口。世界模型把这个逻辑往前推了一步——Agent 所消耗的,不光可以是文字 Token,还应该是视觉世界。需要在 AI 生成的环境里走动、试错、理解物理规则、练习交互
R1 这种能实时、无限时长生成的世界模型,最大的下游用户可能根本不是人类创作者
那问题就来了
如果世界模型的第一批重度用户不是人,PixVerse 这次更新的 UGC 社区、创作者模板库、720P 画质,这些全是面向人类用户的功能
这中间有一个张力
也许恰恰是因为现在面向人类用户把实时生成的体验做到位了,底层的推理效率、画面一致性、交互响应速度这些硬能力才能被逼出来。等 Agent 大规模消费世界模型的时候,这些能力是直接能接住的
R1 能做到实时,核心是把扩散模型的采样步数压到了 1 到 4 步(传统方案跑 50 步以上),再加上自回归流式生成做到逐帧预测、理论无长度限制。代价也有,长时间生成有误差累积,物理渲染精度为了实时做了妥协,PixVerse 自己在技术报告里也提了
这次更新还有一个值得注意的点:Omni(自研原生多模态基座)的完整能力第一次面向用户开放。文本、图像、音频、视频统一编码成连续 token 流,画面跑着的同时声音也在实时生成,环境音、人物语音都跟画面对得上
之前想 AI 视频这个赛道的时候,默认就是在想「怎么帮人出更好的视频」。但如果把 Google 正在做的事情和 R1 放在一起看,这个赛道正在长出一个完全不同的下游
也许今天面向人类创作者做的这些功能,最终的价值不在于帮人拍出更好的片子,而在于它在这个过程中,把世界模型的实时能力打磨到了 Agent 能用的程度,去争取入场券
最后,别忘了,R1 的 API 已经开了,在这里申请:https://aisphere.feishu.cn/share/base/form/shrcnV1ZJhUDBLWJ8vub36t3z4f
热门跟贴