阿里正在内测的 Wan Streamer 产品,又有了更新,现在来到了 v0.3 版本。
Wan Streamer,是阿里万象团队研发的一个实时交互的音视频模型。AI Agent 端能够边听,边看,边思考,边说话,并实时生成视频回应你。
第一次看到时Wan Streamer 时,我惊呆了。
(左为真人,右为AI数字人)
这是直接可以和AI 数字人打视频实时聊天了。
的确是这样,Wan Streamer 的模型侧响应延迟约为0.2 秒,0.35秒的双向网络延迟后,总延迟0.6 秒以内。
可支持亚秒级全双工音视频通信。
实时输出音频+视频,比市面上多数单纯输入语音的模型延时都低,低很多。
不仅如此,Wan Steamer 的AI 数字人还支持边听、边看、边思考、边说话,实时生成视频回应你。
视线、点头、微表情与口型同步。如同真人一样。
对面的 AI,已感觉不出是 AI 了,是真的有人味了。
现在, Wan Streamer来到了v0.3 版本,我们一起回顾下这三个版本。
2026 年 6 月 24 日,发布0.1版本:面向实时交互的端到端基础模型。
(大图为 AI 数字人,小图为真人。下同)
全面介绍了该模型,这是一个实时交互端到端多模态模型,单一Transformer统一处理文本、音频、视频流,实现全双工实时音视频互动。
2026 年 7 月 5 日,发布0.2版本:分辨率更高,延迟不变。让实时画面更清晰。
2026 年7 月 16 日,发布 0.3 版本:保持速度与分辨率的同时,让模型更通用、角色行为更丰富。
这个v0.3 版本里,大模型把AI数字人实时视频,理解为「世界设定 + 事件流」。
啥意思呢?
世界设定:指视频里长期保持一致的场景、角色、画面与声音。也就是不变化的或者变化小的部分。
事件流:指视频里随时间发生的说话、动作、镜头移动、环境变化。随时变化的部分。
也就是,AI 数字人实时视频生成, 会拆解为固定的或变化不大的部分,和随时变化的部分。
世界设定只需载入一次,此后用户输入、智能体说话与行为、音频和视频沿同一时间线持续推进。
这样,v0.3 将 Wan Streamer 从对话模型拓展为更通用的视频学习模型。
这是一种新的理解视频的模式。
视频 = 世界设定 + 事件流。
Wan Streamer要做的,是让合适音视频聊天的AI Agent,像真人一样。
不但能实时音视频聊天,极低延迟。
AI Agent 还能有自己的行为和动作。
比如,对 AI Agent 一边和你聊天,一边演示自己做饭的步骤。
Wan Streamer v0.3 已让这个成为现实。
Wan Streamer从 v0.1 到 v0.3,差不多一周一个版本,迭代非常快。
预计到1.0版本后,会进行公测或对外开放接入。
这对于AI Agent 音视频实时交互,或是一个重大节点。
标志着, AI音视频生成,进入实时交互、 类真人阶段。
这个产品上线后,这对阿里,或许也是个王炸产品。
来源 | 产品笔记(ID:cpbiji)
作者 | 三哥 ; 编辑 | 呼呼大睡
内容仅代表作者独立观点,不代表早读课立场
热门跟贴