你刚在家族群转发的那段"新闻"——某巨头 CEO 亲口宣布破产、某明星公开致歉——可能从头到尾没有发生过。它不是被剪辑的,是被一行代码生成的。而你,第一眼没看出来。
7 月的 WAIC 2026,最安静也最吓人的展台不在机器人区,在一块循环播放的屏幕前:可灵、即梦、海螺、Vidu 轮番生成一段段几可乱真的视频,人物口型对得上、光影站得稳、连手上的戒指都在动。视频生成的最后一道门槛——"看起来像真的",正在被中国模型集体踏破。这背后不是又一项炫技,而是一连串更该想清楚的问题。下面分七个角度拆。
01从"能看"到"能骗":视频的那道门槛被踏破
一年多以前,AI 视频还只是一堆几秒的糊片和抖动的人脸;今天,它能给出几十秒连贯的镜头,人物不眨眼穿帮、物体不乱跳、光影顺着物理规律走。
真正的分水岭不在分辨率,而在"你敢不敢相信它是假的"。当一段视频不再靠放大找破绽,而是第一眼就被当成真事转发,视频生成就跨过了从"玩具"到"武器"的线。
视频生成的分水岭,不是画质,是"你不敢相信它是假的"。
02可灵、即梦、海螺、Vidu:中国四小龙怎么追上来的
可灵(快手)把时长拉到 2 分钟级别,主打影视级质感,在海外创作者圈先建立了口碑;即梦(字节)背靠豆包大模型,分发和生态是天然优势,C 端迭代极快;海螺(MiniMax)在英文 prompt 理解和社区运营上出圈;Vidu(生数科技)则在多主体一致、时序连贯上做得扎实。
四家没有走同一条路,却押了同一个判断:视频是继文字、图片之后,下一个被 AI 整体重写的内容形态。谁先把"真实感"做稳,谁就握住下一代内容的入口。
四家走的是四条路,但都押同一个判断:视频是下一个被 AI 重写的内容形态。
03为什么是现在:算力、数据、审美三件套同时成熟
视频生成比文字难一个量级,因为它要同时搞定"理解世界"和"生成世界"。这件事在 2026 年第一次变得可能,靠的是三件事同时就位:国产 GPU 集群把推理成本打下来;影视级素材加合成数据补足了"动作连贯"的短板;模型对"像"的理解,从像素对齐升级到语义理解。
2026 年这三件事第一次同时就位,视频生成才从实验室走到桌面。
04Sora 的光环还亮不亮:中美真实差距
必须承认,OpenAI 的 Sora 2 仍然强,尤其在长镜头世界模型理解和复杂指令遵循上领先。但"独孤求败"的状态结束了——中国模型在时长、分辨率上已经逼近,成本更是低出一个身位。
中美视频模型的差距,正在从"能不能"变成"贵不贵、快不快"。
05最危险的不是技术,是"眼见不再为实"
当任何人都能生成一段以假乱真的"某人说了某话"的视频,深度伪造就不再是间谍片里的情节:诈骗、谣言、操纵舆论的门槛被降到几乎为零。人类最古老的信任机制——"眼见为实"——开始失效。
当什么都能被生成,"亲眼所见"不再等于"真的发生过"。
06谁先被改写:广告、影视、电商
最先被改写的不是艺术家,是流水线上的重复劳动。一条 TVC 从几十万降到几千块,素材可以批量生成;影视用 AI 做预演、分镜甚至虚拟演员;电商的模特图和带货短视频,正在被一键批量生产。
最先被 AI 视频改写的,不是艺术家,是流水线上的重复劳动。
07普通人怎么自保:在造假自由的时代守住判断
监管已经在动。网信办《互联网信息服务深度合成管理规定》及 AI 生成合成内容标识办法,要求深度合成内容做显式或隐式标识。对个人来说,更实际的动作是:放慢转发,遇到"劲爆视频"先多源交叉验证,把"视频"当"说法"而不是"证据"。
未来的媒商,不只会看,更会问"这真的拍过吗"。
— 完 —
#AI视频生成#可灵即梦海螺Vidu#Sora2#深度伪造#WAIC2026
数据来源:网信办《互联网信息服务深度合成管理规定》及 AI 生成合成内容标识办法;WAIC 2026 各厂商发布;可灵/即梦/海螺 MiniMax/Vidu 官方技术文档与公开测评
· 关注「砚数」,获取更多 AI 与科技深度观察
热门跟贴