做一条播客宣传视频,通常要经历找素材、写脚本、配画面、对观点这几道工序。歸藏这次把流程压缩成了一步:给模型一个官网地址。

他用的是 Anthropic 的 Opus 5.5,配合自己开发的 guizang-product-video-skill,为播客节目 Next Token 制作了一支宣传视频。整个过程里,素材搜集环节没有人工介入——模型仅凭官网地址,就自动提取信息并生成了视频。

从链接到成片,中间没有人工搬运

这条工作流的特别之处在于素材来源。以往用大模型做视频,素材往往需要人先整理好、喂进去,模型负责的是后半段的组织与呈现。这次不一样,模型自己完成了前半段:从官网抓取信息,再据此生成视频内容。

歸藏把通用大模型的能力,通过自定义 Skill 固化成了针对视频生成的标准化流程。通用能力负责理解,Skill 负责把理解导向一个具体产出。两者叠加,专业视频制作的门槛被压低了。

模型还原了他自己都忘了的观点

真正让歸藏意外的,是内容层面的还原度。他提到,模型对风格、内容以及具体观点的把握极为精准,甚至唤醒了他自己遗忘的细节。

他的原话是,模型找出的那些观点、信息和内容太牛了,他自己都忘了说过这些。这句话指向的是一种上下文理解与内容重构能力——模型不只是把已有素材重新排列,而是从原始信息里识别出了哪些观点值得被放进视频。

他对模型风格与内容把握能力的评价很直接:真的牛批。

抽象观点如何变成视觉叙事

播客宣传视频的难点在于,播客本身是声音内容,观点散落在对话里,没有现成的画面可对应。把抽象观点转化为具体的视觉叙事,考验的是模型对内容的理解深度,而不只是模板套用。

歸藏描述的这次体验,模型表现出的水平超出了简单模板生成。它先理解内容,再决定怎么呈现,顺序没有颠倒。

对做内容的人来说,这条路径的价值在于:一个官网地址,加上一套自定义 Skill,就能跑完从素材到成片的链路。剩下的问题只是,这套流程能复用到多少种内容类型上。