折腾了两天,终于通过一系列强约束,让 DeepSeek 也能生成 Opus-5.5 做的那种视频了。
▍先看三个案例 场景一:产品介绍视频
把产品源码给 AI,读源码、写脚本、生成解说、渲染视频,耗时 1 小时 40 分钟,消耗 384K tokens、38.5 积分,一轮直接搞定。
给的是我做可视化 PRD 的 Skill,旁白用了 Fish Audio 的 S2.1-Pro-free 文字转声音模型。
场景二:做概念科普视频
就丢给 WorkBuddy 一句话:帮我做一个介绍大模型推理生成原理的介绍视频。
耗时 1 小时 20 分钟,消耗 60 积分、324K tokens,中间 WorkBuddy 客户端卡死推出了,其他都没管。
输出的视频特效还是蛮有意思的,没让它做旁白,音效都是它自己代码生成的。
场景三:制作音乐 MV
这个是用 DeepSeek Harness 做的,用的也是 DeepSeek 模型,耗时 1 小时 1 分钟,消耗 529 K Tokens,全程一稿过。
生成的视频颜色差点意思,感觉脏脏的,不过动效、转场、卡点都非常不错。
它自己从 Huggingface 上下载了 Wishper 模型做的音乐歌词时间戳识别
▍原理拆解
这事,本质上是让 Agent 写有动效的网页代码,然后渲染成视频。
Opus-5.5 火之前,HeyGen 就开源过专门干这事得 Skill 套件 hyperframes。
理论上你用它做也能 7788 做出来,只是动效没那么好。
前面三个示例“花活儿”这么多是因为我给了 Agent 一些视觉要求,包括分层与错相、运动语言、缓动与曲线、光源材质细节之类的,一共大概 15 组。
然后让 Opus 帮我写一个 tokens 模版,一并丢给 DeepSeek。
某种意义上,就是“蒸馏”了 Opus-5.5 的能力,复制给 DeepSeek 用。
编辑好的AGENTS.md约束规范和设计规范tokens.ts,以及完整的教学教程,我已经更新在《WorkBuddy从入门到精通实战课》里了。
这套课程,第一期会陆续更新 30 个使用 WorkBuddy 的实战场景和配套 skills,后续会跟随产品更新及玩法涌现持续迭代增加。
如果你用 WorkBuddy 或者其他办公 Agent 总是拿不到可靠的交付,强烈推荐来看看~
热门跟贴