9月15日消息,生数科技近日正式发布Vidu S2,并于发布当天全量开放在线体验。此次共推出S2-Avatar和S2-Editing两款模型,分别面向持续交互数字角色生成和输入视频流实时编辑。

其中,S2-Avatar将实时输出分辨率提升至720P,并支持用户在互动过程中随时加入新的参考图,使生成角色能够持续响应新的指令和视觉信息。S2-Editing则针对持续输入的视频流进行实时编辑,可改变视频中的风格、服装、人物和背景等内容。

除实时生成和编辑外,Vidu S2还进一步探索空间视频能力。据介绍,模型可以将实时生成或实时编辑的视频转换为左右眼视频,并通过VR头显观看。例如,S2-Avatar生成的数字角色可以在持续互动过程中以空间视频形式呈现;现实世界的视频流也可以通过S2-Editing实时修改后,再转换为空间视频。

从能力演进来看,Vidu S2将视频模型从单次生成进一步扩展至对持续视频流的实时处理,覆盖实时生成、实时编辑以及空间视频等场景。

据介绍,Vidu S2全链路研发由朱军教授的博士生、生数科技流式视频生成与推理负责人张金涛负责。与部分实时交互模型采用申请体验或研究预览的方式不同,Vidu S2此次选择在发布后直接全量开放。

根据生数科技公布的技术报告,S2-Avatar在实时数字角色生成基准StreamAV-Bench的九项指标中,均取得报告所列对比模型的最优结果;S2-Editing在多项视频编辑基准测试中,总体得分也超过报告所列的离线及流式对比模型。(定西)