学术演示视频已成为研究传播的一个重要媒介,但制作这些视频仍然非常耗费劳动,通常需要数小时的幻灯片设计、录制和编辑,才能完成一个短短 2 到 10 分钟的视频。与自然视频不同,演示视频生成面临着独特的挑战:来自研究论文的长文本输入、密集的多模态信息(文本、图表、表格),以及需要协调多个对齐的通道,如幻灯片、字幕、语音和讲者。
基于此,Show Lab提出了Paper2Video,这是首个包含 101 篇研究论文与作者创建的演示视频、幻灯片和讲者元数据的基准数据集。基于此基础,提出了 PaperTalker,这是首个用于学术演示视频生成的多智能体框架。它通过创新的树形搜索视觉选择、光标定位、字幕生成、语音合成和讲述者渲染等技术,将幻灯片生成与有效的布局优化相结合,同时并行化幻灯片生成过程以提高效率。(链接在文章底部)
01 技术原理
Paper2Video 是一个高质量基准数据集,包含 101 篇论文、相关的演示视频、幻灯片和讲者元数据。每篇论文平均约 13.3K 字、44.7 张图表和 28.7 页,演示视频时长约 6 分 15 秒,最多可达 14 分钟。该数据集不仅用于视频生成,还评估需要整合文本、图表、幻灯片和口语演示的长周期任务。
基于Paper2Video,提出了PaperTalker。这是一个多智能体框架,旨在从学术论文自动生成演示视频。该流程包括四个模块:幻灯片构建器通过 LaTeX 代码生成和优化幻灯片;字幕构建器利用视觉语言模型生成字幕和视觉焦点提示;光标构建器将提示转化为光标坐标并同步解说;讲解者构建器通过 TTS 和讲解者头像模块生成个性化的讲解视频。
Paper2Video与Veo3以及人工自己制作视频进行对比。
学术演示视频的核心价值在于传递研究内容和增强学术影响力,而非单纯追求视觉质量,因此传统视频生成指标难以直接衡量其效果。高质量学术视频应兼顾观众和作者两个维度:既让观众理解论文核心内容,又突出作者贡献并提升学术可见度。
为此,引入了 Meta Similarity(视频内容与原论文之间的契合度)、PresentArena(视频在学术传播环境中的表现力和接受度)、PresentQuiz (检查观众是否真正理解了论文中的关键概念)和 IP Memory (确保观众能够识别作者是谁,他们的研究成果以及创新点)等定制化评价指标。
https://github.com/showlab/Paper2Video
https://arxiv.org/pdf/2510.05096
https://huggingface.co/datasets/ZaynZhu/Paper2Video
热门跟贴