本期为TechBeat人工智能社区第793期线上Talk。
北京时间9月9日(周三) 20:00,上海交通大学博士生吴建宇的Talk将准时在TechBeat人工智能社区开播!
他与大家分享的主题是:DAPD - 如何消除策略自蒸馏中的信息不对称?届时他将从策略自蒸馏中的师生信息不对称出发,介绍 DAPD 的双路径锚定与双来源锚定,探讨如何缓解特权幻觉、匹配师生信息条件。
Talk·信息
主题:DAPD - 如何消除策略自蒸馏中的信息不对称?
时间:北京时间9月9日(周三) 20:00
地点:TechBeat人工智能社区
http://www.techbeat.net/
Talk·介绍
在策略自蒸馏中,教师常借助参考答案等特权信息提供更强监督,但学生在真实推理时无法访问这些信息,由此形成训练与部署之间的信息错位。本次分享将介绍 DAPD 如何通过双路径锚定与双来源锚定匹配师生信息条件,并展示该方法在多类任务和不同模型规模下的稳定增益。
Talk大纲
1. 背景
大模型后训练中的在策略蒸馏(OPD)与在策略自蒸馏(OPSD)
2. 现象与诊断
师生信息不对称及其引发的特权幻觉
3. 信息视图
None、Cross、Self 的逐步定义与 Self 桥接
4. DAPD 方法
双路径锚定(DPA)与双来源锚定(DSA)
5. 实验分析
跨任务、跨模型规模、消融实验与分布外迁移
6. 总结与未来
将信息匹配扩展到更多后训练场景
Talk·预习资料
[1] Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models 论文链接:https://arxiv.org/abs/2601.18734 代码链接:https://github.com/siyan-zhao/OPSD
[2] DAPD: Dual-Anchored Policy Distillation 论文链接:https://arxiv.org/abs/2608.01735
Talk·提问交流
在Talk界面下的【交流区】参与互动!留下你的打call和问题,和更多小伙伴们共同讨论,被讲者直接翻牌解答!
你的每一次贡献,我们都会给予你相应的i豆积分,还会有惊喜奖励哦!
Talk·嘉宾介绍
吴建宇
上海交通大学·博士生
吴建宇,上海交通大学人工智能学院博士生,师从欧阳万里教授,并在上海人工智能实验室开展研究。本科毕业于北京航空航天大学人工智能专业,曾获北京市优秀毕业生。研究聚焦大语言模型训练与生成式建模,主要关注模型高效化、科学推理与后训练,以及面向科学与工程问题的结构化生成。相关成果发表于ICML、NeurIPS、ICCV等国际会议。
5 位不同来路的具身创业研究者闭门聊天局
北京时间9月8日(周二) 晚20:00截止报名
详情点击图片跳转
9月28日晚@美国匹兹堡
「IROS 2026 群星闪耀 精英晚宴」
免费报名,期待线下见面!
北京时间9月25日(周五) 12:00截止报名
-The End-
如果你也想成为讲者
自荐 / 推荐
单人Talk | 团队专场 | 录播or直播 | 闭门交流
多种方式任你选择!
推荐讲者成功也有奖励哦~
关于TechBeat人工智能社区
TechBeat(www.techbeat.net)隶属于将门创投,是一个荟聚全球华人AI精英的成长社区。
我们希望为AI人才打造更专业的服务和体验,加速并陪伴其学习成长。
期待这里可以成为你学习AI前沿知识的高地,分享自己最新工作的沃土,在AI进阶之路上的升级打怪的根据地!
更多详细介绍>>
热门跟贴