本期为TechBeat人工智能社区第793期线上Talk。

北京时间9月9日(周三) 20:00,上海交通大学博士生吴建宇的Talk将准时在TechBeat人工智能社区开播!

他与大家分享的主题是:DAPD - 如何消除策略自蒸馏中的信息不对称?届时他将从策略自蒸馏中的师生信息不对称出发,介绍 DAPD 的双路径锚定与双来源锚定,探讨如何缓解特权幻觉、匹配师生信息条件。

Talk·信息

主题:DAPD - 如何消除策略自蒸馏中的信息不对称?

嘉宾:上海交通大学·博士生- 吴建宇

时间:北京时间9月9日(周三) 20:00

地点:TechBeat人工智能社区

http://www.techbeat.net/

打开网易新闻 查看精彩图片

Talk·介绍

在策略自蒸馏中,教师常借助参考答案等特权信息提供更强监督,但学生在真实推理时无法访问这些信息,由此形成训练与部署之间的信息错位。本次分享将介绍 DAPD 如何通过双路径锚定与双来源锚定匹配师生信息条件,并展示该方法在多类任务和不同模型规模下的稳定增益。

Talk大纲

1. 背景

大模型后训练中的在策略蒸馏(OPD)与在策略自蒸馏(OPSD)

2. 现象与诊断

师生信息不对称及其引发的特权幻觉

3. 信息视图

None、Cross、Self 的逐步定义与 Self 桥接

4. DAPD 方法

双路径锚定(DPA)与双来源锚定(DSA)

5. 实验分析

跨任务、跨模型规模、消融实验与分布外迁移

6. 总结与未来

将信息匹配扩展到更多后训练场景

Talk·预习资料

打开网易新闻 查看精彩图片

[1] Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models 论文链接:https://arxiv.org/abs/2601.18734 代码链接:https://github.com/siyan-zhao/OPSD

打开网易新闻 查看精彩图片

[2] DAPD: Dual-Anchored Policy Distillation 论文链接:https://arxiv.org/abs/2608.01735

Talk·提问交流

在Talk界面下的【交流区】参与互动!留下你的打call和问题,和更多小伙伴们共同讨论,被讲者直接翻牌解答!

打开网易新闻 查看精彩图片

你的每一次贡献,我们都会给予你相应的i豆积分,还会有惊喜奖励哦!

Talk·嘉宾介绍

打开网易新闻 查看精彩图片

吴建宇

上海交通大学·博士生

吴建宇,上海交通大学人工智能学院博士生,师从欧阳万里教授,并在上海人工智能实验室开展研究。本科毕业于北京航空航天大学人工智能专业,曾获北京市优秀毕业生。研究聚焦大语言模型训练与生成式建模,主要关注模型高效化、科学推理与后训练,以及面向科学与工程问题的结构化生成。相关成果发表于ICML、NeurIPS、ICCV等国际会议。

打开网易新闻 查看精彩图片

5 位不同来路的具身创业研究者闭门聊天局

北京时间9月8日(周二) 晚20:00截止报名

详情点击图片跳转

9月28日晚@美国匹兹堡

「IROS 2026 群星闪耀 精英晚宴」

免费报名,期待线下见面!

北京时间9月25日(周五) 12:00截止报名

-The End-

打开网易新闻 查看精彩图片

如果你也想成为讲者

自荐 / 推荐

单人Talk | 团队专场 | 录播or直播 | 闭门交流
多种方式任你选择!
推荐讲者成功也有奖励哦~

关于TechBeat人工智能社区

TechBeat(www.techbeat.net)隶属于将门创投,是一个荟聚全球华人AI精英的成长社区。

我们希望为AI人才打造更专业的服务和体验,加速并陪伴其学习成长。

期待这里可以成为你学习AI前沿知识的高地,分享自己最新工作的沃土,在AI进阶之路上的升级打怪的根据地!

更多详细介绍>>