责编 | 梦依丹
出品 | CSDN(ID:CSDNnews)
一个 Agent,用的人越多,就会越聪明吗?
大家第一反应大概率会回答:是。原因是用得多,反馈就会越多,产生的数据和能拿来改进的素材就越多,进而 Agent 越来越强。
但真正做过 Agent 的团队都知道,现实却是另一回事——用户增长带来的不是进化素材,而是一堆无法直接拿来训练模型的日志。模型不会因为你每天跑几百万次任务,就自己悄悄变好。
这不是理论推演。
腾讯 WorkBuddy,正在用真实的千万级访问量验证这个问题。
11 月 20-21 日,WorkBuddy 模型研发负责人董汉德将在 2026 奇点智能技术大会上带来《LLM Agent 的模型数据飞轮——WorkBuddy 持续学习经验》分享,他会把这套被千万级使用验证过的「用户—数据—模型」飞轮,从模型到产品的完整链路,现场进行拆解。
Agent 进入普通人的日常
2026 年,办公 Agent 的竞争突然加速。
据易观分析发布的《2026 年 Q2 中国办公智能体平台市场洞察报告》显示:6 月国内 17 款主流桌面端 AI 原生办公智能体单月访问量已突破 6000 万次。其中腾讯 WorkBuddy 的 PC 端月访问量达 2097 万次,位居市场第一,超过第二、第三名访问量之和。
从 3 月上线到千万级月访问,WorkBuddy 的增长速度说明一件事:Agent 正在从少数极客尝鲜的 Demo 真正进入普通人的日常工作。
但对技术团队来说,比「有多少人在用」更值得关注的是当一个 Agent 每天开始处理海量真实任务,它会不会因为用户越来越多,而真正变得越来越聪明?
先说结论:数据多,不等于能直接训练模型
一次真实任务里,Agent 要面对真实的办公环境(网页、文件、代码库)做出反应,用户还会在中途介入、纠偏、确认。董汉德把这类数据概括为「Agent—环境—用户」的三方交互——它同时记录了真实世界的复杂性和人类高质量的干预信号,是比通用语料稀缺得多的素材。
所以,用户越多,Agent 不会自然变聪明。
真正的问题是:如何让「真实使用—数据产生—能力评估—模型优化—再次使用」转成持续运转的飞轮,让模型越用越强,而不是上线即巅峰。这正是 WorkBuddy 正在用心做的事。
WorkBuddy:先把"会不会真的干活"测准
要让真实数据反哺模型,前提是有一套可信的评估——不然筛进来的全是噪音。
今年 7 月,腾讯团队公开了 Tencent WorkBuddy Bench——把 Agent 放进 Code、Web、Office、Security 四类真实工作环境里测试,260 个任务全部逆向自真实代码提交、Pull Request 和业务场景,改写成口语化请求后连网上都搜不到原题。通过可执行环境验证 Agent 是否真的把活干完,而不是“ 看起来答对了。 ”
地址: https://arxiv.org/pdf/2607.20911
从 Benchmark 到真实用户任务,再到模型持续迭代,能看到一个明显的变化:Agent 的竞争,正在从 “ 第一次能不能把任务做出来 ”,进入“ 上线之后能不能持续变强 。”
飞轮怎么转:真实任务,反哺模型本身
评估只是入口。 真正的难点,按董汉德的说法,是"如何把 Agent 的经验数据转化为高效的训练信号"——数据本身不等于训练信号,中间还隔着筛选、归因、验证一整套工程,这也是目前行业内最具挑战的一环。
WorkBuddy 内部把它叫做"用户—数据—模型"飞轮,跑的是这样一条循环:
用户在 WorkBuddy 里下达真实任务——写方案、查资料、做表格、生成 PPT;
Agent 执行过程留下完整轨迹,包括状态观察、工具调用、错误修正;
用户在过程中介入、纠偏、确认——这个动作本身就是一条高价值信号;
这些轨迹经过筛选和标注,被转化为模型能高效吸收的训练信号;
再回灌到下一轮模型训练中;
新模型上线后,继续在真实任务里产生新数据。
转一圈,模型强一点,再转一圈,再强一点。
这条循环要成立,关键前提是模型团队和产品团队必须坐在一起。
至于这些数据具体怎么筛、信号怎么转化、效果怎么验证,正是董汉德要在这场分享里拆开讲的部分。
这条循环要成立,关键前提是模型团队和产品团队必须坐在一起。
WorkBuddy 的做法是 Co-design——腾讯自研混元模型在训练时就把 WorkBuddy 需要的 Agent 能力写进目标,WorkBuddy 跑出来的真实反馈再回灌下一轮训练。
据腾讯披露,与 WorkBuddy 深度协同设计的 Hy3 模型,幻觉率从 12.5% 降到 5.4%,WorkBuddy 任务解决率从 72% 提升到 90%,平均任务耗时下降 34%。
到了 8 月 28 日, 混元 Hy4 preview 发布(总参数 770B、激活 49B、上下文突破 1M),在 WorkBuddy 国内版、国际版首发接入,上线当天 API 排队用户一度超过 5000 人。为什么是 WorkBuddy 首发?因为 Hy4 不是为 “ 聊天 ” 设计的,是为 “ 干活 ” 设计的——最懂AI 干活需要什么 的团队,就是每天泡在真实任 务里的 WorkBuddy。
这场演讲,值得你带着问题来听
现在回头看开头那个问题——用户越多,Agent 就越聪明吗?
答案不在 PPT 里,而在 WorkBuddy 跑过的千万级真实任务里。董汉德这场分享最值得听的地方,不是 WorkBuddy 又加了什么功能,而是回到产品背后更底层的问题——当一个 Agent 开始承接千万级真实任务:
这些数据如何被识别、筛选和利用?
失败 Case 怎样进入评测和训练体系?
模型、数据、评测与产品体验之间,怎样形成一个真正能持续运转的闭环?
如何让 Agent 不再依赖一次次人工调 Prompt、补规则,而是具备真正的持续学习能力?
对于已经开始做 Agent 的团队,这些问题正在变得越来越现实。
因为未来真正拉开 Agent 产品差距的,可能不只是接入了哪个最强模型——更重要的是:运行半年之后,它有没有从真实业务里学到更多东西。
董汉德背后,是一个月访问超 2097 万次、每天在真实办公任务里产生数据的系统——他讲的每一个环节,都是被千万级使用验证过的。
从能用到越用越强,这条路上踩过的坑和验证过的解法。
关于奇点智能技术大会
2026 奇点智能技术大会由 CSDN 与奇点智能研究院联合举办,OpenAI 资深研究科学家、Transformer 八子之一的 Łukasz Kaiser 领衔,诚邀京东集团副总裁、京东探索研究院副院长段楠,新浪微博首席科学家及AI研发部负责人张俊林,面壁智能技术合伙人、智能进化首席科学家李宇轩,昆仑万维集团首席科学家、南洋理工大学讲席副教授成宇,观行数智创始人&CEO、全球前 2% 顶尖科学家唐都钰以及腾讯、阿里、百度、网易、上海人工智能实验室、高校与开源社区等 70+ 位一线技术专家共同参与。
18 大前沿专题、1000+ 行业精英,重点覆盖大模型与 Agent、AI 原生软件研发、AI Infra、世界模型、具身智能、Physical AI、企业级 AI 应用等方向。
此外,今年 C++ 及系统软件技术大会也将与奇点智能技术大会同期同址举行。上层 AI 应用的爆发,离不开底层系统软件的支撑,两条技术脉络将在同一个现场交汇,让参会者既能看到 AI 下一阶段的趋势,也能深入到真正影响工程落地的模型、数据、软件与基础设施。
对于正在做 Agent、AI Coding、企业级 AI 或基础设施的技术团队来说,这两天更重要的价值不是“听到更多概念”,而是和真正做过的人一起讨论:哪些方案已经跑进生产,哪些坑必须避开,以及下一阶段的技术投入究竟应该往哪里走。
2026 年 11 月 20—21 日,北京万达文华酒店,期待现场见。
「领取 2026 奇点智能技术大会全套 PPT 资料」
官方网站:www.ml-summit.org
购票热线:400-821-5876
购票咨询:service@boolan.com
企业合作:partner@boolan.com
演讲申请:hemiao@csdn.net
媒体联系:media@boolan.com
热门跟贴