当模型参数规模持续突破、推理成本不断下降、开源生态日益繁荣,一个更深层的问题正在浮现:当人人都能获得强大的模型能力,真正的竞争力究竟还剩下什么?行业给出的答案正在从模型能力本身,转向围绕模型构建可规模化的智能系统;从单点能力提升,转向系统工程与组织级落地能力。 在这一背景下,2026年AICon人工智能开发与应用大会·深圳站正式启动。大会将于8月21日至22日举办,聚焦AI基础设施、大模型系统、智能体工程、数据智能、多模态技术与行业落地等关键方向,邀请腾讯、阿里、华为、百度、蚂蚁集团等50余家头部科技企业技术负责人及科研机构一线专家,系统性分享前沿洞察与实战干货,共同探讨AI技术从能力到系统、从实验到生产的真实路径。 快手大模型应用算法专家邱慧已确认出席“大模型效率工程与Agent系统实践”专题,并发表题为《智能互动Agent在快手商业场景的落地实践》的主题分享。邱慧现任快手(杭州)AI互动方向负责人,全面负责AI Agent在快手电商场景的业务落地,曾成功主导快手电商智能客服从传统FAQ模式向生成式大模型的代际升级。在此之前,她就职于网易和蚂蚁集团,深耕智能客服算法与视频多模态内容理解领域,长期致力于多模态大模型及强化学习在大模型中的前沿应用,在ICLR、ACL、EMNLP等国际顶级学术会议上发表过多篇论文,毕业于哈尔滨工业大学。 本次分享以“高并发、高变化场景下的大模型高效推理”为主线,结合快手商业互动Agent的落地实践,探讨如何在真实业务约束下构建稳定、低成本、可规模化的商业Agent系统。分享内容直面多重业务痛点:高并发、低时延、强动态知识更新、算力成本多重约束并发。传统方案直接上线大模型,在时延、幻觉、成本上均遭遇瓶颈。核心矛盾可以概括为效果、时延与成本的不可能三角,这也正是效率工程需要解决的主线。 在动态知识更新方面,商品、优惠、库存信息往往秒级变化,离线索引更新滞后,幻觉风险高。邱慧团队提出将知识变更前移至推理阶段,实现实时注入,同时引入知识自裁机制:当多来源知识发生冲突时,基于来源优先级、更新时间和置信度进行可信度裁决,从而有效解决商业场景下的知识冲突问题。 在Agent自进化方面,开放动态商业环境下,固定策略长期运行容易失效退化。团队构建了用户模拟机制,基于历史交互轨迹构建离线模拟环境,支持策略预评估与失败案例挖掘;同时设计停滞检测机制,实时识别策略失效与环境漂移,触发自更新链路。由此形成“模拟评估→数据回流→策略更新→上线验证”的数据飞轮,避免Agent在动态环境中越用越退化。 在多轮对话归因方面,最终成交难以归因到历史关键对话动作,稀疏奖励导致优化方向偏移。团队引入自适应混合步度归因算法(Step-Aware Credit Assignment),结合中间过程信号(追问、点击、加购)与最终转化结果,将稀疏业务结果转化为细粒度可学习反馈信号,使模型优化方向更加准确。 从落地效果看,该方案已在生活服务、电商、商业化、直播等场景实现多场景覆盖,核心收益包括知识实时一致性提升、模型退化缓解、多轮转化归因改善。同时,多Agent协作框架可应对跨品类比价、组合优惠等复杂商业决策链路,个性化策略自适应能够基于用户消费偏好与决策风格实现Agent策略的个人级定制。 邱慧在分享中强调,商业Agent落地的核心矛盾是效果、时延与成本无法同时拉满。高效果依赖大模型和长上下文,高并发又要求低时延和低成本,两者天然对立。实践结论是放弃“一套链路解决所有问题”的思路。为了响应速度,经常需要使用小模型并关闭思考模式,但小模型在复杂场景下的效果损失不可忽视,如何提升小尺寸模型能力仍是持续投入的方向。与此同时,知识更新频率与推理成本之间的权衡、模型自更新的稳定性与收敛速度的博弈,都是在真实业务中反复遇到的取舍问题,没有一劳永逸的答案,只能在具体场景下持续调优。 本次分享为行业带来的核心启发是:效率工程的本质,是在系统整体层面找到最优平衡,而非追求每个环节的极致。对于关注大模型Agent落地的开发者与决策者而言,这不仅是一线实战经验的总结,更提供了理解效果、时延与成本三角博弈的应对思路,以及动态知识实时更新与知识冲突裁决的可迁移方法论。 2026年AICon深圳站将持续聚焦AI技术落地的真实路径,邀请更多一线专家分享系统工程与组织级落地能力的前沿思考,助力行业在Agent时代构建真正的竞争力。
热门跟贴