作者 | AICon 全球人工智能开发与应用大会
策划 | Kimmy
编辑 | 宇琪
Agent 已成为 AI 应用发展的重要方向,从简单的信息问答走向代码生成、系统操作和业务流程执行。但当 Agent 进入真实业务环境,它需要理解复杂系统、调用各种工具、遵守业务规则,同时还要能被验证和持续优化。这就带来了一个新的工程问题:如何构建适合 Agent 工作的工程环境?
近日,InfoQ《极客有约》X AICon 直播栏目特别邀请阿里云技术专家张鑫、NoDesk AI CTO 王仿、腾讯高级后台开发工程师/项目组 Agent 落地负责人任磊达一起,在AICon全球人工智能开发与应用大会(https://aicon.infoq.cn/2026/shanghai/track)2026 深圳站即将召开之际,共同探讨 Agent Infra 从“可用”走向“高效可规模化”的关键路径。
部分精彩观点如下:
就像发动机马力不大的时候不需要方向盘和刹车,马力强了才需要配套安全防护。
Harness 不是消灭幻觉,而是用工程系统承接和约束不确定性。核心两点:让 Agent 做正确的事,以及正确地做事。可观测也很关键,只有观测到 Agent 的执行逻辑,才能从数据中学习它为什么错、错在哪,形成飞轮效应。
企业内部的数据、知识、系统都是给人构建的,现在要让数字员工上岗,首先要把给人看的上下文翻译成 Agent 能理解的语言,这就是本体论。
Agent 只会道歉,没办法背锅。专业性是人的核心价值,也就是判断力。
在 8 月 21-22 日将于深圳举办的 AICon 全球人工智能开发与应用大会 2026 深圳站上,我们特别设置了 【Harness Engineering:模型之外的智能体工程】 专题。该专题将邀请一线团队分享他们在构建、运行、演进 Agent Harness 过程中的真实经验与教训。
查看大会日程解锁更多精彩内容:https://aicon.infoq.cn/2026/shenzhen/track
以下内容基于直播速记整理,经 InfoQ 删减。
完整直播回放可查看:https://www.infoq.cn/video/4a2B42u4btbcGi6295ut
1 为什么需要 Harness Engineering?
张鑫:从大家目前的实践来看,Agent 当前最大的可靠性挑战是什么?为什么需要 Harness Engineering?
张鑫:Agent 当前最大的可靠性挑战,不应该简单归结于模型幻觉或推理能力不强。模型能力越来越强,但进到真实业务环境以后的失败,绝大部分发生在模型之外。比如 Agent 怎么知道正在操作哪些业务对象?对象是什么状态?跟别的对象有什么关系?有哪些可靠数据来源?可以执行哪些工具?执行完怎么确定达到了预期状态?如果这些问题没解决,换更强的模型也是盲人摸象,甚至会以非常专业、非常确定的语气告诉你任务完成了,实际上并没有。真正的挑战是怎样让 Agent 在持续变化的环境里,形成理解、行动、观察、验证的闭环。从我做 UnifiedModel 的角度出发,我更关注怎么样让 Agent 真正理解一个真实的业务系统——把业务对象的关系、状态和证据组织起来,而不是面对一堆零散的文档和数据。它需要的是一个可以被理解、被观测、被操作的系统世界。
王仿:今年大家都在讨论 Harness,背后说明模型能力确实越来越强了。就像发动机马力不大的时候不需要方向盘和刹车,马力强了才需要配套安全防护。Harness 本质上不是限制模型能力,而是让它在可控范围内发挥作用。实习生答错问题有人兜底,但正式员工真的把款退了或做了不可控操作,影响就非常大了。不光应用公司在做,OpenAI、Anthropic 也在做模型之上的 Harness 能力建设。
任磊达:最近争议比较大的 Fable,从技术角度看它有个很有意思的地方——把读写 KV 存储的能力加进去了,本质上是在吸收工程技巧到模型里。这其实是一个跟模型互利共生的关系:一方面从好模型里学怎么让成本更低的模型 work 起来,另一方面在尝试怎么驾驭模型。我昨天一不小心烧了七八亿 token,给我吐了四万行代码,就一个很小的模块,这就是典型 Harness 失控。Harness 从二三月份火起来后,一开始说得很虚,什么都像 Harness。真正接触多了之后,我的感觉是,Harness 包括 Loop,本质上是一个人机交互的工程:我怎么跟 Agent 交互?我要做什么?Agent 吐什么能让我满意?怎么让产出有正向 ROI?找到跟模型交互的协同模式,就是所谓的 Harness。
王仿:实践上,面向企业的 Harness 工程核心要解决几件事。一是上下文管理,在什么阶段注入什么上下文。二是跨系统集成,企业有 ERP、OA、WMS,要在可控环境里调用。三是 skill 调度,复杂场景下 skill 越多模型反而越差,因为经常调错。企业任务不是跑通一次就完了,是每天几百上千个任务要稳定执行。还有权限、可观测、评测体系,企业要发展,市场在变,怎么通过 Harness 让 AI 快速适应变化。
张鑫:Harness 不是消灭幻觉,而是用工程系统承接和约束不确定性。核心两点:让 Agent 做正确的事,以及正确地做事。可观测也很关键,只有观测到 Agent 的执行逻辑,才能从数据中学习它为什么错、错在哪,形成飞轮效应。
任磊达:Harness 在我理解里是两层:一层是架构层面,聚焦怎么做 Agent,包括可观测性等底层架构;另一层是用 Agent 的层面,更关注流程,人在什么时候接入,怎么促进飞轮转起来。这也是我下个月 AICon 上的分享的主题,在真正的研发流程中,人怎么接入。当架构更清晰之后,人在里面的效率会更高,产出也更稳定可控。
张鑫:任老师现在还在用 RAG 做专有领域的知识检索吗?
任磊达:RAG 本身也是 build agent 的一个过程。我们更多是用 Agent 去 build 业务逻辑和流程,在现有流程下把 Agent in loop 放进去。之前推 Tokenmaxxing 的时候要求 Agent 100% in loop,但这是不是最好的形态?人在什么时候进去?包括最近 OpenAI 很火的 RSI 模型自进化,当模型自己能进化了,人在里面的价值是什么?我们最后要维护什么、掌控什么?我们会更关注这些边界问题。
2 Agent 需要什么样的“工作环境”?
张鑫:如果把 Agent 看成一个新员工,企业过去提供给员工的是文档、系统、流程和权限。进入 Agent 时代,我们需要为 Agent 构建怎样的工作环境?
任磊达:我们要给 Agent 结构化的信息、正确的边界。一开始推 Tokenmaxxing 的时候让大家 100% all in AI,去搞清楚 AI 的边界到底在哪里。搞明白了之后才发现,有些事情让它做能提效,有些事情让它做它负不了责。边界的定义一定要从试错中产生,没有一两个生产事故,可能感受不到这个边界到底会影响到什么地方。
张鑫:适合 Agent 的工作环境至少解决四个问题,跟新员工进公司是一样的。第一,看得懂,理解系统里的业务对象、模块关系和代码是怎么组织的。第二,做得到,有没有足够清晰的 tool description 交给它去完成这些事。描述是有边界的,给太细了上下文会被撑爆,给太大了它理解的东西和你的会有偏差,又陷入幻觉,给到适中是一个很关键的设计权衡。第三,可证明,怎么证明改动没有出问题,这有点像 TDD,测试优先,夹具要提前写好。可观测能力要强,假设没有观测到,它可能就触发 P0 级别的 bug 和故障出来,到时候它只会说“对不起,这是我考虑不周”。第四,做不坏、能回滚,关键步骤一定要人参与。我们一个同事把所有权限开放给 Agent,Agent 直接把他根目录删了,然后去恢复系统。现在企业的问题通常不是没有数据或工具,而是工具和数据比较割裂,有的在 A 系统,工具在 B 系统,整个 loop 不起来。看到日志不知道跟哪些应用关联,看到告警不知道是不是做了变更。理想的工作环境不是一次性把信息塞给 Agent,而是围绕任务持续渐进式披露,交给它去正确地干事。
王仿:前面两位老师更多从 coding 角度讲,我从企业数字员工的角度来思考。比如做一个智能导购的数字员工,过去我们招一个人进来,有大量培训资料教他怎么用系统、怎么回复客户、依据什么标准。企业内部的数据、知识、系统都是给人构建的,现在要让数字员工上岗,首先要把给人看的上下文翻译成 Agent 能理解的语言,这就是本体论。这些有了,技术才入场。另一个维度是,coding 本身是封闭环境,有 IDE、编译器,浏览器操作、手机电脑操作都是封闭环境。大模型解决 agentic 能力就是从这几个大的封闭场景切入,把人在环境里做各种任务的语料定义出来去训模型。但企业本身也是一个环境,有它的系统、流程和知识,我们没法把这个环境训到模型里,只能通过 Harness 加大模型的方式来做。要把企业里的上下文和模型能力通过 Harness 结合起来,让它变得像今天写 vibe coding 这么爽。
任磊达:今年 ROI 特别明显的一个点是 SDD,先跟 Agent 把流程澄清清楚,澄清是 AI 跟我一起做的,直到足够清楚了再拆分成子任务或 DAG 图去执行。做完要 review,我们也在探索怎么跟 AI 共建 review。现在一个 MR 少则几百行,多则上万行,已超出人的思维负担,逼着每个环节都要调教 Agent 的协同能力。
3 为什么“更多数据”并不一定让 Agent 更可靠?
张鑫:企业拥有大量数据资产,但 Agent 仍可能无法正确理解业务。Agent 时代真正重要的是数据、知识,还是更高层次的语义和结构?
王仿:数据告诉你过去发生了什么,知识告诉你当前的客观业务事实,语义和结构告诉你它们之间的关系,基于这些,决策下一步该怎么行动?过去我们讲数据驱动业务发展,数据把人过去发生的事情定量地告诉人,人基于定量做定性分析,再用知识和语义结构去做下一步的策略和执行。另外数据多了可以去发现趋势、预估趋势,做更前置的准备。现在 Agent 落地阶段,首先解决知识和语义结构的问题,这在本体论里解决,再跟数据结合,让 Agent 能像人一样主动感知,而不是被动响应。第一阶段先被动的把事情做对做好,第二阶段像人一样主动去做事情。
张鑫:Agent 时代不是缺数据,而是数据太多了,多到注意力被分散。举个例子,半夜运维被电话叫起来,你问 Agent 发生了什么,它会用肯定的语气确定地告诉你“一定是某某某出问题了”。但实际上可能是别的业务方调大了阈值,流量大了,下游容量没扩导致 CPU 高。这些关联知识以前记在人脑子里,要靠本体论把它显化出来。现在的模型看见 CPU 高就说要扩容,看见日志出错就说代码有问题,缺少全局因果理解。这就是我们常说的,你后面调着调着就改不动了,它也改不动,因为上下文塞了太多没用的知识,导致它现在的注意力被分散了,就会词不达意,抓不到重点。不只是耗费 token,是越来越不可控。所以本体论在 Agent 时代是一个基础设施,而且是非常非常基础的东西,也就是用最精炼的语言描述系统能干什么。
任磊达:把本体论那套丢给 AI 生成很简单,但很多人不愿意做接下来的“脏活”——连接到别的数据,连接到更多的东西。怎么提高大家的主观能动性,让每个人都参与进来,对他那一块的领域知识进行迭代和演化,这很重要。还是我说的 human in loop 的角色比例问题,不是一个人把整个团队或公司的活都做完就结束了。
张鑫:数据、知识、语义三者,数据一直都有,工具也有,但要靠语义层把它们之间的内容和对象关联起来。本质上,本体论是在缩减你的上下文,用最精炼的语言去描述这个系统能干什么。
张鑫:RAG 只有数据没有结构。搜一个关键词搜出很多东西,全怼到上下文里就会崩掉。现在有 GraphRAG,带图的,本质上是从图的某一点出发不断探索关联,逃不开本体的图结构。
观众:现在在企业里面,是一个团队 agent,还是一个 agent 团队呢?
任磊达:企业追求的是确定性。“团队 agent”还是“agent 团队”,本质上是个组织架构问题,要服务于怎样能带来更大收益。如果由 agent 来指挥人,有一个长线问题——这个团队的长期发展方向和目标到底是什么?全由 agent 负责,我们敢不敢?而团队去指挥 agent 更务实,类似于之前的工作流,是一个更确定的组织形态。
张鑫:人更多是提供判断力。Agent 什么活都能干,但唯独缺判断力。它在我现在看来就是一个工具,可以增加人效,以前一天干一个活,现在拆成十个 Agent 去干不同的活。但这里面对人的消耗也非常巨大,人会在里面疯狂做上下文切换。
观众:用户输入命中多个 tool 时,怎么确认执行顺序是正确的?
王仿:第一,做上下文隔离,把任务拆成不同阶段,每个阶段隔离对应的 skill 和工具,不能把整个企业知识全挂给它说“你自己查”,这样出错的概率很高。第二,通过反馈学习,记录每个工具的执行成功率、token 消耗、成本,做 ranking 选择。复杂场景下查同一数据可能从 ERP 能拿到,从 WMS 也能拿到,到底哪个系统稳定性更好?要靠反馈学习判断。第三是 Agent runtime 要强,Codex 和 Claude Code 体验好,就是因为 Plan、执行、校验、Loop 这套闭环强,通过 multi-agent 协作,有的做规划、有的执行、有的校验,边界给清楚了,准确率就比较有保障。
张鑫:Tool 是持续迭代的东西。现在用 A tool 和 B tool 都能达到同样目标,但到底哪个执行效率更好?后面要在流程里持续优化,写进知识库,工具才能越用越好,越用越懂你。
4 Agent 的执行能力应该如何被工程化?
张鑫:当 Agent 从回答问题走向执行任务,它需要调用工具、拆解任务、处理异常。一个可靠的 Agent 执行系统应该具备哪些核心能力?
任磊达:今年 SDD 和 goal 都在做同一件事:反复明确 Agent 当前在干什么、上下文关系是什么。概率性的串行叠加会导致失败率指数级倍增,所以要不断提醒它:你在做什么?目标是什么?你在哪一步?聚焦在你的背景上。
王仿:被客户 CTO 挑战最多的就是这个问题。可靠 Agent 需具备几个核心能力。一是状态管理,任务能挂起、能恢复、能重试。二是执行结果校验,返回结果是否符合预期 schema?核心字段缺失怎么处理?没有感知就继续执行会产生大量不可控问题。三是异常恢复和回滚,任务做到一半发现前面有问题,能不能回滚到某个阶段?怎么恢复现场?四是可观测性,要有日志、有看板,人随时能看到发生了什么、背后的原因是什么。这些东西有了,CTO 心里才踏实。不然 demo 很好看,一上线全是不稳定问题。
张鑫:核心就是让你的 Agent 获取别人的信任。跟人一样干活踏实,老板要能看到在干什么,不能老板让你干 A 你去干 B。出了问题能兜底,不能只会道歉。一个是“怎么想”,Agent thinking 要能正确思考,要靠本体论帮它对全局有把控,不会钻牛角尖只钻到一个点上。另一个是工具的契约,工具要能清晰地定义入参是什么、出参是什么,参数怎么校验,能解决什么问题、在什么条件下完成。这些东西在 skill 或 tool description 里一定要清晰明确地告诉它,这样才能正确地去理解和调用。还有一个兜底能力——可靠的 runtime,能重试、能回滚,删文件之前 backup 一下,至少能回退到某个点。最后是可观测,人对 Agent 的执行看不到摸不着就会很慌,至少要有日志,一步步告诉你做了什么、结果是什么。但这些数据不只让人安心,还能成为未来优化流程和 skill 的基础数据,通过数据去 loop,让 Agent 越做越好。
观众:人类员工和 Agent 哪个更有性价比?
王仿:企业对 Agent 的诉求就是降本提效和增长。人力密集型如客服,中国电商客服几百万。知识密集型如程序员,中国有几百万程序员,培养一个好程序员门槛很高。程序员既是人力密集型又是知识密集型,所以 AI 落地第一个奔着程序员来。但今天看,程序员也没有被替换掉,人还是有不可替代性和稀缺性。至于增长,现在在企业落地里不是那么好论证价值,但我认为 Agent 可能比人有更强的大局观和串联能力。我给一家国内头部保险公司做 workshop,他们 60 多万销售人员,非常庞大的 HR 团队、培训团队、业务团队。你会发现所有团队的目标都不一样,HR 只说我招了多少人,业务招的人合不合适他不 care;培训天天做各种培训,对转化率、市场需求的动态捕捉没有感知;用人团队就逼着大家按流程拜访,所有人都是割裂的。Agent 的价值就在于,让所有人动态感知今天客户市场发生什么变化、人的能力短板在哪,马上给培训部门反馈,培训部门对应生成内容和方法去做培训,把所有人的目标拉到一个方向上。
张鑫:Agent 只会道歉,没办法背锅。专业性是人的核心价值,也就是判断力。在已有的知识体系上你战胜不了 Agent,你要用好这个工具。两者在不同维度,缺一不可。
王仿:尊重人的专业性非常重要。我们聊了很多品牌,哪怕一个包材审核,知识量也非常大,有几十个维度要审核。所有做得好的企业,哪怕很小的部门背后都有一堆 know-how。好企业之所以能成为品牌,是因为他们把东西做到了极致。
5 如何让 Agent 保持自主,同时又保持可控?
张鑫:Agent 最大的价值在于自主性,但企业最大的担忧也是不可控。当 Agent 拥有越来越多权限和工具时,工程团队应该如何设计它的边界?
任磊达:coding agent 今年火的一个原因,就是代码编出来是可控的、实实在在运行的,没有概率性。把不可控变成可控,用可控的东西去执行,这是企业的常见做法。
王仿:自主性的边界设定,取决于任务的风险等级。高风险一定要有非常严格的校验审核,大量还是需要人做兜底。比如做策略分析,以前要查很多资料、搜很多视频才能形成报告,现在 Agent 帮你查、生成报告,人来决策哪些点要补充、哪些要完善,既给了自主性又不失人的专业性。再比如医疗影像诊断,AI 看片子写诊断结果确实比大部分普通人强得多,但最终结果谁负责?还是医生,因为一旦出问题影响面太高了。我们解决自主和可控的 balance,一般分三阶段:第一阶段影子系统,一个 SKU 让 Agent 做分析和创意但人不执行,人该怎么干怎么干,然后对比人的策略和 AI 策略,离线评估 gap 有多大。差异小了进入第二阶段 copilot 模式,模型出、人做确认,这已经在提效了。第三阶段半自动驾驶,低风险的让它全自动干,不需要人确认,核心节点人确认一下。通过这套工程方法保证落地不失控、能提效、能拿到结果。
张鑫:自主和可控不矛盾,是在可控范围内让它自主,你只有让它在可控范围之内,它才不会给你拉出什么幺蛾子。几个维度:数据权限很多人容易忽略,不能让没权限的人通过 Agent 看到不该看的数据,比如底层员工看到公司财务数据,这是非常恐怖的。权限应该一点一点放开,跟人一样,开始进到公司可能啥权限没有,就一个克隆权限,随着职位越来越高权限越来越大。Agent 后面一定有自主的知识库,知识库就是在告诉 Agent 怎么样正确干事情,你遵循这个东西我才能够给你更大权限,否则永远进不来,这也是 Agent 进化的关键。最后是可观测加告警,高危操作必须感知到。
6 Agent 时代的软件质量体系会发生什么变化?
张鑫:当 Agent 可以参与代码生成、测试甚至需求分析时,传统软件工程流程会发生怎样的变化?未来需要验证的是代码质量,还是 Agent 工作流质量?
任磊达:验证成本已经是开发成本的两三倍了,有点像去年 MCP 很火的时候,要先想办法能验证,再想办法验什么,想办法控制验证本身的成本。
张鑫:Agent 出来后本来程序员应该最开心,结果我越来越忙,都在给 Agent 擦屁股。关于怎么把质量固定下来,我从微积分里想到一个思路——不断缩小、最后加到一起,就能算出整个弧度。本质上我们也是在做这件事。以 Coding 为例,夹具越多越好,横向业务代码的夹具保证不出边界,纵向从架构师角度评估业务性能,测试要提前想好哪些东西需要测。说到底,Agent 是上层应用的狂欢,对底层提升微乎其微,它能帮你快速生成各个方向做快速验证取最好结果,但仅此而已。
王仿:传统代码质量和今天可能是两套体系。传统程序员一天 500 行算很不错,vibe coding 一天可能几万行,速度确实快了。但千行代码 bug 率,人写代码大概在千五到千八,vibe coding 大概在 3.5,明显更高。另一个问题是怎么修复 bug,传统开发中所有代码都是人写的,都在脑子里边,资深程序员一看就知道问题在哪,修复很快而且很少引入新 bug。但 vibe coding 改一个 bug 会不会衍生出其他 bug?这个 bug 怎么去收敛?还有商业生产系统是持续演进的,淘宝初期不是现在这个样子,是一步步演化出来的,要不断删功能加功能,vibe coding 怎么做到架构设计足够通用,能快速加功能而不引起其他模块崩坏?现在没有解法。目前两个共识:一是做 demo 确实快了,验证原型快了;二是做前端确实很强了。但复杂的后端,大家都很谨慎。
Agent 质量又是另一个命题。Agent 没有一个放之四海的质量衡量共识,基本是一个场景一个场景论证,不同场景要构造不同的评测集和语料。首先要看完成度,其次看大规模语料上了产线能否稳定执行,不是一会儿好一会儿坏。我们做客服的经验是,采纳率能做到 90%,剩下 10% 的 bad case 分析下来,90% 不是模型问题,是给它的支持不全,优惠条件变了不知道,新活动不知道,边界规则没讲清楚,靠人口口相传没反映到系统里。Agent 质量收敛是比较复杂、比较慢的过程,大家要保持耐心,持续打磨。
7 未来的软件工程师需要重新学习什么?
张鑫:当 Agent 成为软件开发和业务执行的重要参与者,未来工程师的核心能力会发生怎样的变化?哪些能力会变得更加重要?
任磊达:AI 今年发展特别快,三个月前的东西如果你没学,可能现在就不用学了。快速学习、快速迭代能力特别重要。刚刚我们一直在聊 AI 和人类员工的价值,已经比到这个地步了,不是 AI 和工程师的价值,而是只要是人类愿意去背锅、去负责、去演进迭代的,这样的人会比较吃香。
张鑫:抛开知识不谈,Agent 记得比你多多了。软实力有两点,第一是审美,你对事物有自主的看法和判断力。为什么不同人用同一 Agent,效率完全不同?因为审美在线的人能通过抽象能力写出高内聚、不出问题的模块,模块之间耦合得很好,产物就不会不可控。第二是批判,Agent 学的是以前的知识,本质上是一个 token 生成器,预测你下一个词是什么,但自己并不理解。有时候它会拿着错误的数据跟你瞎说。人有时候会有惰性,都已经生成了,我看看大差不差,八九不离十吧。但严肃场景不行,你要对它生成的东西做批判,去思考这个结论到底对不对,才能产出更优质的输出。硬实力层面,Agent 知识迭代极快,可能这个月很流行,下个月就不流行了,学习能力要非常强。还有一些基础能力,比如怎么评估 Agent、评估的方法论,不管你用什么工具都离不开。
观众:本体论构建应该先看手头数据,还是先看场景解决什么问题?
王仿:不建议从公司全局出发建本体体系,周期长、投入大、价值难论证。更建议 for 具体业务场景,做客服导购就做客服导购的本体论,做供应商审核就做供应商审核的本体论。脱离业务场景做出来大而全的东西,模型还是理解不了。
张鑫:先明确要解决什么问题,再构建这个领域里的模型,在模型里定义工具、关联数据集,让 Agent 高效解决问题。
今天我们讨论 Harness Engineering,本质是在讨论一个新的工程范式:未来我们不仅需要训练更强的模型,也需要构建让模型可靠工作的环境。从 Context 到 Runtime,再到 Quality Loop,Agent 的能力只有被工程体系承载,才能真正进入复杂场景。
会议推荐
2026 年 AICon 人工智能开发与应用大会 · 深圳站(https://aicon.infoq.cn/2026/shenzhen/track)将于8 月 21 日—22 日举办,聚焦 AI 基础设施、大模型系统、智能体工程、数据智能、多模态技术与行业落地等关键方向,邀请来自腾讯、阿里、华为、百度、蚂蚁集团等 50 + 头部科技企业技术负责人、科研机构一线专家,系统性分享前沿洞察与实战干货,共同探讨 AI 技术从能力到系统、从实验到生产的真实路径。限时 9 折专属优惠,现在报名立减 580,更多详情可扫码或联系票务经理 13269078023 进行咨询。
热门跟贴