打开网易新闻 查看精彩图片

QECon全球软件质量效能大会技术专场上,众多测试架构师对Agent测试展开深度探讨。当下大模型与多智能体热度高涨,不少Demo可通过一句话生成自动化脚本。但回到企业真实研发环境,大量团队陷入困境:脚本生成效果出色,执行却频繁报错;大模型幻觉难以规避,测试资产无法复用,大量AI测试项目止步POC验证。技术团队需要回答:落地AI测试不能只看脚本生成,究竟要补齐哪些工程能力,才能实现规模化推广。

当前AI测试行业存在明显割裂:上层大模型生成能力迭代迅速,但执行、异常处理、资产沉淀等工程短板被忽视。不少团队引入单点脚本生成工具后发现,脚本产出快,但本身十分脆弱,遇到弹窗、页面变更极易失败,依旧需要工程师大量调试修改。大模型擅长内容生成,却不擅长稳定执行。单纯依靠大模型包揽全部测试任务,会面临推理成本高、结果不可控的现实障碍。AI测试工程化,必须打通需求解析、用例生成、智能执行、故障诊断、资产沉淀完整链路。

传统自动化的固有痛点,不会因为AI生成脚本就自动消除。脚本过度依赖控件定位,页面微小改动就造成失效,维护占据工程师60%以上工时;网络抖动、弹窗、加载超时都要手动编写大量异常分支,故障人工定位平均耗时30分钟以上。历史用例、缺陷经验难以沉淀复用。市面上很多AI工具只完成脚本生成,缺少配套执行、自愈、诊断能力,产出脚本可读性差,属于一次性临时脚本,无法沉淀为企业长期可用的测试资产。只解决脚本编写效率,无法真正解决工程测试难题。

Agent测试工程核心思路:意图规划交给大模型,稳定执行交给专用引擎,多智能体解耦任务,RAG抑制大模型幻觉,VLM完成界面感知。Testin XAgent采用四层架构:数据层管理用例、缺陷、私有文档与真机资产;AI能力层包含领域微调模型、VLM视觉模型、Agent集群与RAG知识库;应用层实现智能生成、脚本自愈、错误诊断、质量报告;访问层提供一体化测试管理平台。

三类专项Agent分工协作:生成Agent依托RAG检索历史资产,两阶段意图规划,脚本

生成耗时从1小时/条缩短至20分钟/条;自愈Agent融合OCRVLM视觉算法,摆脱控件绑定,自动处理各类页面扰动,脚本稳定性由70%提升至95%以上,自愈经验反哺知识库;错误诊断Agent解析截图、录屏、崩溃日志,自动定位故障输出修复建议,定位时间压缩至5分钟。依托RAG知识库与语法对齐模型,注入企业私有业务知识,同时将Agent指令转化为规范可维护脚本,规避一次性临时脚本。技术路线对比,海外方案侧重大模型直接执行,国产化适配不足;国内部分工具只做单点生成,XAgent实现端到端全链路工程闭环。

行业调研显示,AI测试POC中脚本生成指标普遍亮眼,但半数以上项目卡在执行稳定性、资产可维护性两大关卡,无法全业务复制。工程落地看重真实迭代环境下综合表现,而非Demo效果。XAgent落地多项业务,测试设计速度提升85%,关键业务场景覆盖率提升300%,脚本维护人力成本降低30%,自动化一次性通过率提升25%,API案例生成采纳率87%。平台提供半托管AI辅助、全托管无人冒烟回归两种模式。敏捷项目将平台作为质量门禁接入CI流程,AI承担冒烟测试,工程师专注复杂边界场景;信创项目借助1400+云端设备池完成多系统兼容测试。实践证明AI是有力助手,复杂业务校验依旧离不开人工审核。

AI测试的核心竞争并不取决于大模型参数规模,真正拉开差距的是工程落地能力。Demo只需跑通理想化场景,企业级测试系统则必须接纳网络抖动、页面迭代、机型差异化等复杂现实生产环境。Agent时代,测试工程师重心正在转移:从重复编写调试脚本,转向测试意图设计、风险策略制定、知识库治理、AI结果审核。行业所说的“无人测试”,不是淘汰测试人员,而是测试执行主体转向智能体,人升级为质量策略设计者。企业落地AI测试切忌追逐表面演示效果,补齐完整工程能力,才能释放AI测试真正业务价值。