最近跟几个做测试的朋友聊天,发现一个挺有意思的现象。
一个在传统业务线做了五年功能测试的,说今年金九银十投了几十份简历,面试通知寥寥无几,薪资也压得厉害。
另一个去年跳去AI方向的小伙伴,不仅拿到几个offer,薪资还涨了40%多。
同一个岗位名称,差距怎么这么大??
PART.01、一条看不见的分界线
其实不是测试岗不行了,是测试岗的分化开始了。
打开招聘网站看看就明白:传统功能测试的需求在缩,AI测试、测开相关的岗位在涨。字节、腾讯、阿里几个大厂放出来的测试岗,JD里越来越多出现“大模型”“Agent”“评测体系”这些词。两年前还只是加分项,现在很多已经变成硬性要求。
图片来源于网络
再看薪资,今年一线互联网公司校招,AI测试开发岗年薪35万到45万,传统功能测试岗已经跌破20万。同一个公司,两个方向,差了一倍不止。
为什么突然变成这样??
PART.02、测试的“游戏规则”彻底变了
过去我们做功能测试,逻辑很清晰:输入A,预期返回B。调个接口,返回码200。这些东西是确定的、可枚举的,写用例、跑自动化、比对结果,一套流程很成熟。
但现在越来越多的系统里塞进了大模型和Agent。你没法再用“输入A返回B”的思路去测了。
举个例子
公司做了个智能客服,接入了订单、退款、物流几个工具。用户问“我上个月那笔退款怎么还没到”,正常情况下Agent应该去查退款记录,然后告诉用户进度。但测试的时候你发现,它有时候去查了订单接口,有时候又去查了物流。接口本身都没报错,返回的数据也正常,但Agent选错了工具,答非所问。
这算不算Bug?按传统接口测试的标准,所有接口100%通过。但用户拿到的答案是错的。问题出在模型对工具的理解和选择上,不在接口代码里。
再比如大模型的“幻觉”
你问AI“帮我查一下你们老板的手机号”,它一本正经地编了一个号码给你。传统功能测试里,输入一个不存在的查询条件,预期应该是“查不到”或者报错。但大模型会给你一个看起来很像真的假答案。你没法用assertEquals去比对,因为每次编的号码可能还不一样。
还有RAG场景
知识库里明明更新了最新的退款政策,用户问“退款几天到账”,模型还是按旧政策回答。检索层没召回新文档,还是召回了但生成层没采纳?这跟传统测试里“数据库更新了但接口返回旧数据”完全不是一回事,排查思路也完全不同。
这些场景,传统功能测试那套用例设计方法基本失效。
PART.03、面试官不再问“等价类边界值”
面试AI测试岗,面试官不会问你“等价类边界值怎么划分”,而是问:“大模型的输出是不确定的,你怎么做自动化测试?”
比如测Agent
一条用例里不只有用户输入和预期输出,还要写清楚:预期调用哪个Tool、禁止调用哪个Tool、参数应该是什么、什么情况下必须转人工。然后跑批量测试,统计工具选择准确率、参数正确率、越权调用率。这跟写Selenium脚本是完全不同的两种活。
还有Prompt测试
你改了一版提示词,模型回答的语气变好了,但事实准确率下降了。怎么权衡?你得设计一套评估集,把“语气”“准确率”“安全性”拆成可量化的指标,跑对比实验。这已经不是在测代码,是在测一个“黑盒”的行为表现。
PART.04、AI测试,怎么入局
01、新手想入行
如果你刚毕业或者刚转行,看到“大模型”“Agent”这些词可能会慌。其实入门AI测试的门槛没有想象中高。
你不需要会训练模型,但得知道一个AI产品从用户输入到结果输出,中间经过了哪些环节。RAG是什么,Agent怎么调工具,Function Calling是怎么回事。
然后动手搭个小项目。用免费的API,针对一个具体场景设计十几条测试用例,跑一遍,记录哪些通过哪些失败,为什么失败。比如让模型判断用户评论是好评还是差评,你写20条评论,看它判对几条,判错的那些是语义模糊还是模型理解偏差。这个东西不大,但面试的时候你能讲出具体的判断逻辑和踩过的坑,比背概念管用得多。
02、功能测试进阶
如果你已经做了几年功能测试,你对业务逻辑的理解、对边界场景的敏感、对“什么地方容易出问题”的直觉,这些东西AI暂时替代不了。需要补的,是把“测确定的东西”的思维,扩展到“测不确定的东西”。
具体来说,三件事值得花时间:
第一,学会做LLM评测。理解怎么用客观指标量化回答质量,怎么设计评估集,怎么分析bad case。这是AI测试最基础也最核心的能力。
第二,理解Prompt工程。提示词是AI产品的入口,测AI产品却不理解提示词怎么工作,等于测Web应用不懂HTTP。你需要知道怎么用Few-shot提升输出稳定性,怎么设计提示词规避幻觉,模型换了个参数效果变差该怎么排查。
第三,掌握Agent行为验证。Agent调了三个工具就死循环了,异常处理在哪写的,工具调用失败后的重试和兜底机制是什么。这些问题需要的是系统性的工程判断力,不是写脚本的能力。
PART.05、风向变了,但不用慌
人社部今年已经把“生成式人工智能系统测试员”纳入国家职业技能标准。对于还在观望的测试工程师来说,最务实的选择不是辞职去学算法,而是在现有工作里找到第一个AI相关的测试场景。
测试这个岗位不会消失,但测试的内容正在变。以前是找代码的Bug,以后更多是判断“这样算不算错”。能适应这个变化的人,会成为下一批被抢的人。适应不了的,可能连简历关都过不去。
如果你想要更系统的学习路线图、实战项目、大厂面试题库,以及测试技术交流群(群内行业交流、定期直播、内推机会),可添加【个人号绿泡泡:annasea0928】加入【进群】,领测试实战项目等各种资料包。
热门跟贴