260道题、四个领域、防作弊设计——AI编码智能体终于迎来了一场“真刀真枪”的大考 01 编码智能体评测,走到了一个尴尬的路口
2026年,AI编码智能体早已不是实验室里的玩具。从Claude Code到GPT-5.5,从DeepSeek到GLM,各家模型都在争相展示自己的“写代码”能力。但一个尴尬的问题始终悬而未决:我们到底该怎么公平地评测这些智能体?
过去,评测编码智能体的方式一直很割裂。修bug的看SWE-bench,做前端的看Design2Code,生产环境的基准又多半关着门不让外人审计。每一块都像一座孤岛,各测各的,谁也说不清一个智能体在真实工作中到底能打几分。
更麻烦的是“数据污染”——公开的基准测试题往往会被爬虫抓取、被模型记住。你今天考了80分,明天可能只是因为模型“背过”了这道题,而不是真的变强了。
7月23日,腾讯在arXiv上扔出了一颗“炸弹” ——WorkBuddy Bench,一套把代码、网页、办公、安全四个领域全部装进来的编码智能体评测套件。
02 260道题,四个考场
WorkBuddy Bench的规模不算大——总共260道任务,但覆盖的广度堪称前所未有。
四个子集分别是:
· 代码(Code) :80道题,仓库级软件工程。智能体被丢进一个真实项目的某个commit节点,需要在多个模块间定位并修改代码,最终通过隐藏测试。涵盖开发者、算法工程师、产品经理、QA、运维五种角色。
· 网页(Web) :70道题,前端开发。要求智能体生成、修改、分析前端页面,涉及交互、数据可视化、视觉设计等。
· 办公(Office) :50道题,多文件业务流程。智能体需要操作xlsx、csv、pdf、docx等混合格式文件,产出精确的制品。
· 安全(Security) :60道题,红蓝队攻防。智能体要发现并安全复现真实漏洞、分析恶意软件、探测自身攻击面。红队38题、蓝队22题,白盒审计锚定binutils、curl、nginx等真实CVE。
每个子集共享同一套任务目录格式,但各有独立的验证方式,分数不能在子集之间直接比较——腾讯干脆不报套件平均分。
03 最硬核的设计:从根上防“背答案”
WorkBuddy Bench真正让人眼前一亮的地方,不在于题多,而在于这些题从根上就防着“背答案”。
怎么做到的?
每个任务都不是从公开题库里改来的,而是从真实的代码提交、拉取请求或业务场景中“逆向工程”出来,再改写成简短、口语化、带角色扮演味道的请求。
举个例子:一个真实的bug修复commit,被拆解、重构、包装成一个看起来完全不同的任务提示词。智能体拿到的是一个“角色扮演”式的请求,而不是一段可以直接搜索到原始PR的文本。
你搜不到,自然就背不了。
更关键的是,WorkBuddy Bench的数据集是完全公开的——任务目录、环境镜像、评估工具、测试用例、参考方案全部开放。它的抗污染不靠“捂着题”,而靠这种构造方式加版本管理。
评测时,模型和沙箱分离,推理上下文给到200k,并禁用WebSearch与AskUserQuestion。关掉联网搜索,就是为了验证抗污染是不是真管用。
04 四个子集,四种打分逻辑
WorkBuddy Bench的评分方式也很有意思——每个子集用完全不同的逻辑打分:
· 代码类:按隐藏测试通过率打分,简单直接。
· 网页类:规则检查 + LLM/VLM评判 + 智能体评判三重校验,且必须交付声明路径上的制品、不连实时互联网。
· 办公类:确定性规则检查 + 基于证据的LLM评判,规则权重占0.70到0.95。
· 安全类:用确定性的scoring.py跑三次取平均,不用大模型当裁判。
安全子集还布了五层反作弊——禁字面量扫描、重命名输入、覆盖篡改测试、编码依赖、低权重诱饵。
任务构建走的是统一流水线:来源收集→改写成真实请求→组装工作空间→回合后隔离评估资产→独立目录打包,全程不碰用户数据。评分资产在智能体跑完之后才引入,它全程看不见。
05 谁在榜首?排行榜揭晓
WorkBuddy Bench附带了一份跨模型排行榜(0–100分,思考模式,三次平均)。
结果颇有看点:
· Claude Opus 4.8在代码、网页、办公、安全多数榜首通吃,拿下五个第一。
· GLM-5.2在安全子集两榜登顶。
· GPT-5.5摘得Office子集cc框架第一。
框架的敏感性也不小——安全子集重排最狠,平均绝对变动达8.6个点。Claude Opus 4.8在cc框架下拒答了13次,而GPT-5.5在cbc下只拒答2次。
效率方面,GPT-5.5输出token最少却分数不低,而DeepSeek-V4-Pro在代码任务上跑了44轮、出入token都高,显得更“费劲”。
06 谁在背后?腾讯三大实验室联手
这篇论文的署名阵容也透露了WorkBuddy Bench的分量。
它由腾讯优图实验室(Youtu Lab)、科恩安全实验室(Keen Security Lab)、Workbuddy团队与云鼎安全实验室(Yunding Security Lab) 合力完成。
优图实验室擅长计算机视觉,科恩安全实验室是全球顶尖的攻防安全团队,云鼎安全实验室专注云安全——视觉+安全+办公+AI,四股力量拧在一起,才端出了这个横跨四个领域的评测套件。
这不是某个团队的单打独斗,而是腾讯内部多实验室协同的一次集中输出。
07 局限与未来
团队在论文中也坦承了当前局限:
· 代码子集以Python为主,跨语言偏少;
· 开源发布本身带来被爬取污染的风险,得靠版本管理缓解;
· 评判器偏差尚未量化;
· 办公类偏文本,暂无OCR与GUI交互。
近期计划是校准网页评分、扩充公开榜单。
08 为什么这件事值得关注?
WorkBuddy Bench的发布,不只是又多了一个基准测试。
它标志着AI编码智能体评测正在从“单一维度、易作弊”走向“多领域、抗污染”。过去修bug的看SWE-bench、做前端的看Design2Code的局面,终于被打破了。
更重要的是,WorkBuddy Bench完全开源——任何人都可以在GitHub上拿到代码,从HuggingFace下载数据集,在本地Docker沙箱里复现评测。这种开放性让整个行业都能参与进来,共同推动编码智能体的进步。
而WorkBuddy Bench背后的WorkBuddy产品本身,2026年7月DAU已突破1300万,是国内用户活跃度最高的Agent办公产品。从产品到评测基准,腾讯正在编织一张从“干活”到“考试”的完整闭环。
当AI智能体越来越多地走进我们的日常工作,我们需要的不仅是一个能“聊天”的助手,更需要一把能准确衡量它“干活”能力的尺子。
WorkBuddy Bench,就是腾讯递出的这把尺子。
热门跟贴