「严肃解读」
打开网易新闻 查看精彩图片
「严肃解读」

懂模帝Bench黑客松是一个在网吧举行的严肃活动。

严肃在于,选手们在国窖畅饮(Man!)、豆汁爽喝之余,还真的做出了30个Bench,确实评测出了模型的优缺点。

两天下来,我的主要感觉是,人民群众的创意太丰富,反衬出目前主流Bench的匮乏。

后者成天折腾GitHub上的编程数据和越来越离谱的长程任务环境,对于非编程领域的能力是极度忽视的。

这其实说明懂模帝的思路有价值,让普通人来定义模型能力。Bench黑客松现场就没人做传统的主流的编程Bench,大伙都发挥了自己的创意。

有好几个模拟经营类考验模型综合智力的Bench。比如北漂模拟器、偶像出道模拟器、港股打新模拟器、洛杉矶急救调度员Bench。

也有测试环境设置得清新脱俗的Bench,一听就没有被模型厂训进模型里的。比如用网吧真实环境来测试模型的渗透能力,导致最后网吧电脑全黑了。

还有律师让大模型写脚本在无网环境中运行筛查政府合同,因为他的真实工作场景很多时候就是无网的。

那个拿网吧4080本地部署Qwen小模型的家人,还整了一个Windows PowerShell Bench,测试模型在Win系统的脚本能力,誓要为AI时代的二等操作系统发声!

还有一类就是垂直领域Bench,用自己专业的数据集,考验模型的非编程能力。比如,考验模型物理模拟能力的PhysicalAI Bench;医疗器械立项决策 Bench,作者是药企员工。

上周沐秋已经回顾了网吧活动盛况。今天让我们再来回顾一下,Bench黑客松上测评出了哪些模型的哪些问题。我会着重解释其中三道Bench。

01

嵌入式底层驱动开发能力Bench

第一个Bench是嵌入式底层驱动开发能力Bench。

这个Bench主要测试方法是给模型一个芯片外设手册和一块虚拟开发板,让它自己写驱动、读写寄存器、编译运行、处理中断/超时/异常。

这个Bench的作者仙五是是做嵌入式软件的,他们公司要开发芯片,而他的工作是做芯片上的软件。所以前端调试工具几乎可以 100% 交给 AI 写,但嵌入式驱动让 Agent 跑三次会出现三种不同错误。

所以他从自己的真实经历出发,给模型出了两个题、一个是特殊条件下的概率性数据传输卡死。

第一道题是,给一个数据变换加速器写 3 个接口,初始化、执行操作、软复位,要求模型处理 MMIO 寄存器、错误码、状态机和有界等待,设置的陷阱是INIT_KEY 文档缺失,然后初始化偶发失败。

第二道题是给内存到内存 DMA 写 5 个接口:初始化、发起搬移、等待完成、中止和 ISR。HAL 要求任意合法长度、任意源/目标缓冲都可靠完成,且等待必须有上界。核心硬件有短搬移不发中断、流量门槛后的罕见永久卡死的缺陷。

Qwen3.8-Max的功能完成度最高,测试和逆向最深。在两道题的表现都是第一,展现了模型极强的系统级 Agent 能力:能读手册、逆向外设、搭测试、定位平台问题、连续修复直到闭环。

DeepSeek的简单题全部通过,但在复杂 DMA 场景暴露写了但没实际接通的问题,静态读代码和常规轮询能完成,结果到真实状态机闭环就断了。

Opus 5.0的代码质量和实验报告最好,但理解问题没有等于修好问题——Opus 5.0的理解能力真的是当之无愧的最强模型。在隐藏压力场景 S5 失败:40 轮里有 5 次初始化失败、15 次操作失败,说明重试上限或恢复链条不够稳定。

GPT把两个任务都跑通了,偶发失败能解决,但属于静默修复,质量只有 11。只有SD3失败 ,但主要是参数、错误契约没有精确满足。归档运行约 4 次,测试量明显少于 Qwen/Opus。

打开网易新闻 查看精彩图片

不过,仙五最后也说,实际工作里的说明手册常有上千页,USB 相关材料会大到百万上下文放不下,所以这两题仅仅只是玩具级别的。他后续会把工作场景遇到的实际问题转化成题目。

02

物理理解Bench

第二个Bench是一位具身的选手张振尧提供的,他做了个考验模型物理能力的Bench,题目包括无人机巡逻路径、机械臂抓取、静摩擦破冰、击拆48块积木塔、水流驱动水车、限速切割弹性体和布料覆盖球体,核心检验模型理解世界的能力。

无人机巡航是Qwen独占的能力点。 它后两轮都完成了全部航点,RMS轨迹误差约 0.16 米。虽然首轮仍然坠毁。其余四个模型三轮全部坠毁或控制发散,连一个航点都没稳定通过。

这说明 Qwen 真正构造出了可用的闭环飞控,直接起飞✈️

材质抓取题K3完成得最好, 金属、易碎泡沫、冰块三种物体,三轮都是 3/3 完成抬起、保持、放置,且无压碎、无滑落。

吸盘搬运是GPT完胜。 三轮终点误差 2.7–2.9 厘米,全部无掉落,是唯一稳定满分。DeepSeek 第一轮掉落,后两轮把误差压到 0.5 厘米,恢复能力还不错。

切割题中,Qwen、GPT、DeepSeek 都是稳定满分,每轮都达到约 0.35 米切深且不超速,GPT 峰值速度约 0.313m/s,K3 首轮有 86/280 帧触碰超速线,后两轮完成但只有 90 分。

布料题目则没有模型真正稳定攻克,目标覆盖率是 80%。DeepSeek靠首轮约 75% 的覆盖拿到最高题均分 70.5,但后两轮掉到约 59%和63%;Qwen三轮都在约61%—64%,相对稳定但没有进步;GPT、K3最后都收敛到约63%。

最终评分是这样:

打开网易新闻 查看精彩图片

Qwen的分数是最高的,是唯一能飞无人机,切割满分、击塔稳定,短板是吸盘安全和流体题,且无人机/抓取仍有较大轮次波动。

K3的物理直觉强,交付纪律弱。 材质抓取第一,水轮第二梯队,摩擦满分;但击塔两次空输出、切割首轮超速、无人机全坠毁,所以能力上限与最终总分差距很大;

Claude则是恢复和流体能力突出,但首轮可靠性最差。 水轮第一,布料后两轮接近最好,摩擦/切割也能在重生成后满分;问题是多题首轮代码、边界或执行失败,五题标准差超过20,现阶段不能当稳定交付模型。

但其实从这个Bench你就可以看出,没有哪家模型在物理场景是全知全能的,现在那些扯物理模型的祝他们好运吧。

03

破壁者Bench

不难看出破壁者Bench的灵感源于《三体》。

打开网易新闻 查看精彩图片

作者做这个Bench的原因是,他认为目前整个 AI 的发展路径和「智子」类似,在不断增加多模态输入(从文本、语音到视频,甚至未来的肌电信号等),只要输入足够丰富、算力与智能足够高,就能通过人类社会的行为数据去预测各种规律。

所以他想知道在有限的条件下,AI能不能做出最优解。

于是他选用了德州扑克场景,找到公开无解说高额现金局实况打码,人工逐条复核校准。

模型分为两种输入,一种文本输入,模型只看牌和行动线;另一种是视频输入,模型除手牌信息外,还能看到其他选手出牌时的表情等场外信息。不支持视频理解的就通过抽帧来模拟连续判断。一共有10 手牌,每手做 3 次独立运行。

打开网易新闻 查看精彩图片

从最终表现来看,K3的判断是最好的,具体表现是会很好地利用行为线索,而且不是每手都跟。比如在T4 授牌看到对手河牌约 2–3 秒快速推入、推注后反复看底牌,把诈唬概率抬高,给出 0.55 跟注,判断正确;面对 T2 也会把激进范围和诈唬组合纳入判断。

Claude也是牌理选手。他在L0 时它正确跟了T2,硬动作 EV 187.1,是五家最强的纯牌理行动线。但使用抽帧带来的错误把它带偏了。因为加入抽帧后,它把「预备筹码」「双手抱胸」都解释成强牌信号,T2、T4 转向弃牌,还在 F5 错误跟注。

Qwen的打法比较保守。三层里几乎始终只在 F3 跟注,但 F3 恰恰应该弃牌。T2、T4 这类应跟牌,多次把推注连贯、姿态稳定、没有明显马脚解释成价值牌,于是继续弃牌。同样,加入视频模态的信息后,Qwen3.8-Max的胜率反而降低了。

GPT也是保守主义,就不提了。DeepSeek则是过于激进导致总是跟错牌,尤其在F1牌局,它声称认出了某个著名牌局,断言对手是听牌破产,结果对手是价值牌。量化模型这波发挥失常了。

最后总结一下。

目前大模型主要卷编程能力,而传播案例往往是前端能力。这些网吧家人们自定义的Bench,就很好地测出了模型厂没有专门优化过的领域。

比如Qwen3.8-Max是一个工程能力更强的模型,它在物理模拟、嵌入式等场景的表现显著好于其他模型,说明Qwen训练时用的数据集更丰富,兼顾了相对小众的工程场景。

而K3则是综合智力较强,尤其是涉及多模态能力的经营模拟类Bench,K3往往有更好表现。

从现在来看,大模型在编程能力上已经卷到远远超出人类程序员水平,而在更广泛的非编程场景,各个模型的水平参差不齐。大伙都是编程专精模型,

AGI、ASI都还远未到来,大伙仍需努力。

(本文封面由ChatGPT生成,纯人工写作)

⬇️

欢迎订阅我们的Substack

funeralai.substack.com