「豆汁好喝」
打开网易新闻 查看精彩图片
「豆汁好喝」

上周末,我们在班味很重的北京举办了班味很重的懂模帝Bench黑客松大赛,狠狠践行了一把「每个人都要拥有对每个模型能力的定义权」。

经过一天的激烈Coding,最后产出了超过30个Bench。Demo演示了整整五个小时,到后面已经有点缺氧了。

真是网吧知识含量最高的一集。

本场活动里,伟大的Qwen 为全场选手提供了每人1500人民币的Token用于构建和跑Bench。第一天结束后,只有四名选手要求加Token。

说明Qwen3.8-Max确实很耐用。好用,得多用。

打开网易新闻 查看精彩图片

多的不说,没来的朋友直接看回顾吧:

01

Qwen喜欢你

不知道是不是Qwen模型开源的名声过于响亮。一位名叫冬云的参赛选手在第一天晚上鬼脑一热,直接在网吧电脑里部署了Qwen3.5-7B。

我问他部署这玩意干啥,他说也没啥用,就是看不得电脑闲着,平常也会在自己服务器上整一堆30B左右的模型,然后拿它们出来斗蛐蛐。

他还说,「网吧的显卡(RTX 4080)算力被严重低估,平时只用来打游戏太浪费了。如果能利用起来跑大模型那岂不是爽歪歪。」

网吧电脑迎来了它最严厉的父亲。

打开网易新闻 查看精彩图片

有一位选手带来了嵌入式底层驱动开发能力Bench,由于名字过于专业我一开始都听不懂。

后来我才知道这个Bench的开展方式是给模型一个芯片外设手册和一块虚拟开发板,让它自己写驱动、读写寄存器、编译运行、处理中断/超时/异常。

他给的两道题目都是基于自己的工作场景,Qwen3.8-Max在两道题的表现都是第一,展现了模型极强的系统级 Agent 能力:能读手册、逆向外设、搭测试、定位平台问题、连续修复直到闭环。

打开网易新闻 查看精彩图片

最终获得Qwen的选择奖则是一位来自美团龙猫团队的同学Vivian,这位同学的日常工作就是做模型评测。

在参加完我们的活动后,本周共计工作7.5个工作日——意思是老板看到了记得付加班费。

Vivian的评测集叫万物皆可评测,鼓励大家从自身工作场景里出题。不是,这不是我们活动的Slogan,在这套娃呢?

Vivian的题目分别是,DeepSeek harness多个插件的兼容性、某播客顶流主播是抄袭、蒸馏还是汉化了、Markdown 多视图评测、AI 社会研究、以及小红书图片素材做成离线目录,足以看出其兴趣之广泛。

打开网易新闻 查看精彩图片

02

外卖大王拿走了Mac mini

来看获奖选手。

最终赢得Mac mini大奖的选手是RainFly,这哥们上次就在我们的网吧黑客松比赛里赢了一台PS5,搁我们这儿进货来了。

RainFly非常深入群众,做了个「外卖大王」点外卖比价Benchmark,主要考验模型领券能力。

他Mock了一个美团 App 的环境,要求模型在每日领券、免费领神券、神券膨胀、天天红包、店铺红包和领券弹窗六个入口里作出最优解。

根据他的评测,Qwen 的表现跟大胃王良子有一拼,三轮都把系统里的三处免费权益领满,价格也做得不错,只是花费时间最长。

打开网易新闻 查看精彩图片

第二位获奖选手是灝,他做了个911接线员Bench。

顾名思义,就是让模型在有限资源下,去调度类似救护车、消防车这些公共应急单位。

灝找到了旧金山一个公开数据集,从中抽取了20小时的时间窗口,让 大模型在看不到未来的情况下做决策,其中响应时间、服务覆盖、安全约束和资源效率也由程序自动计算。

这Bench有点太有用了。我将其命名为美国斩杀线Bench。

最后一位获奖选手是做具身的张振尧,他做了个考验模型物理能力的Bench,题目包括无人机巡逻路径、机械臂抓取、摩擦起步等等。

这套Bench的灵感来源于哥们在比赛前让模型帮他写了一段无人机控制代码,模型飞快地给了他一段。

结果他把代码丢进仿真器里一跑,刚起飞就坠机了。疑似科比飞机代码泄露。

我认为这个Bench应该叫世界模型Bench。

之后可以用来测那些最爱吹牛逼自己掌握物理规律、实际是拿Wan后训练的世界模型们。

还有一家名为NemoVideo的AI剪辑Agent公司贡献了一个视频剪辑Bench,把五个模型装进同一个剪辑 Agent 里,用同一批素材、同一套题目,各跑十遍,看它们能不能独立把一条片子剪出来。

NemoVideo的朋友和我说。他们也是在批量跑评分的时候发现了自身Agent的一些缺陷,开始紧急修复与迭代。现在Bench的结果已经被工程部作为产品迭代规划的参照了。

这就是我们做这类Bench内容的初衷——复兴AI应用公司!

03

看看谁的Bench最有活

整活赛道迎来了各路神仙,有Dating bench、北京浮生记Bench、还有转行Bench。

期待下次有人整个胖猫Bench。

最终两名获奖者中,一位做了娱乐操盘手Bench。

让五个模型拿着同样的预算,经营同样三位各有短板的练习生,在八周内完成训练、做舞台、赚资源、处理突发事件,最后争取成功出道。

这有点像我们之前写过的CEO bench。

打开网易新闻 查看精彩图片

另一位则做了牛来Bench,这名字多少有点标题党了。

打开网易新闻 查看精彩图片

因为实际上这哥们主要是让给不同模型同一个「牛来」的角色人设,让他们做一段视频。

和直接生成一段视频不同的是,模型是先用代码创造一个可以运行的三维世界,为角色、场景、灯光和物体建立空间与时间规则,再像导演一样在这个世界里安排表演、调度摄影机并完成拍摄。

在得知牛来Bench得奖后,一位激情参赛、通宵整晚,甚至整了台RTX PRO 6000 来跑分的选手感慨,「有牛就有奖,没吃上牛来的红利。」

打开网易新闻 查看精彩图片

这说明个人的努力固然重要,但主要靠时代选择。

04

长程任务之Kimi

同样作为国产之光的Kimi也为本次比赛的所有选手提供了价值1000人民币的Token。

我们也来看看K3的具体表现:

以上述提到这个要考验模型能力范畴最多的牛来Bench为例,所有模型要通过代码去完成分镜、Three.js 世界搭建、角色动画、声音设计、浏览器调试和最终交付。

Kimi在镜头、角色连续性、视觉一致、动画连续和原创性六个维度都是最完善的,斩获了第一名的成绩。很难相信语言模型能做到这个维度。

请欣赏Kimi的《牛来》:

我的朋友@电子羊贡献了一个算命Bench,他从全球算命师大赛里选了199 道可自动评分命理选择题,让五家大模型作答,

当然不是模型的抽奖能力,主要考验他们调用命理工具以及时序判断的能力。

K3调用了344 次工具,说明结构化长工具链做得够好。最终得分也仅次于 Opus 5.0,唯一的不足是,完成时间长达51 分钟,是Opus 5.0的两倍还多。

可以看出,K3 在「沿着既有道路执行」的长程任务上有明显优势。

说明大就是好。如果算力允许,估计K3还能接着杀。

05

豆汁仙人

有了上次醋鱼的经验,我们这次特意买了几十瓶豆汁给大家喝,相信总有高手能喝完。然而还是远远低估了豆汁的威力:

咸鱼在喝完后怒斥是发酵的粪水;一位选手在喝完豆汁后,惊讶地发现包间里的味道久久散不去,最后只能离开房间。

当然还是有高手的。上面那位本地部署了Qwen的选手一口气喝了半瓶并且面不改色。

打开网易新闻 查看精彩图片

我合理怀疑他是北京人。

06

选手变网管

第二天来网吧的时候,我看前台多了个人,以为网吧临时摇了人来干活,于是喊这哥们给我贴了两张海报,哥们没拒绝。

结果哥们后来搬个电脑在前台Coding,我一瞬间以为网管也来参赛了。后来才知道哥们本来就是选手,被网管临时拉去干活了,

我后来问哥们咋想的,他说「自己熬夜熬穿了没事干就去跟早班的网管聊天,帮帮忙,清理垃圾布置场地了。」

下次我要贴一个禁止网管奴役选手的提示了。

打开网易新闻 查看精彩图片

07

黑客帝国

这是历届网吧黑客松里含黑客量最高的一集。

最后展示的选手在测模型安全相关能力的过程中,不小心用某家模型直接把网吧电脑全 Hack了,直接谁也开不了机

一场黑客松斩杀了整个网吧。

打开网易新闻 查看精彩图片

我们现在和网吧老板进入冷战期了,这网吧下次没机会用了,悲

最后总结一下,我们的Bench比赛之所以选择Claude Opus 5.0、GPT5.6 Sol、Qwen3.8-Max、K3、DeepSeek V4 Pro这五个公认的顶尖模型,核心原因在于我们要找到好的Bench,而好的Bench就应该能让顶尖模型有区分度。

不过这次比赛中,海外模型表现不佳,暂不确定是因为API不够稳定、还是高峰期偷偷降智了。

要是大伙都测小米MiMo或者美团长猫这种二线模型,那所有都能看出来谁好谁差,就失去比赛的意义了。

当然,不排除我们之后会办活动专门测这些模型到底有多菜。

之后,我们还会发一篇专门分析上述Bench的文章,敬请期待。

(本文封面由ChatGPT生成,纯人工写作)

⬇️

欢迎订阅我们的Substack

funeralai.substack.com