衡宇 发自 凹非寺
量子位 | 公众号QbitAI

服都服了,又是哪家模型搞匿名啊,大过节的搁这儿杀出来冲榜?!

说的就是你,Space Bunny。

一个没留神,它在短短几天里经历了突然出现->突然热度飙升->突然干到OpenRouter、OpenCode双榜调用日榜第一->突然讨论热度也飙升。

打开网易新闻 查看精彩图片

扫了一眼,推特和Reddit上目前的整体风向是这样的:

有说unbelievable的(be like@CoderGeeta)。

打开网易新闻 查看精彩图片

不少用户反馈输出效果不错(be like@Fei2411)。

打开网易新闻 查看精彩图片

还有夸速度快,“打败了Astra”的(be like@marcthecreatorr)。

打开网易新闻 查看精彩图片

真的吗?

我不信。

所以在迷人又珍贵的中秋假期最后一天,我做了一个违背祖宗的决定——管他是谁家的匿名模型,先测了再说吧。

猜它是谁干嘛,快开蹬啊

先跟大家说一声,我是从OpenRouter上拿的API,接到了DeepSeek Harness(为公平起见我用了之前我没用过的DSH,惭愧)里面,给Space Bunny随便取了个名字叫“tuerye”。

昨晚上和今天上午都在使劲蹬,然后随机抽取,最后放了**4个case**在这篇稿子里。

可能附带一些我自己的个人主观弹幕,但主要还是为了呈现。

欢迎大家给自己的判断。

我这个人吧有点执念,这个世界上的匿名模型,管他大王小王,通通都要给我拉来测coding能力。

最近最火的除了Astra操控Blender,还有的就是3D玩法了。

那就上强度吧,我让它“用Three.js构建一个详细的立方体风格天坛,包含交互式细节”。

任务一开始跑我就搁旁边看《花少2》8小时版本去了……大概一个多小时不到两个小时吧,想起来看了一眼居然就跑完了,比我预想中快很多。

效果见视频:

我给编辑部几位同事看了下,满足“交互”这个条件就不说了,它自己加了些我压根儿没提的细节,比如底部控制条里还有夜、黎明、正午三个时刻和雨、烟的天气开关;昼夜还会自行循环,一天约3.5分钟,时辰文字也随时间从子时走到亥时。

反正总体而言大家都觉得Space Bunny的初战效果比较令人满意。

而且说出来都丢脸,做完了我才想起来DSH它,没!长!眼!睛!

打开网易新闻 查看精彩图片

所以评分方面再给这兔子加一颗星,表达我的歉意。。。

OK,展示第二个任务,给咱**做一个苹果系统的、更适合中国宝宝体质的闹钟**。

这个功能其实iOS 27说是有了,但身在中秋假期在这儿为爱测评的我,脑子里啪一下就冒出了这个需求。

Space Bunny耗时共22分钟46秒。

做出来的闹钟,响铃时的界面是这样的,霸占整个Mac的屏幕。

很霸道但也很简洁:

打开网易新闻 查看精彩图片

一轮跑出来界面是这样的:

打开网易新闻 查看精彩图片

按理说一轮就够用,但我还是又让它加个每个月到底闹铃响不响的功能,起床时间也调到7:23。

我们早八人是这样的,能多睡一分钟就尽量多睡一分钟。。。

这任务吧实用性比较强,咱们主要来看看readme里面它记录的思考。

打开网易新闻 查看精彩图片

iOS的硬性限制它也考虑到了:

打开网易新闻 查看精彩图片

但你们要不要看下我在这里看到了什么。。。

这是什么。。。

晕倒了我已经。

打开网易新闻 查看精彩图片

怕自己贴截图的时候再次晕倒,所以赶紧来看第三个Coding任务吧,让Space Bunny做个App。

“做一个mac app,把dsh当前的思考像字幕一样打在屏幕上。”

好消息是这玩意儿做起来就很快,可能不到5分钟?

我在飞书页面写这篇稿子呢,非常短的时间里屏幕上就冒出来了个这个,给我吓一跳。

打开网易新闻 查看精彩图片

坏消息是这次它自己脑补的细节就没有天坛那个丰富,初次交差的版本确实一直在显示DSH的脑回路,但窗口不能拖动挪动,也没有关掉和最小化。

这个位置一度挡住了我和DSH的对话框,我沉默许久,终于想起来可以给窗口缩小咯(可能是还沉浸在中秋尾声,今天测试的诸多环节我好像都失了智,好在Space Bunny智商还挺在线的)。

但我还是无能地勃然小怒了一下:

打开网易新闻 查看精彩图片

不到15分钟,且是在我开了多个任务同时跑的前提下**,它给改好了。**

现在就是随便挪,任意挪,想咋挪就咋挪。

而且没有思考的时候它会变得小小只。

我觉得海星?还不错!

不过也有两个问题。

一个是它自己说的,“合成鼠标事件在这个环境里会被系统丢掉一部分,所以「拖动是否与指针1:1同步」我没法在无头环境里断言——我改成了直接跟指针的屏幕位移(两端都是AppKit坐标,不存在符号翻转),你手动拖一下最准。”

另外就是拖动的时候会像小星星一样一闪一闪的?

这个不是啥大问题,应该就是因为实时显示脑回路所以窗口忽大忽小的,我又在拿鼠标拖拽,两套操作有点打架。

回头再交互一轮简单打磨下就好了。

讲真最近测的好几个模型都这样,首轮出来总会有些小细节有bug,肯定是没有Astra这种惊艳你一跳又一跳的feel,但拿来干活跑跑代码肯定是没问题的。

也就是首轮结果出来过后自己要再手动提点小建议,一般一轮就能解决。

如果要增加新功能就再交互再跑。

Reddit上有老哥跟我体感是一样的:

打开网易新闻 查看精彩图片

我测试过程中几乎没有出现一轮解决不了的问题。

只有一次,跑了个“给GitHub某仓库的文章列表增加cursor分页和标签组合筛选,补全测试且保持旧接口可用”的任务,看到它声称“全部检查通过”,随后又说明lint仍有33个错误,有点bug。

但这个问题一说也马上就改了,我还让codex帮我审了一遍,人家也说没问题。

打开网易新闻 查看精彩图片

前前后后测了十几个coding任务都给我测累了,于是我的魔爪又伸向了多模态。

丢给它一个特斯拉擎天柱吧台优雅营业的视频,就是这个:

△视频来源@cb_doge

问Space Bunny(写到这里我脑子里有一瞬间无理由飘过“这兔子不会是Grok吧”):

这个机器人干嘛呢?

打开网易新闻 查看精彩图片

中间流程太复杂了,直接上最终结果:

打开网易新闻 查看精彩图片

讲道理这个任务不知道为什么缓存命中有点低?

我看了下,除了这个任务其余的缓存命率中都在95%以上⬇️

打开网易新闻 查看精彩图片

太空玉兔,你是O/A/G/Z/M/K…家的吗?

讲真,我是测完过后才开始认真去看开发者们分享的一手体感的。

好的坏的评价都有,初步目测是好评偏多。

什么说Space Bunny是个工具狂人啊:

打开网易新闻 查看精彩图片

速度快啊:

(好,原来大家都用GPT-6审代码,本菜狗放心了)

打开网易新闻 查看精彩图片

别慌,当然不可能全网好评!

也有说它思考得太多——这和第一个测试中它给的天坛的结果比prompt丰富得多对应上了。

但也要和大家李涛一下,速度快、最终结果ok,还能给出更多的信息量……

那么思考太多到底算好算坏呢?

打开网易新闻 查看精彩图片

Anyway。

如果你有自己的体会也欢迎分享在评论区,我们会在第一时间把留言放出来。

好,最后还是俗气地来到传统习俗——猜厂商——环节。

虽然说,现在每个月都有新匿名模型,已经快成模型发布固定伴侣了……

但因为使用体感没有拉胯,猜一猜也行吧!我看网友们的猜测都五花八门的。

有网友说,因为声音听起来和GPT的很像,所以OpenAI你别藏着掖着了,直接亮相吧小宝贝:

打开网易新闻 查看精彩图片

居然还看到有人跟我前面一样,从名字里的“space”来粗暴猜测,说Bunny同学就是Grok的船新版本。

xswl,谢谢兄弟姐妹告诉我这么神经的人不只有我一个。

打开网易新闻 查看精彩图片

然后国内头部模型们几乎都被猜了,猜Kimi的、GLM的、HY的、MiniMax的都有。

打开网易新闻 查看精彩图片

还有人觉得是Meta接下来会发布的Muse Spark。

打开网易新闻 查看精彩图片

先不说猜得对不对的,但猜想小扎看到这个猜测一定很欣慰,我们Meta也是真的靠Muse重新上桌了呜呜呜。

放几个月前,这种表现不错的匿名模型,谁会把Meta的模型拿出来说啊喂!

最后的最后,我俗气地和大家感慨一下,比起认领兔子更值得关注的应该是Space Bunny这么快在调用榜登顶的实质原因。

现在日常干活,除了搞算法的朋友们,大家的大模型挑选标准都趋向经济适用。

吾日三省吾身:这模型快不?准不?贵不?

正因如此,几乎所有的Flash高速模型就成了处理高频任务的主力工具。

就目前的信息而言,Space Bunny大概率也是想这样走花路的,不过,具体定价还是要等厂商认领公布咱们才知道了╮(╯▽╰)╭

参考链接:
[1]https://x.com/Fei2411/status/2104030913814515932
[2]https://x.com/CoderGeeta
[3]https://www.reddit.com/r/opencode/comments/1wocn5s/space_bunny_thoughts/
[4]https://OpenRouter.ai/rankings#natural-languages
[5]https://x.com/cb_doge/status/2032939247443882115?s=20