一个只有8MB的模型,官方说它能对标DeepSeek V4 Flash。这不是玩笑,是Cactus刚发布的Needle 3。

它的定位很明确:自动化基础模型,主打纯函数调用能力。换句话说,它不跟你聊天,它负责干活——把指令翻译成可执行的函数调用

打开网易新闻 查看精彩图片

一套权重,切出无数个模型

Needle 3最特别的地方是"可切片"。同一套权重,从2层到20层,每一层深度都能独立成为一个模型。

参数规模在25M到121M之间浮动,量化精度为CQ2-bit。体积最小8MB,最大29MB

这意味着什么?开发者可以根据设备算力,直接切出合适大小的版本,不用重新训练,也不用维护多套权重。

技术底座与运行方式

它建立在Cactus自研的Simple Attention Networks之上,完全本地运行,上下文支持到4k

纯函数调用这个方向值得注意。端侧场景里,模型不需要写诗,它需要准确地把"帮我订明天下午三点的会议室"变成一段结构化调用。

Needle 3把全部筹码压在这件事上,体积才能压到8MB这个量级。

端侧自动化的新变量

过去端侧模型要么太小干不了活,要么太大跑不动。Needle 3给出的解法是:用切片换弹性,用函数调用换实用性。

它能不能真的对标DeepSeek V4 Flash,需要实测验证。但8MB这个数字本身,已经让端侧自动化的想象空间变大了。