一个整个模型只有14MB的语言模型,最近爬上了GitHub趋势榜。它叫Needle 2,来自一家名叫Cactus Compute的小团队。整个模型连同权重一起打包进一个14MB的二进制文件,完整推理大约只需要28MB内存。团队宣称,在函数调用能力上,它和比自己大5到70倍的模型“互有胜负”。
这个宣称值得仔细拆解。Needle 2不是一个通用的聊天机器人,而是一个专用的工具调用引擎。它几乎放弃了通用LLM擅长的所有事情,只为换取在没有云连接、没有GPU、有时只有纽扣电池的设备上运行。这种取舍到底值不值,完全取决于你在构建什么。而它的README对这种局限的坦率程度,在开源项目中相当少见。
打开网易新闻 查看精彩图片
抛开营销说法,Needle 2本质上是一个把模型权重直接编进二进制文件的智能体运行时。没有单独的.gguf文件需要下载,没有模型注册表,推理也不需要网络。你只要pip install cactus-needle,把一个Python函数装饰为工具,拥有4500万参数的模型就会自行决定何时调用它。比如,你可以定义一个get_weather工具,然后直接问“拉各斯现在的天气怎么样”。
项目关注的全部表面,就是结构化工具调用、JSON Schema约束的输出、以及将数据提取到Pydantic模型。它明确不追求做全能助手,而是要在资源极端受限的设备上,把“调用工具完成任务”这一件事做到极致。
热门跟贴