一个数字先摆这儿:35B。
如果按这两年大模型圈的主流叙事,这个体量放进“万亿参数俱乐部”面前,理论上连气势都不该有。结果偏偏就是这么一台 35B 的 MoE 模型,公开论文第一段就把话挑明了:它在多项长时程 Agent 基准上,正面去对 Kimi-K2.6、DeepSeek-V4-pro 这种 1T 级对手。这个反差,才是这波讨论真正炸开的原因。
主角叫 Agents-A1,来自上海人工智能实验室 InternScience 团队。论文在 2026 年 6 月 29 日挂上 arXiv,标题也很直接—— 扩展地平线,不是扩展参数 。这句话说白了,就是不靠一味把模型堆大,而是让它在一个任务里“撑得更久、做得更完整、纠错更彻底”。
这点很关键。
因为现在很多模型的强,强在“会答”;但 Agent 真正难的地方,恰恰不是一句话答出来,而是它能不能连续查资料、调工具、读反馈、发现错了再回滚、最后把答案核实完。Agents-A1盯的,就是这个长流程能力。
它的底子也很有意思。公开信息基本已经对齐:Agents-A1 是建立在 Qwen3.5-35B-A3B 路线上的 MoE 架构,官方给到 256K 上下文,而实际推理时激活参数大约只有 3B 左右。这个数字意味着什么?意味着它不是那种“看着 35B、跑起来也像 35B 全开”的重型选手,而是更偏向 训练时做大、推理时按需调用 。对本地部署玩家来说,这就不是纯论文玩具了,量化以后确实有上手空间。
更狠的是它的训练思路。团队不是拿静态文本去喂,而是专门构造长轨迹数据,把搜索、行动、观察、验证器反馈全串成一整条链,平均长度做到 45K token。你可以把它理解成:不是单纯教模型“答案是什么”,而是反复教它“这道题该怎么一路死磕到最后”。
我个人其实很吃这一套。
因为这条路,代表的是另一种行业判断:大模型未必只能靠参数继续狂飙,很多真实工作流里的上限,可能取决于它能不能稳定完成 20 步、50 步、100 步,而不是一锤子灵光一现。这种能力如果能训出来,含金量是很高的。
从论文摘要和公开基准看,Agents-A1 在 SEAL-0、IFBench、HiPhO、FrontierScience-Olympiad、MolBench-Bind 这些项目上都很能打。最抓眼球的是 FrontierScience-Olympiad 拿到 79.0,FrontierScience-Research 也冲到 40.0。这种分数未必等于“全面领先一切”,但至少说明一件事:在长时程科研、搜索、工具调用这类任务里,35B 真的已经摸到了更高量级模型的门槛。
而且它不是只给 PPT。
权重已经上 Hugging Face,ModelScope 也同步开放,许可证直接给到 Apache-2.0,商业使用没额外拦路条款。对开发者来说,这比“跑分神话”更重要。能下载,能量化,能接进工作流,才有资格谈下一步。现在社区里已经冒出不少 GGUF 量化版本,vLLM、SGLang 方向也有人在试,这说明它至少已经过了“看热闹”阶段。
当然,话也得说全。
Agents-A1 这条路的代价,很可能是把一部分成本从训练端,挪到了推理端。模型想得更久,token 就吐得更慢,延迟也会上来。对本地玩家、对生产环境,甚至对 API 计费,这都是实打实的账。所以它更像一台“肯做长题的大脑”,而不是那种追求极速首答的短跑型模型。
所以这东西适合谁?很明确。
如果你关心的是 Agent、科研辅助、复杂搜索、工具调用,或者你本来就在盯“更小模型能不能做更重任务”这条线,Agents-A1 值得重点看;如果你要的是极致低延迟、轻快对话、随问随出,那这条路线可以再等等。
35B 没有把模型做得更大,它只是把“死磕到底”这件事,先做出来了。这个方向,我看好。
热门跟贴