成立不到5个月,第二次拿出震动业界的东西。上海AI公司StartLux(原点星辉)在9月30日正式发布决策模型StartLux-Decision,一口气推出0.8B、2B、4B、9B和27B五档版本,并提供支持本地部署的量化模型,完全开源。
最能说明问题的是一场国际象棋。对手是近期受到关注的Jev 1.13,双方看到相同棋盘状态,不借助额外搜索,每一步都由模型直接选择。最终StartLux-Decision-27B完成将死,这样的棋局,StartLux在36局中赢下35局。
榜单上的6分差距
在独立的Decision Index 0.2.1中,StartLux-Decision的27B版本得分63.88,38项基准里有31项高于Jev的最新版本Jev 1.13,综合得分对比为63.88对57.91,领先公开榜首近6分。在另一套七项测试中,StartLux-Decision-27B平均准确率达到91.82%。
需要说明的是,上述成绩为StartLux团队基于公开评测工具、对照2026年9月28日Decision Index公开榜单快照完成的自测结果;七项公开测试来自上海AI Lab Intern-Decision团队的评测集,与Decision Index是两套相互独立的口径。
这不是这家公司第一次拿出让人意外的成绩。上一次,StartLux-27B的本地模型在工信部中国信通院测试中超过284B的DeepSeek-V4-Flash,并以约1/60的参数量基本打平DeepSeek-V4-Pro。
为什么Agent需要一种专门负责判断的模型
先看StartLux-Decision实际在做什么。在一个客服工单Demo里,系统收到这样一条消息:「订单已经被重复扣款两次,但系统仍然显示未支付。」传统生成式AI通常会先理解问题并生成一段分析,而StartLux-Decision可以在一次请求中同时完成三项明确判断:分流团队、处理时效及严重等级。
这里体现了Decision Model与普通生成模型最直观的区别:它不需要先生成自然语言再由程序解析,而是直接针对开发者提供的候选项进行选择、是非判断或等级评分。
这类能力放进Agent后,作用会更加明显。在购物Demo中,用户给Agent的要求是购买「最便宜、免运费的8节装AA电池,并寄到家庭地址」。系统综合考虑型号、数量、价格和配送条件,每轮由StartLux-Decision根据当前页面状态判断下一步操作及任务是否完成,执行操作后更新页面状态并继续判断,直至完成下单并通过任务条件检查。
类似的模式也出现在办公协作Demo中。任务是把指定成员邀请到Design团队,并设置为Editor,模型需要依次选对团队、成员和角色,随后判断邀请流程是否已经完成。
这几个Demo的共同点在于,答案空间是相对明确的。浏览器控件、客服部门、工具列表均已提前定义。不同于LLM擅长的开放式内容生成,大量Agent步骤的需求非常短小,比如Yes/No、三选一、五级评分或工具选择。
如果把时间往回拨,会发现这里发生了一个很有意思的循环。传统软件时代,工程师会把业务拆成大量规则,金额大于多少进入哪条流程,出现某种状态触发什么操作,不同用户进入哪个权限分支,系统很精细,但大量逻辑需要人工提前写好。LLM出现以后,大量这种显式逻辑被模型吸收,开发者开始直接把自然语言和环境状态交给大模型,让同一个模型完成理解、分类、判断、规划和生成。
到了Agent阶段,AI重新开始分工——确定性流程交给代码,搜索交给Embedding,复杂规划交给Reasoning Model,而高频选择则开始出现Decision Model这样的专用模型。
毫秒级的速度账
算力也随之开始更精细地分配。StartLux公布了一组速度测试:在单卡H200、BF16、本地HTTP和短请求条件下,StartLux-Decision-4B一次回答三个问题平均耗时26毫秒;0.8B和2B分别为12.2毫秒和15.5毫秒。团队还使用CUDA Graph、快速线性注意力算子,并把多个问题合入一次前向计算,以降低重复计算和调用开销。
当一次Agent任务包含几十个判断节点时,每一步究竟需要多少计算,很快就会影响整个Agent的响应速度和运行成本。这也解释了为什么Decision Model会在短时间内快速升温。它处理的很多事情看起来都很小:选择一个工具、判断任务有没有结束、检查某条信息应该进入哪条流程、决定页面下一步点击哪里。可一旦Agent开始长时间、规模化运行,这些小判断反而可能成为整个系统里调用最频繁的一层。
今年9月,机器之心曾经和StartLux联合创始人兼CTO郭权玮聊过一次「本地×RSI」。当时一个很重要的问题是:StartLux所说的「本地AI」究竟是什么?郭权玮给出的边界很宽:包含模型、量化、推理系统、硬件适配,以及上层的Agent Harness、工具、搜索和持续学习,团队的目标是将这些能力尽可能部署在用户本地设备上。
这与单纯在本地运行一个离线模型有着本质区别。一个长期运行的本地Agent必须面对诸多系统级挑战:显存与内存约束、模型精度选择、不同任务在4B/9B/27B之间的调度、长上下文管理、步骤中断后的恢复机制、Memory的存取策略,以及高阶判断的开销平衡。StartLux-Decision正是为填充其中特定层级而推出的组件。
在StartLux的系统划分中,StartLux-27B承担通用能力层,Decision Model专注于高频决策,上层部署Agent与Memory,底层则由量化、推理系统和硬件适配支撑。这种架构设计始于现实的算力约束:个人电脑的硬件资源存在明确边界。与云端可通过GPU集群扩展模型规模不同,本地系统必须在有限显存、内存、带宽及功耗下长期运转,因此「单位算力如何高效率分配」成为核心问题。
此前StartLux在27B模型上的后训练实验已体现出这一逻辑。郭权玮将模型参数形容为一个高维空间,规模决定容量,而训练则是在重构容量中的能力分布。实验显示,针对Agent能力后训练后,GPQA从83.33升至90.40,DeepSearchQA从47.04升至59.39,Tau3-Banking也有所提升;但与此同时,GAIA从57.57降至45.70,IFEval亦出现下降。这一现象表明:在固定参数量下,不同能力之间存在资源重新分配,训练过程本质上是在决定参数更倾向于处理何种任务。
Decision Model则更进一步:将频繁调用且目标明确的特定任务,交由专用的轻量化模型处理。这也是StartLux推出五种规格的原因,以覆盖不同设备与场景,同时提供BF16、Q8_0和Q4_K_M三种GGUF量化文件。
以4B规格为例,Q8_0文件大小约4.48GB。在团队公布的231道公开JevBench量化复测中,其与原始权重的决策一致率达100%,均答对204题;压缩至约2.71GB的Q4_K_M版本后,决策一致率为98.3%,答对201题。
在实际的本地Agent系统中,这种规格分化具备明确的工程意义。一个长期运行的个人AI系统可能同时调度多种模型:低延迟判别由小型Decision Model完成,复杂推理交付大模型,检索由专业模块承载,长期记忆依赖Memory,而跨应用操作则由Agent Harness协调。模型正逐步转变为计算系统中的不同处理单元。
此外,概率输出也是其关键特性。StartLux-Decision可输出候选项的概率分布,使系统能够建立路由与分流策略。若模型在已知任务上的置信度达标,系统直接执行后续逻辑;若多个候选项概率接近,则可补充信息、转交更强模型或触发人工确认。不过,概率本身仍需结合具体业务场景校准,对于支付、删除、权限修改等高风险操作,原有的授权确认机制不可或缺。
3天跑通一次Auto Research
再来看一个非常引人注意的数字:3天。根据团队公布的信息,这次从确定Decision Model方向到完成首轮模型研发与验证,大约用了3天。对于一个模型项目而言,这一周期相当紧凑。
这得益于RSI思路下,StartLux长期构建的Auto Research研发体系:AI已经进入数据构造、训练、评测和失败分析等研发环节,这在StartLux近期的两次模型研发中被连续证明。
在此前的机器之心专访中,郭权玮曾对「70%实验执行由AI参与」这一数据作出解释:若仅统计配置生成、训练启动、Eval运行与结果整理等机械性工程,自动化率已超95%;而70%指的是在核心的研究与决策环节中,AI模型参与的比例。两者的技术难度存在本质差异。自动化启动训练已相对成熟,而难点在于训练结束后的分析与决策:模型为何失败?应补充何种数据?问题出在算法还是推理顺序?下一个实验需调整什么变量?该路线是否值得继续投入算力?
StartLux将这种高阶决策流程定义为Auto Research。郭权玮曾经举过一个金融任务的例子。当系统发现模型在未回查原始数据即直接计算时,失败样本会被送入研究系统。多个AI模型协同分析原因并提出假说,比如数据覆盖不足、推理链条缺陷或缺乏对应行为强化,系统随后评估方案价值,自动构造数据、启动训练、运行Eval并检测能力退化,最终将新结果反馈至下一轮迭代。在此流程中,AI已开始承担传统意义上的「科研决策」职能。
StartLux-Decision即为该管线在新模型品类上的一次落地实践。决策模型确立后,团队需定义其接口规范,围绕动作选择、约束理解、结构化输出等能力构建数据集与评测体系。训练后的异常样本重新进入迭代循环,最终由实测数据决定保留哪些修改。
在基础模型快速更迭的背景下,单版权重的领先周期缩短,研发系统的迁移能力变得更为关键。郭权玮表示,在StartLux的实践中,同系列基础模型切换时,积累的数据与训练经验大部分可直接复用,而Pipeline、Eval及失败分析体系的迁移率更高。因此,团队将长期积累的核心资产定义为:数据的有效性识别、失败样本的处理机制、实验评估体系,以及下一轮实验的自动生成能力。
在此基础上,StartLux进一步提出了Recursive Self-Improvement(RSI)的五级划分:
- Level 0是Self-correction,模型发现错误后可以重新尝试;
- Level 1开始积累Memory和Experience;
- Level 2是Automated Training,AI可以生成数据、写代码、启动训练和运行Eval;
- Level 3是Auto Research,AI根据上一轮实验分析失败、提出新假设,并参与决定下一步研究方向;
- Level 4才进入他定义中的完整RSI:被改进后的AI连「改进AI的能力」本身也继续增强,形成递归反馈。
目前,StartLux将自身定位在Level 3阶段。StartLux-Decision既是Auto Research管线加速产出的成果,同时也是该管线未来可调用的基础组件。因为自动化研究本身包含大量离散决策:哪些失败值得深入分析?下一步调用什么工具?多个实验方案的优先级如何排序?何种情况下终止当前路线?
从36局赢35局,到3天跑通一轮研发,这家成立不到5个月的公司正在把「判断」这件事拆出来,交给一个专门的模型去做。
热门跟贴