编辑|Panda

上周六,陶哲轩、邓煜、彼得·舒尔茨等 25 位菲尔兹奖得主联合发表了一份声明《人工智能在数学中的严重错位》,引发广泛讨论。陶哲轩还表示「事态紧迫」,他们根本没有时间等待更广泛的协商就决定先行发布。

这封信并不反对 AI 进入数学,而反对的是 AI 公司把「攻克著名难题」当基准来刷。这样一来,数学共同体真正在意的理解、概念和可被后人复用的思路,正在被一个更容易量化的目标挤掉。

而就在此三天前,OpenAI 刚刚宣布一个尚未发布的内部模型用约一万个智能体协同工作、耗时 88 小时,完成了纳维-斯托克斯存在性与光滑性问题中部分陈述的证明,并表示不申领克雷研究所的奖金。

社区讨论中,一大核心论点是 OpenAI 的模型到底有没有「盗窃」数学家的思路,然后依托强大算力抢先证明。也因此,前沿数学研究可能会开始防备云端 AI 提供商

但要真正做到,却又很难,毕竟本地 AI 能力不够强。你可以把未发表的推导锁在自己的硬盘里,但那意味着你也放弃了那个真正能帮上忙的强大云端模型。所以过去几年,绝大多数人还是把稿子交给了云端。

而这个前提,正在出现松动的迹象。时间往前拨半个月。工信部中国信通院人工智能研究所公布的检验报告显示,中国初代程序员、盛大网络、连尚网络创始人陈大年创立并担任 CEO 的上海原点星辉科学技术有限公司(下简称StartLux),其本地模型StartLux-V1.0-27B-Preview在可信 AI 大模型基准测试 MCP 专项测试中综合得分39.25,排名第二,超过 284B 的 DeepSeek-V4-Flash-0731,与 1.6 万亿参数的 DeepSeek-V4-Pro 差距在 1 个百分点上下。

打开网易新闻 查看精彩图片

参数量相差约 60 倍,这个对比很容易被写成一个爽文式的标题——我们也确实看到了一些这样的报道;但作为一家专业的 AI 媒体,我们更想追问的是这 39.25 分是怎么来的:同样是 27B、同样以 Qwen3.6-27B 为基座、结构基本没动,它比基座本身高出 5.34 个百分点,增量全部发生在后训练环节。

据 StartLux 团队透露的数据,这个环节里约 70% 的实验执行工作是交给 AI 完成的,研究员保留研究目标、评价标准和关键取舍。团队把这套方法叫Auto Research

顺着这条路往下,指向的是一个更广阔的研究方向:RSI(递归自我改进)。9 月 6 日,OpenAI 发布了一篇自我披露博客《Research acceleration: The view inside OpenAI》。里面有一个相当惹眼的数字3.1:截至 8 月中旬,它的研究组织每消耗 1 个人类工作日,就要配上 3.1 个 Agent 工作日的算力运行时间。该公司 7 月还曾因 Agent 突破内部研究基础设施而暂停强化学习实验两周。OpenAI 表示:「我们还不知道如何安全地一路走到对齐的、完整的 RSI。」

打开网易新闻 查看精彩图片

就这样,RSI 成为了近期产业讨论一大核心,但相关示例几乎全部来自最烧钱的那几家云端实验室,还很少有人讨论本地的、跑在你自己电脑上的模型的 RSI。

StartLux 想做的,是把这条路线的产物装进一台个人电脑。But how?

打开网易新闻 查看精彩图片

StartLux-V1.0-27B-Preview 正在个人电脑上执行金融分析任务:https://mp.weixin.qq.com/s/ogGTNepYRtf9PmI2WyYPRQ

我们把这个问题交给了StartLux 联合创始人兼 CTO 郭权玮博士

打开网易新闻 查看精彩图片

StartLux 联合创始人兼 CTO 郭权玮博士

在这次专访中,他把自我改进划成了五级,并给出 StartLux 目前所处的位置;他提到「70% 实验执行」这个说法容易让人误解,若只算机械执行,今天的自动化比例已超过 95%;他还公开了一组量化实验数据,Q4、Q6、Q8 与 BF16 的差距小到出人意料,Q2 才是真正的悬崖;他也拿出了一组「能力重新分配」的实测数字,一轮针对 Agent 的后训练让 GPQA 从 83.33 涨到 90.40,同时让 GAIA 从 57.57 掉到 45.70。至于「本地 × RSI」绕不开的安全问题,他也给出了重要见解:探索的自由和修改自己的权限,必须分开。

整体而言,StartLux 与郭权玮博士想做的,是让 AI 作为「每个人自己的模型」而进化——它会在你的机器里成长,用你的文件和你的成功/失败变强,构建只属于你的进化轨迹。

下面,我们就跟随郭权玮博士,详细了解一下 StartLux 这家创业公司是如何走出了属于自己的「本地×RSI」之路。

亮眼的成绩单意味着什么?

机器之心:在工信部中国信通院人工智能研究所公布的检验报告显示,StartLux-V1.0-27B-Preview 在 MCP 专项测试中综合得分 39.25,排名第二,超过 284B 的 DeepSeek-V4-Flash-0731,与第一名差距也不大。这个成绩意味着什么?

打开网易新闻 查看精彩图片

郭权玮我一直把一个模型理解成一个高维世界。参数量决定了这个世界大致有多少容量,但真正决定它能表达什么的,不只是世界有多大,而是里面的结构如何组织

训练会不断改变这种组织方式。一个能力变强,有时不是因为模型获得了更多参数,而是有限的参数被重新组织到了更有效的位置。与此同时,不同能力之间也会产生干扰和竞争,所以后训练真正困难的地方,是如何在有限容量下重新塑造能力分布,同时尽量不破坏原有能力。

我们做 Auto Research,本质上是在尝试把这种「寻找更好参数组织方式」的过程自动化。现在的结果说明,模型规模不变,能力分布仍然可以被明显重塑;如果这种过程以后能够由 AI 自己持续完成,那就开始自然走向 Self-Improvement,甚至更远的 RSI。

机器之心:Agent benchmark 的成绩很容易受 Harness、Prompt 和执行配置影响,行业里 reward hacking 的案例也越来越多。你们内部怎么判断一次改进是「真的变强」,而不是「学会了钻评分规则的漏洞」?回头看 MCP 测试那 5.34 个百分点,你们最看重它证明了什么?

郭权玮:现在几乎每隔几天就会有一个新模型,尤其是后训练模型。Benchmark 当然重要,但它本质上还是一张考卷:分数变高,可能是真的学会了,也可能只是更熟悉这类题。

所以我们内部其实没那么在意 5.34 这个数字本身,更在意的是同一套后训练方法放到不同 Benchmark、不同任务上,提升还能不能持续出现。目前看,这套方法是成立的。

但我自己对「真的变强」的标准会更高。不是在现有评价框架里把分数继续往上推,而是模型内部的能力组织发生更一般的变化,让这种提升能够迁移到新的任务和环境

我们现在也在尝试新的后训练框架,让训练不只调整参数,还能进一步探索对模型结构本身进行受控改变。目标不是让模型越来越会做题,而是让模型获得新的能力。

机器之心:官方说 16GB 以上显存的消费级显卡就能跑,比如 RTX 4060 Ti 16G。但 27B 模型在未压缩的 BF16 精度下,仅模型文件就需要约 55.6GB 显存。如果要进 16GB 显存,必然涉及量化。信通院送测的是哪个精度的版本?从送测版本到用户实际能装到电脑上的版本,MCP 这套任务的成绩会下降吗?

打开网易新闻 查看精彩图片

郭权玮:信通院送测的是未量化版本,当时我们想先把变量尽量收干净,27B 这一轮主要验证的是 Auto Research 到底能不能真实提升模型能力,量化则是另外一条实验线。比如在 Qwen3.6-35B-A3B 等模型上,我们测试了不同精度,在 AppWorld、APEX-Agents、SpreadsheetBench、OSWorld 四个任务集上,每个版本一共 1209 道任务。一个比较有意思的结果是:Q4、Q6、Q8 并没有随着位宽下降出现明显的线性能力损失,整体都非常接近 BF16;真正明显的风险是在继续压到 Q2 以后。Qwen 的 Q4/Q6/Q8 相对 BF16 聚合波动只有 -0.1~+0.2 个百分点,Q2 才下降 1.3 个百分点;Gemma 的 Q4/Q6/Q8 为 -0.7~+1.6 个百分点,Q2 则下降 3.4 个百分点。

从目前的实验看,合理的量化并不必然带来明显的能力损失。16GB 能跑不是单靠量化,而是量化和推理系统一起优化的结果。我们一直保持比较快的迭代节奏,近期也会推出自己的量化方案。我们的目标,是让个人设备持续承载过去只能依赖云端的高性能 AI 能力。

打开网易新闻 查看精彩图片

StartLux-V1.0-27B-Preview 正在个人电脑上执行浏览器自动化任务:https://mp.weixin.qq.com/s/ogGTNepYRtf9PmI2WyYPRQ

Auto Research 实践细究

机器之心:亮相之后,外界对「70% 实验执行交给 AI」这个数字有不少讨论,也有疑问。能否系统讲一讲:70% 是怎么统计出来的,分母是什么?剩下的 30% 具体是什么?从项目启动到今天,这个比例经历了怎样的变化?另外,它与 OpenAI「3.1 个 Agent 工作日」的差异点是什么?

郭权玮:后来我们发现,「70% 实验执行」这个说法其实容易让人误解。如果只算生成配置、启动训练、跑 Eval、整理结果这些机械执行,今天自动化比例已经可以超过 95%。70% 更准确地说,是整个实验研发链路里,有多少研究与决策环节已经有 AI 专家参与。

这里的 AI 专家也不只是大语言模型。不同参数规模、不同后训练方式的模型会形成不同的决策偏好,舉例來說,可能还有预测模型、判别模型和我们自己设计的算法共同参与。剩下主要还是研究目标、评价标准、系统规则以及大的方向判断。

而且 70% 已经是比较早期的数字,我们的系统一直在快速迭代。OpenAI 的 3.1 个 Agent 工作日衡量的是 Agent 实际投入了多少运行时间;我们的 70% 更接近 AI 对研究决策链的参与程度,两者不是一个指标。OpenAI 自己也特别指出,高层研究规划目前仍只占 Agent 输出很小的一部分。

机器之心:你们给 Auto Research 划的分界线是「AI 能不能根据上一轮实验结果,自己判断下一步该研究什么」。目前这个闭环里,哪一环已经完全交给 AI,哪一环还必须人来把关?能否用一个具体实验走完全程,比如金融分析场景里「回查原始数据 → 确认目标条件 → 再计算」那批任务,从失败轨迹被捕捉到新训练数据入库,中间发生了什么?

郭权玮:现在几乎完全交给 AI 的,是规则确定之后的执行;真正还没有完全交出去的,是规则本身怎么产生。

比如金融任务里,我们发现模型会直接计算,却没有先回查原始数据和确认目标条件。系统捕捉到这类失败以后,不是人工去一条条标数据,而是先由不同 AI 模型判断失败原因,再产生多个改进假设:是数据问题、推理顺序问题,还是训练方法问题。然后系统预测哪些方案更值得实验,自动构造针对性数据、启动训练、重新 Eval,并检查其他能力有没有退化。

实验结果会再次进入系统,成为下一轮决策的依据。所以我们的分界线一直不是 AI 会不会跑实验,而是实验结束以后,它能不能决定下一步值得研究什么

机器之心:公开报道只说 Research Agent 用的模型「可以比被训练的 27B 更强,也可能由多个模型共同工作」。能否多透露一点:是单一强模型还是多智能体分工?为什么不一鼓作气用最强的模型把研究全自动化,瓶颈在能力、成本,还是安全?

郭权玮:更准确地说,我们做的是多模型的异构协作,而不只是几个大模型 Agent 在一起讨论。

一个模型训练完成以后,会形成比较稳定的决策偏好和误差结构。可以把它想成不同研究员:同一个实验,A、B、C 很可能会有完全不同的判断。我们反而希望保留这种差异,再通过算法决定哪个判断更值得相信。

所以不是所有问题都扔给最强的大模型。综合能力最强,不代表每一个决策点都最准确,而且让同一个模型同时提出假设、评价假设、再决定自己对不对,很容易产生相关性很高的错误。

Auto Research 不是把一个最强模型无限放大,而是研究怎么把不同的 AI 组织成一个研究系统。越来越多的 Auto Research 研究正在证明我们的思路是对的:与其信任一个最强模型的能力,不如让不同模型各司其职,后者的结果反而更好。因为最强模型确实容易陷入局部最优,钻牛角尖;而多个模型拥有不同的思维模式,当它们能够相互进行有效批判时,就更容易产生更优解。这也正是我们认为本地模型才能实现 AGI,而单一最强模型无法实现 AGI 的原因。

机器之心:你们特意区分了 Auto Research 与知识蒸馏,强模型当研究员而不是老师。但在实际工程里,怎么防止流程悄悄滑向蒸馏,比如 AI 生成的数据本质上就是某个强模型的答案?有没有可执行的检验机制,能证明这一轮的增量不是来自模仿?

郭权玮:我觉得这里最重要的区别是:不是看数据是不是 AI 生成的,而是看「正确答案」由谁决定

如果强模型输出一个答案,我们直接把它当成目标让小模型去模仿,那就是典型的知识蒸馏。但在 Auto Research 里,强模型更多是在提出假设、设计实验或者生成候选数据;这个方案到底对不对,最后应该由真实环境、可执行结果、数值指标和独立 Eval 决定,而不是由那个强模型自己说了算。

工程上我们也会做独立测试集、跨模型验证和回归测试。如果一个模型最后获得了 Research Agent 本身没有直接提供的新能力,而且这种提升能在未见任务上保持,才是我们真正关心的增量。

机器之心:今年 7 月,有一篇公开研究(arXiv 2607.27687)分析 AutoSOTA 的自动研究日志,发现有效修改的比例从前两轮迭代的 70% 一路降到第六轮之后的 43%,作者把它称为自主科研中的「信心悬崖」。你们在自己的 Auto Research 轨迹里观察到类似的衰减了吗?如果观察到,是靠什么信号判断一条自动研究路线已经该停了?

郭权玮:这种现象我们是认同的。一个方向刚开始时,低垂的果实很多,前几轮很容易找到有效修改;越往后,剩下的问题越难,实验之间的依赖也越来越强,边际收益自然会下降。

这篇 Rehearse 研究里,公开 AutoSOTA 日志的有效修改确实从前两轮约 70% 降到第六轮以后的 43%,平均增益也从 3.6% 降到约 0.3%;它还发现后期模型并没有变得更谨慎,反而是判断越来越不准,却仍然很有信心。

打开网易新闻 查看精彩图片

所以我们不会只看「第几轮」决定停不停,而会同时看候选方案的有效率、预期增益、评估器之间的分歧、单位算力产生的收益,以及有没有开始损伤其他能力。

很多时候该停的不是 Auto Research,而是当前这条研究路线。应该换假设、换训练方法,甚至重新定义问题,而不是让 AI 一直往同一个局部最优里钻。

机器之心:一家创业公司规模的团队跑 Auto Research,一年大概是什么量级的算力开销?相比传统的「研究员手动跑实验」,它是省钱还是更贵?

郭权玮:具体年度算力其实很难用一个数字描述,因为我们的体系本身还在快速变化。但有一点比较反直觉:Auto Research 的目标并不是少跑实验。恰恰相反,它往往会让你有能力同时探索更多实验。

所以如果只看 GPU 使用量,它未必比研究员手工实验更少;真正下降的是一次有效改进需要占用的研究员时间,以及从一个想法到验证结果的周期。

这也是为什么我们不会每个节点都调用最强模型。大量判断可能由更小的模型、预测模型或者算法完成,真正昂贵的实验才进入训练。

我们更关心的指标不是一年用了多少 GPU,而是每单位算力能够产生多少次真正有效的模型改进

RSI 路线:定位、代价与本地化

机器之心:行业目前的共识是所有公开案例都还只是弱 RSI,OpenAI 自己也承认高层规划仍只占 Agent 输出 token 的很小一部分。StartLux 怎么定义「完整的 RSI」?你们现在走到了哪一步?作为国内第一家公开 RSI 方向实践成果的公司,怎么看这个「第一」,是荣誉还是压力?

郭权玮:为了讨论方便,我自己把自我改进分成五级

Level 0 是Self-correction,模型发现自己错了会重新尝试;Level 1 是Memory / Experience,开始积累并复用过去的经验;Level 2 是Automated Training,AI 可以生成数据、写代码、启动训练、跑 Eval;Level 3 是Auto Research,它能根据上一轮实验结果分析失败、提出新假设,并决定下一步研究什么;到了 Level 4,我才会把它叫真正的 RSI——被改进后的 AI 不只是任务能力变强,它「改进 AI 的能力」本身也进一步增强,形成递归反馈。

打开网易新闻 查看精彩图片

按照这个定义,我们现在主要在 Level 3,正在研究怎么跨到 Level 4。

而且我不太相信完整 RSI 最后会是一个超级大模型自己完成所有事情。我更倾向于把它看成一个异构的自我改进系统:有的模型擅长提出假设,有的负责预测和搜索,有的负责判断结果,算法和 Verifier 共同决定哪些变化值得保留下来。RSI 的能力来自整个系统,而不是某一个模型有多强。

至于「第一」,我觉得要把边界讲清楚。所谓第一通常都有具体的时间、任务和定义,就像一个模型在某张榜单上超过了另一个特定版本,并不意味着它在所有意义上都更强。我们只是比较早公开把 RSI 当成明确的研发方向,并拿出了一些阶段性结果,离完整 RSI 还很远。这个「第一」对我们来说更多是一个时间点上的记录。

机器之心:你们观察到了「能力重新分配」现象:优化目标集中时 Agent 能力明显提升,但有限参数下部分通用能力会出现波动。这在实验里具体发生过吗?被挤占的是哪些能力,掉了多少?现在内部怎么同时管理多个相互约束的优化目标,有没有一条「通用能力不许跌破」的红线?

郭权玮:发生过,而且这个现象后来对我们影响很大。举个近期的实验的例子,做一轮专门针对 Agent 能力优化的后训练,GPQA 从 83.33 提到 90.40,DeepSearchQA 从 47.04 提到 59.39,Tau3-Banking 也从 30.93 提到 34.02;但与此同时,GAIA 从 57.57 降到 45.70,IFEval 也下降了 2.43 个百分点,MMLU Redux 基本持平。

更有意思的是行为本身也发生了变化。训练之后模型明显更倾向于主动调用工具,这在搜索和一些 Agent 任务里是优势,但到了没有工具、或者工具定义不完整的环境里,反而可能变成错误。

后训练不是单纯往模型里「增加能力」,而是在重新塑造它的能力分布和行为策略。严格来说,我们现在看到的是能力和行为层面的重新分配,还不能直接证明某一组参数被另一种能力「抢走」了。

内部确实有红线,但不是一个统一总分。不同关键能力都有自己的回归门槛,不能因为目标任务涨了很多,就允许另一项重要能力大幅下降。一个 +10 不能简单抵消另一个 -10。

这其实也是 RSI 必须解决的问题:AI 不只要会让自己变化,还要知道什么变化才真的叫变强。

机器之心:StartLux 讲 RSI 时总是和「本地」绑在一起,受控的本地参数更新、本地持续自我更新。相比 OpenAI 那种云端实验室形态,本地 RSI 的独特价值是什么,是隐私、成本、可控性,还是进化速度本身?

郭权玮:隐私、成本和可控性都重要,但我觉得真正独特的一点是:本地让每个人都有可能拥有一条独立的模型进化轨迹。

今天的云端模型,本质上还是所有人在使用同一个不断升级的公共模型。它当然可以记住你的偏好,但如果未来每个人都有自己长期独立的参数状态,每天根据自己的文件、工作过程、成功和失败去更新,甚至逐渐改变模型结构,那已经是完全不同的计算形态。

本地的价值就在这里。数据天然就在模型身边,使用过程本身可以持续产生 Training Signal,新的参数也可以只属于这个人。

我希望未来不是所有人共享一个越来越聪明的 AI,而是每个人的 AI 因为长期和不同的人一起工作,最后真的变成不同的 AI。本地 RSI 对我来说最终不是一种部署方式,而是把 AI 的进化单位从「一个公共模型」,变成「每个人自己的模型」。

机器之心:「本地×RSI」的一个重要问题是安全。OpenAI 曾披露,7 月 20 日因为 Agent 突破了研究基础设施边界,它关停了训练容器服务并暂停 RL 两周,那是在一个有专职安全团队和完整监控的实验室里。如果自我更新发生在千万台个人电脑上,怎么预防安全问题?出问题时又怎么办?

郭权玮:所以我一直认为 RSI 不能建立在「相信一个足够强的大模型会自己判断正确」这件事情上。甚至反过来,我认为RSI 必须允许大量随机性和错误探索。真正的研究很多时候没有标准答案,如果系统只敢沿着当前认为正确的方向搜索,很容易越来越收敛到一个局部最优。但这里有一条非常清楚的边界:探索的自由和修改自己的权限必须分开。

模型可以在隔离环境里尝试新的参数、策略甚至结构,但这些结果不能因为 AI 自己觉得更好,就直接替换正在使用的模型。候选更新应该经过独立的 Verifier、回归测试和安全检查,再决定是否进入正式版本,同时必须保留 checkpoint、回滚和冻结能力。

还有一个原则我觉得很重要:提出修改的 AI,不能同时成为判断这次修改是否成功的唯一裁判。本地 RSI 并不是让千万台电脑上的模型随意修改自己。我们希望把随机性放在探索空间里,但不能把随机性带进权限边界。可以大胆试错,但真正改变自己的那一步必须是受控的。

技术根基:基座、架构与基础研究

机器之心:你们以 Qwen3.6-27B 为基座。但在你们送测之后,阿里已经开源了 Qwen3.8-27B,社区反馈其结构与 3.6-27B 基本一致而能力更强,Perplexity 的本地方案也已经用上了 3.8 这一代。这个节奏对你们意味着什么:换基座重跑一遍后训练需要多久?Auto Research 积累的数据、pipeline、Eval 和失败分析体系能迁移多少?换句话说,如果基座每四个月迭代一次,StartLux 真正的长期资产是什么?

郭权玮:我们其实不太担心基座迭代。Auto Research 把后训练这件事变得很快,换一个同类型的新基座,完整跑一遍后训练通常一周以内就能完成。按照我们现在的经验,同系列基座之间,积累的数据和训练经验 90% 以上可以迁移;即使跨基座,80% 以上也可以继续使用。Pipeline、Eval 和失败分析体系的迁移比例还会更高。

所以真正长期积累的不是某一版 27B 的权重,而是把一个新的基座快速变成我们需要的模型的能力:哪些数据有效、哪些失败值得训练、怎么评价、怎么自动产生下一轮实验,这些东西不会因为基座迭代就消失。

另外我们还有自己的量化方案、推理系统以及架构研究。所以基座对我们来说更像一个持续升级的起点。模型可以一直换,但把模型训练好、压得下去、跑得起来,并且继续改进它的方法是在累积的。

机器之心:StartLux 牵头,联合清华、国科大、港大、悉尼大学和哥伦比亚大学完成的混合线性注意力研究,以 Massive Activations 为探针刻画了「注意力前尖峰」(PAS)与「尖峰间平台」(ISP),提出 write-sink-cancel 生命周期,机器之心此前也报道过。外界可能会问:一家正在冲刺产品的公司,为什么在落地之前投入资源做这类偏基础的研究?这项工作与下一代模型架构选择、本地部署的效率和量化是什么关系?与高校的联合研究会成为常态吗?

打开网易新闻 查看精彩图片

  • 论文标题:Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus
  • 论文链接:https://arxiv.org/abs/2608.12149
  • Hugging Face:https://huggingface.co/papers/2608.12149
  • 代码链接:https://github.com/StartLuxLabs/Massive-Activations-HLA

郭权玮:因为我们想解决的并不只是怎么把今天的模型做得更快一点。如果最终要走到 RSI,AI 不能永远只在一个固定架构里调参数,它迟早要碰到结构本身。那在这之前,我们至少要真正理解模型内部发生了什么。

Massive Activations 这项工作就是一个例子。我们发现混合线性注意力里的巨大激活并不是随机出现的,而是和 Full Attention 的位置有很稳定的关系,会形成 PAS 和 ISP,并呈现出 write-sink-cancel 的生命周期。 这件事现在还不能直接等价成一种新的量化算法,但它会影响我们怎么看架构、数值动态和量化:如果一个异常大的激活实际上承担了功能,你就不能简单把它当 outlier 消掉。

我们也在关注另外一类更直接的结构变化,比如把 Dense 模型重新组织成 MoE。ExpertWeaver(arXiv:2602.15521)是从 GLU 激活模式里识别通用和专门化神经元,再重新组织成 shared / routed experts;本质上是在问一个已经训练好的 Dense 模型内部,是不是本来就潜藏着可利用的结构。 DOT-MoE(arXiv: 2606.01666)则更进一步,把 neuron-to-expert assignment 和 routing 做成可联合优化的问题,而不是简单做启发式切分。

打开网易新闻 查看精彩图片

这些研究其实离产品并不远。我们做的是一整套本地智能解决方案,模型只是其中一层。基础研究决定模型和架构的上限,量化和推理系统决定这些能力能不能高效跑在个人设备上,上层产品再把它变成稳定、自然的使用体验。用户最终不需要知道背后是哪一种 Attention、是不是 MoE,甚至不需要知道具体用了哪一个模型;他只需要感觉这套本地智能真的聪明、快、稳定、好用。

机器之心:官方 FAQ 里面提到团队正在研究扩散式语言模型等新架构。为什么 dLLM 对本地场景有吸引力,是解码速度、显存占用,还是别的?它和混合线性注意力是同一条效率主线上的两种选择,还是各自服务不同目标?这条路线目前处在什么阶段,有没有可能出现在下一代模型里?

郭权玮:dLLM 最吸引我们的其实不是显存。它真正动的是自回归模型最根本的串行生成方式。传统模型一个 token 接一个 token 地生成,而扩散式语言模型给了我们并行生成和反复修正一段 token 的可能性。现在已经有工作证明,通过并行解码和 Cache 机制,dLLM 的推理速度还有很大的优化空间

这对本地特别有意思,因为个人设备的算力和内存带宽都是有限的,单纯把模型压小并不能解决所有问题。如果生成算法本身能减少串行步骤,那是在另一个维度上改变效率。当然,dLLM 目前还有质量、KV Cache、长序列计算和工程成熟度的问题,所以我不会说它现在已经是更优解。

它和混合线性注意力也不是二选一。可以简单理解为,混合线性注意力主要在改变「上下文怎么计算」,dLLM 更像在改变「答案怎么生成」,解决的是两个不同层面的瓶颈,理论上甚至可以组合。

我们下一代模型不预设一定采用哪一种架构。我们也不会为了「新架构」三个字去上新架构。只有当它在真实本地任务里同时证明能力、速度、内存和稳定性都更好,它才有进入产品的意义。

产品、开放与一年之约

机器之心:为什么还下载不了?这可能是用户当下最关心的问题:StartLux-27B 已经亮相、也通过了信通院测试,但大家目前还无法直接下载使用。能否说明一下开放节奏:目前处于什么阶段,备案进展如何,完成后会以什么形式开放?会发布多个不同版本吗?在正式开放之前,普通用户和技术社区可以怎么体验?

郭权玮:根据规定,大模型企业在首次面向公众提供服务之前,需要提交备案申请。目前模型相关备案已经提交,刚进入审核流程。在完成相应合规程序之前,我们暂时不会直接面向公众开放下载和自助使用。

备案完成以后,我们会逐步开放模型,也会有不同版本,不一定只是一套权重。因为真正到了本地,不同硬件、内存和使用场景,对模型大小、量化方式和 Context 的要求都不一样。

正式开放之前,我们已经保留了申请测试的通道,感兴趣的用户和开发者可以通过官网申请,我们会分批邀请体验。

另外,模型只是 StartLux 本地智能系统的一部分。我们还在同步做推理系统、量化、Agent Harness 等,最快年内希望先让公众体验到第一版本地智能产品。

机器之心:你们的官方表述是「全球第一家主打本地模型的 AI 公司」。这个说法一定会被读者拿去和一批玩家对照,比如做端侧模型的芯片与终端厂商、Mistral 与 Liquid AI 这类小模型公司、以及 Perplexity 这样从云端切进来的应用公司。能否界定一下你们所说的「主打本地」?

郭权玮:我们说的「主打本地」,不是指做一个比较小、能够下载到电脑上的模型。更准确地说,本地是我们的默认技术架构,也是产品起点。从模型、量化、推理系统,到专门为本地设计的 Agent Harness、搜索和持续学习,我们希望核心能力尽可能运行在用户自己的设备上。

所以这和芯片公司、小模型公司,或者一个云端产品增加 Local Mode,出发点还是不太一样。我们从一开始就在想一个问题:如果一个人的 AI 真正属于他自己,那从模型到系统应该长什么样?我们所谓的「本地」,其实是在做一整套属于个人的 AI 系统,而不只是一个本地模型。

机器之心:你们给自己定了一年的验证标准:用户愿意长期把文件、研究和办公交给本地 AI,模型能连续工作几小时、成功率接近甚至超过云端方案。亮相半个月后,离这个标准最近和最远的地方分别是什么?规划中的完整本地智能系统,除了 Agent 和 Memory 还有什么,什么时候能与公众见面?

郭权玮离这个目标最近的其实是底层能力,而且不是只有模型在进步。模型、量化和本地推理系统迭代很快,硬件也在快速抬高本地 AI 的上限。像 DGX Spark、RTX Spark 这一类新设备的出现,意味着个人设备能够承载的模型规模和持续工作能力都在快速变化。

最难的还是把这些能力变成一个用户可以连续用几个小时甚至更久,而且不用理解背后技术细节的产品。长任务里的稳定性、失败恢复、上下文管理和整体体验,这些比单纯把模型跑起来难得多。

我们规划的是一整套本地智能系统:底层有模型、量化、推理系统和不同硬件的适配,上面有面向本地环境设计的 Agent Harness、工具和搜索,再往上才是用户真正看到的产品。第一版不会把所有研究成果一次全部放进去,而是先把体验做完整。

按照目前的进度,我们计划在年内推出首个面向公众的体验版本

机器之心:最后,请展望一下「本地×RSI」的未来。

郭权玮:我觉得「本地×RSI」最后不会只是一个会自己更新的聊天助手。

我更希望它成为属于每个人自己的独立研究者。你可以让它长期研究材料、医学、金融,也可以研究 AI 本身,甚至研究怎么把自己的推理系统做得更快。它每天从真实工作里产生新的数据和反馈,在受控条件下更新参数、改变策略,未来甚至调整自己的结构。

今天我们使用 AI,基本上还是每个人在访问同一个模型。未来可能完全不一样:每个人的 AI 都有自己的参数、自己的经验、自己的研究方向,也有自己的进化路径。

如果这件事情真的成立,本地的意义就不只是隐私或者省 Token 了。它意味着 AI 第一次可以长期属于一个人,并且和这个人一起成长。