自现代大模型诞生以来,“下一个Token预测(Next-Token Prediction, NTP)”就被奉为不可撼动的黄金律条。然而,逼着模型逐字死记硬背,真能学会宏观语义规划吗?
近日,arXiv 上悄然挂出了一篇来自上海人工智能实验室与上海交通大学人工智能学院 LUMIA Lab 团队联合撰写的技术报告——《NCP-ArchPreview Tech Report》。没有什么铺天盖地的宣发,这篇论文却在短短几天内自发引爆了开源与极客社区:一举登顶 HuggingFace Daily Papers 榜首,HuggingPapers 官方及海外多位知名科技博主纷纷转发剖析;海外科技评论人VISION IA更是在 X 上给出了极高评价:“这篇论文很可能构成了未来 AI 的第一块基石(might constitute the first brick of the future of AI...)”。
让全球研究者如此兴奋的原因极其纯粹:他们打破了纯 Next-Token Prediction(NTP)的单一教条,在大规模预训练中直接引入“下一个概念预测(Next Concept Prediction, NCP)”这一全新的预训练任务,跑通了全球首个 8.9B 规模的离散隐空间基座模型,在Dolmo-3的 5.73T 大规模开源语料预训练中,仅消耗 51.3% 的 Token 预算就追平了 OLMo-3-7B 的最终预训练 Loss,等效收敛速度狂飙 1.95 倍! 与此同时,GSM8K 推理暴涨近 6 个点,更附带了“17M 参数零遗忘微调”、“推测解码免费加速”等一系列意想不到的外溢红利。目前,团队已将包含数十个训练阶段 Checkpoint 在内的全部资产彻底开源。
在视觉生成领域,从像素空间走向隐空间(Latent Space)的 Latent Diffusion 彻底改写了文生图的效率格局;在视频与具身智能领域,LeCun 力推的 JEPA 架构也在证明预测高维表征远优于重建底层细节。但在大语言模型(LLM)的世界里,大家似乎习惯了“逐词预测”的自回归范式。即使是当下大火的多Token预测(Multi-Token Prediction, MTP),其损失函数依然被牢牢绑定在浅层表面的 Token 上。语言模型内部明明已经自发形成了丰富的语义抽象与世界表征,我们为什么不能直接在隐空间中对其显式监督,让模型学会更高层级的“概念规划”
针对这一长期痛点,研究团队交出了一份惊艳的答卷:NCP-ArchPreview。
- 论文标题:NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction
- 论文链接:https://huggingface.co/papers/2609.10715
- 开源权重:https://huggingface.co/collections/ArchSpace-Collection/ncp-archpreview
- 评估代码库:https://github.com/LUMIA-Group/ncp_olmo_eval
一、 51.3% Token 追平收敛!万亿规模下的效率神话
在以往的研究中,许多非标准 Transformer 架构往往只能在玩具级数据(Toy Dataset)或几百兆参数的小模型上自娱自乐,一旦推向 Trillion 级别的大规模真实预训练,常常遭遇 scaling 失效或训练崩溃。
但 NCP-ArchPreview 直接把实验做到了8.94B参数,并基于严格对齐完全开源的 5.73T Dolma-3 语料展开了全周期的工业级预训练。
对比开源界最具说服力的基准之一 OLMo-3-7B,其实验曲线呈现出令人咋舌的效率优势:
1.预训练收敛速度翻倍:在第一阶段(Stage-1)的 5.73T 训练中,NCP-ArchPreview仅用了 51.3% 的 Token 预算,就追平了 OLMo-3-7B 跑完全程才达到的最终预训练 Loss,等效收敛速度提升达 1.95 倍;最终收敛 Loss 比官方基线足足低了。在 Stage-2 退火阶段,其收敛速度同样达到基线的 1.51 倍。
2.计算 Pareto 前沿大幅外扩:团队进行了严格的 “算力对齐(Computation-aligned)”与“尺寸对齐(Size-aligned)”的消融实验。由于概念模块的序列长度被大幅压缩,NCP-ArchPreview 在仅消耗 40 层 Transformer 基线 85% 算力的情况下,逼近了后者的训练 Loss;在不同算力预算下的 Scaling Law 拟合表明,其计算帕累托效率带来了1.74 倍的系统性提升
更重要的是,更低的困惑度直接转化为了下游任务的全面领先:
- 下游综合表现全方位压制:在涵盖 30 个基准大类的系统评测中,Stage-1 综合宏观平均分超越 OLMo-3-7B 达+2.45 分
- 复杂推理与代码能力暴涨:在数学推理方面提升最为惊人,GSM8K 提高 5.99 分(从 39.27 提升至 45.26),GSM-Symbolic 提升 3.95 分,Minerva 提升 3.11 分;代码生成方面,HumanEval 暴涨 4.28 分(从 27.10 升至 31.38),多语言代码基准 MultiPL-E MBPP 提升 5.29 分!
二、 拆解 NCP 架构:
让模型学会“边想大纲,边抠字眼”
能够取得如此大幅度的效率跃升,NCP-ArchPreview 究竟在架构上动了什么底层手术?
团队在经典 Transformer 骨干中巧妙植入了一个“三段式”的隐空间概念处理流水线(Token Encoder → Concept Module → Token Decoder),配合乘积量化(Product Quantization, PQ)与分层残差路由机制,实现了显式的未来概念建模:
1. 概念提炼与乘积量化码本(VQ Codebook)
模型并非在无边界的连续向量空间里任意漫游,而是构建了一个结构化的离散概念词表:
- Chunk 压缩:底层 16 层的 Token Encoder 处理输入序列后,每连续 k=4 个 Token 的隐藏状态被 Mean-pooling 聚合为一个连续概念表征 cm(概念序列长度缩短至原先的 1/4)。
- 超大容量的VQ量化:为了避免维护一个天文数字级的扁平码本,团队将概念表征切分为 S=32 个段,每个段匹配大小为 N=128 的独立子码本。通过这套乘积量化组合,以极微小的参数开销换取了高达 128^32 的巨大离散概念表征空间!
2. 可微的下一个概念预测(NCP)
中间由 8 层 Transformer 组成的 Concept Module 负责自回归地预测“下一个概念”。
3. 严格的因果防泄漏反馈机制
预测出的未来概念并不是游离在外的辅助信号,它会被重复扩展回 Token 分辨率,并在时间轴上施加因果位移(Causal Shift Δ=k=4),残差融合进顶层 16 层的 Token Decoder 中。
这种因果位移保证了 Token Decoder 在解码第 t 个词时,能够合法地参考先验的“宏观概念方向”,而绝不会发生未来 Token 信息的泄露穿越。
4. 破除瓶颈的分层残差路由(IRC + CRC)
为了让底层 Token 细节与高层宏观概念顺畅互通,研究团队借鉴 MUDDFormer 设计了分层残差连接:
- 模块内残差(IRC):每一层都能动态组合当前模块之前所有层的表征;
- 跨模块残差(CRC):在 Encoder、Concept Module 和 Decoder 之间架设直通桥梁。
消融实验证实,仅需多引入 0.051% 的极微计算量,IRC+CRC 就能带来 0.0323 的系统性 Loss 下降。
三、 隐空间的额外彩蛋:
参数高效微调与推测解码“双丰收”
如果说大幅缩减预训练 Token 是 NCP 架构的“本分”,那么它在下游任务中展现出来的外溢收益,则完全称得上是意料之外的“巨大红利”:
彩蛋 1:仅微调 17M 隐空间参数,击败 LoRA 还不发生遗忘!
在下游领域微调中,全参数微调代价高昂且极易导致灾难性遗忘,而常规 LoRA 往往也会在通用基准上造成掉点。
由于 NCP-ArchPreview 拥有一套独立的离散概念码本,团队提出了一种前所未有的微调界面:完全冻结 8.9B 的骨干网络,仅仅微调其 VQ 码本和概念预测头(仅约 1700 万参数,+VQ 模式)。
评测结果令人瞩目:
- 数学领域:在 GSM8K 和 MATH-500 上,17M 参数的 VQ 微调平均分从 30.56 跃升至34.83(+4.27),直接超越了同等 17M 参数量的 LoRA(+3.15)!
- 零遗忘特性:最惊人的是通用能力保留度——Full 微调在通用集上下降了 0.97 分,LoRA 下降了 0.42 分,而VQ 微调后的通用能力甚至逆势上涨了 +0.39 分!
- 工程吞吐暴涨:在 8 张 GPU(MBS=1)的实测中,VQ 微调的训练吞吐量达到了 15,632 tokens/s/GPU,是全量微调的 2.02 倍,也是 LoRA 的 1.50 倍;显存占用相比 LoRA再降 34%(单卡 MBS=2 时,全参数直接 OOM,LoRA 占用 87.9%,而 VQ 仅占 51.6%)!
彩蛋 2:概念先验注入,推测解码“免费提速”
在大模型推理加速领域,块级并行草稿模型(如 DFlash2)往往因为难以维持长距离的多步预测轨迹而限制了接受长度。
团队尝试将 NCP-ArchPreview 生成的 Chunk 级概念表征直接注入到 DFlash2 草稿模型中。整个过程仅仅为 1.1B 的草稿模型增加了 0.04M(约 4 万)参数,没有给 Target 模型带来任何额外计算,却让整体的平均接受长度(Mean Accepted Length, MAL)相对提升了 4.17%,在 HumanEval 代码任务上更是暴增+7.59%
这证明:隐空间学到的不仅是抽象特征,更是极具前瞻性的宏观逻辑规划,能够直接赋能推理加速。
四、 极其坦诚的技术洞见:踩坑与开源实践
在长达 40 余页的技术报告中,这篇工作展现出令人钦佩的严谨与工程透明度:
- 排查 Muon 优化器与 QK-Norm 的暗礁:团队在报告中详细复盘了使用 Moonlight Muon 矩阵优化器配合层级 Q/K Normalization 时遭遇的注意力 Logit 爆炸与梯度突刺现象,并剖析了其机制(全矩阵更新耦合了多头比例,层归一化无法约束单头离群值)。他们验证了 Per-head QK-Norm 能完美平抑这一隐患,并将其完整机理毫无保留地写入了报告。
- 千亿级代理指标筛选机制:针对 Stage-2 退火阶段“训练 Loss 越来越低、下游任务却可能由于分布不匹配而掉点”的工业界普遍难题,团队构建了基于 1 亿 Token 专家轨迹的轻量级无痛筛选代理(100M Proxy),仅凭单次前向 Log-Likelihood 即可高相关度预测下游能力分布(R2 最高达 0.999),为退火配方提供了绝佳的风向标。
- “全透明”开源生态(ArchSpace):团队拒绝做“只扔最终权重”的黑盒发布,而是在 HuggingFace 上开放了 ArchSpace 集合,公开了从 100K 步、200K 步直至 1.2M 步的全程阶段性 Checkpoint、评测框架与投机草稿模型权重,甚至详细列出了消融数据,供全球社区深入研究非经典架构的演化动态。
结语
在全行业算力逼近极限、单纯堆叠数据与参数的边际效益日益递减的当下,NCP-ArchPreview 用扎实的万亿 Token 实验证明:我们依然可以在自回归架构的根本机制上做文章。
从纯粹被动的微观 Token 模仿,转向具有宏观自顶向下指导意义的“隐空间概念预测”,不仅大幅拓宽了基础模型的训练效率上限,更为模型微调、长序列扩展乃至端到端系统加速开辟了一座全新的富矿。
热门跟贴