清华大学副教授代季峰创办的隐形AI“独角兽”NaiveAI 刚刚发布 了核心模型Naive-N0.5-Flash,并开放模型权重。
这是一款 3090 亿参数的 MoE 模型,但实际激活参数约为 155 亿,主要面向编程和 AI 研发任务。
它原生支持 100 万 Token 上下文,而且没有使用传统的全量 Attention。
NaiveAI 对它采用了一套混合 Attention 架构:大部分层使用 Sliding-Window Attention(SWA),少数层使用 DeepSeek Sparse Attention(DSA),整体比例约为 5:1。
SWA 只关注附近的 128 个 Token,而 DSA 会从完整历史中筛选出最重要的 2048 个 Token,再进行后续计算。
这套设计解决的是长上下文下的计算效率问题。NaiveAI 给出的目标,是让模型在拥有 100 万 Token 上下文的同时,减少 Attention 带来的计算和内存开销。
但 NaiveAI 真正想展示的,并不只是一个模型架构。
从模型设计、训练,到推理系统和工程优化,NaiveAI 都在尝试让 AI 模型自己参与研发过程。
NaiveAI 的研发方式是,研究人员负责确定目标、计算预算、约束条件和评价标准,AI 模型则参与写代码、运行实验、分析结果、优化方案,并根据实验结果决定下一步尝试什么。
而Naive-N0.5-Flash 本身就是这样开发出来的。AI 模型参与探索了它的混合 Attention 架构,也参与了训练、推理和部署系统的优化。
为了让这种研发方式能够真正运行起来,NaiveAI 建立了一套面向 AI 研发的基础设施。
根据其公开介绍,这套系统每周处理接近 1000 万个沙箱sandbox,峰值同时运行的沙箱达到 10 万个,并通过统一控制平面管理计算资源、运行环境、工具、权限和安全。
NaiveAI 还把这种方式用于推理系统。
它开发了 NaiveRT,一个专门为 Naive-N0.5-Flash 优化的推理运行时。在 8 张 GPU 上,NaiveRT 的单流解码速度最高达到每秒 2122 个 Token。一次完整的 speculative decoding round,从 SGLang 的 12.3 毫秒降低到 3.4 毫秒。
这个系统同样不是完全由人工完成。
NaiveAI 表示,NaiveRT 的核心优化工作在 6 天内完成,共进行了 151 次有记录的优化实验,其中 63 次最终被采用,71 次因为验证失败或性能回退而被撤回,另外 17 次用于探索替代方案或原型。
AI 模型参与了整个过程,包括性能分析、候选方案实现、数值验证、多 GPU 测试,以及对实验结果的分析。
其中一个典型例子是 GPU Kernel 优化。
NaiveRT 将原本需要多次执行的计算过程重新组合成Mega-Kernel,同时利用 Programmatic Dependent Launch,让部分 GPU 操作可以直接衔接下一步执行,减少 Kernel 启动、同步以及中间数据传输带来的开销。
NaiveAI 还特别强调了一点,一个局部的 Benchmark 变快,并不意味着整个模型真的变快。
因此,AI 模型并不是简单寻找某一个 Kernel 的最快结果,而是观察这些修改放到完整模型运行路径之后,是否真正降低端到端延迟。有些优化在单独测试时看起来更快,但放进完整模型后反而变慢,最终就会被放弃。
这种“实验—验证—修改—再实验”的方式,也被 NaiveAI 用到了模型研发之外的任务。
例如,NaiveAI 让 Naive-N0.5-Flash 从零开始参与一个 World Model 项目。此前,World Model 并不是 NaiveAI 已经建立起来的研究方向。
研究人员只设定了研究目标、计算预算和评价方法,之后由 Naive-N0.5-Flash 参与设计方案、训练模型、运行评测、分析结果,并决定下一步实验方向。
经过累计 400 小时的研究和 15 轮主要实验,最终得到的 AutoWM 在公开的 WorldArena-1 Track 1 评测中取得 77.43 分,而此前公开的最高成绩为 73.64 分。
过程中,AI 不只是执行一套预先写好的实验流程,而是根据实验结果不断改变研究方向,包括调整训练数据、重新设计数据筛选方式、改变视频帧采样策略,以及探索推理阶段的结果选择和后处理方法。
这也就是NaiveAI 所说的“AI-centered R&D”:不是把 AI 当成一个辅助研究人员的工具,而是让 AI 模型本身进入研发循环。
NaiveAI 将这条路线进一步指向了一个更大的目标——Recursive Self-Improvement,也就是递归式自我改进。
按照其公开描述,理想的研发循环是,AI 模型参与制造下一代模型,而下一代模型又能够承担更多 AI 研发工作,从而让 AI 参与研发的程度不断提高。
目前 Naive-N0.5-Flash 的模型权重和推理代码已经按照 MIT License 开放。NaiveAI 同时提供 API,并公开了 NaiveRT 的相关代码、Docker 环境以及模型权重。
热门跟贴