文|王欣逸

编辑|张雨忻

如果你近期有和投资人闲聊两句,会得出这样一个结论:AI圈的关注点再一次回到了模型和AI Infra(基础设施)。模型,对应着时下应用遇冷,热度向上游转移;而AI Infra的关注点之一,是后训练平台和推理平台。

昨天,Mind Lab发布了他们的最新成果:推出面向行业的模型后训练与推理平台Mint Recursive,以及基于这一平台做后训练的模型Macaron-V1.1。

Macaron-V1.1是一个基于GLM-5.3做后训练、参数为752B的模型。7月,Mind Lab创始人陈锴杰告诉我们,从基于GLM-5.1后训练的Macaron-V1-Preview到基于GLM-5.2的Macaron-V1,中间只隔了不到一个月。而迭代还在加速,据了解,Macaron-V1.1从上一代迭代而来仅用了不到两周。

Macaron-V1.1由744B的基座模型和四个2B的LoRA专家模块组成,其中四个LoRA分别负责Chat、Agent、Coding和Generative UI(生成式UI)。

从V1的1B LoRA变成了现在的2B LoRA,他们也正在摸索更为理想的专家参数规模。从Benchmark结果来看,相比V1,V1.1在6个Agent榜单上全面提升,在SWE-Marathon(超长程AI编程能力)表现尤为出色。。

打开网易新闻 查看精彩图片

△Macaron-V1.1 benchmark表现,来源:企业

更值得注意的是,Macaron V1.1完全基于Mint Recursive完成训练。

Mint Recursive是一个后训练与推理平台,其工作流程包括测评、数据、后训练与部署推理,用户通过API和Python SDK即可调用平台的训练和部署能力;还能接入生产环境中的反馈,让模型在真实任务中持续改进。而这套流程,Mint Recursive 在Macaron V1.1模型的迭代上已经跑通。

就在这一节点,Mind Lab集中发布了一系列成果,把过去一段时间在持续学习与Infra领域积累的Know-how,沉淀为一套可对外提供的服务。

做后训练的Infra

Mind Lab一边做模型、一边做Infra,这并不让人意外。

在今年1月,他们就率先推出了Mint Recursive的早期形态——一个关于LoRA训推的基础设施平台,为客户提供大模型后训练全流程解决方案。

与此同时,在Infra层面下功夫,正慢慢成为一个行业共识。

几天前,智谱创始人、首席科学家唐杰在X上发了一篇长文,阐述了他们用AI改进AI的最新进展,他们让GLM-5.3驱动的Infra Agent,自动优化GLM-5.3自己的推理引擎,让一个超10万张国产芯片组成的集群,在不到两周的时间里,将端到端吞吐提升至初始基线的3倍。

智谱正在做的就是让AI去自我改进推理层Infra。同样是模型参与优化自己,大家想解决的问题不同——Mind Lab要做一个后训练平台,想优化的是从整个后训练到部署推理的流程,囊括数据、评测、部署、反馈收集等步骤。

Mint Recursive平台由三大模块组成:Train&Deploy(训练与部署)、Env Hub(环境中心)、Data&Experience(数据与经验)。这一平台支持模型、SFT(监督微调)、RL(强化学习)、DPO(偏好训练)、全参微调等算法,兼容GLM、Qwen、DeepSeek、Kimi、MiniMax等多种尺寸的开源模型;训练完成后可一键部署,还有配套的测评体系,为下一轮模型训练做准备。

去年9月,OpenAI前CTO Mira Murati创办的Thinking Machines Lab发布了一篇名为《LoRA Without Regret》的技术博客,从理论和实验上证明了,只要方法得当,LoRA的效果可以比肩全参数微调。从那以后,LoRA几乎成了后训练领域的普遍采用的方案。

值得一提的是,Mind Lab一直关注“LoRA”这一后训练范式,这次他们也在这条路线上更进一步,在Mint Recursive中,他们用LoRA把训练和部署都做成了Serverless(无服务器)的模式:客户无需自己买GPU、管理集群,可以直接按Token用量计费。

在训练侧,Mint Recursive想实现的是让模型更聪明——用LoRA的方式,只训练一些少量的新增参数,根据业务目标,不断从业务反馈中学习、持续迭代能力,让模型变得更懂业务,与此同时,还能显著降低企业后训练的开销。

在部署侧,4个LoRA专家模块对应的4个业务版本各自是一个轻量级的Adapter(外挂插件),挂在同一个基座模型上。这些Adapter互不干扰、非常灵活,每个Adapter都能单独升级、上线与下线,历史版本也保留着,便于客户对照与回滚。客户也可以把某个Adapter合并到基座模型里,变成一个完整的、独立的模型。

这也正是LoRA的核心思路,共用基座模型,在每个业务场景只做针对性的后训练。好处在于,模型后训练、部署与迭代的成本能实现大幅下降,调整权重也更加灵活。

后训练所需的数据、评测、反馈等,每一步都离不开Infra的支撑。从做后训练到做后训练Infra,Mind Lab的选择很自然。

但在交出Mint Recursive答卷之前,他们也能做了很多准备:

2025年,Mind Lab开始在Kimi K2这样的万亿参数模型上做后训练研究,Mint Recursive的基础设施最早也是那时开始搭的;

随后,2025年底,他们向NVIDIA Megatron-Bridge贡献了业界首个1T参数量级的LoRA-RL,为Megatron补充了面向超大规模基座的轻量化强化学习的经验;

2026年中,参与火山引擎的强化学习训练框架veRL、NVDIA的下一代训练后端megatron_lite等多个开源项目,提供了一些LoRA和强化学习解决方案;

2026年7月,Macaron-V1系列正式发布并开源,验证了这套训练方案在Agent、Coding等任务中的有效性。

Infra很重要,但不是所有公司都能做Infra,以及有必要单独做Infra。

万亿模型的后训练,工程难度远超想象。分布式训练的显存调度、训推一致性的精度对齐、异步RL的权重热更新,对于一家创业公司而言,每一块都是硬骨头。

陈锴杰告诉我们,训练小模型的强化学习其实很容易,但是一旦规模上来了,难度会变得非常大,尤其是他们还在强化学习之上,叠加了LoRA的持续学习训练方法。

目前,Mint Recursive主要提供三种服务:类似FDE形式的专家与企业一起完成训练;依托平台进行自动化训练;企业通过API和Python SDK自主训练。

训一个企业自己的模型

越来越多企业想要拥有自己的模型,这也是轻量的后训练、持续学习的训练范式被推崇的原因。

从落地角度看,企业端或许是定制化模型最为迫切的场景。“通用大模型仅能覆盖各行业20%-30%的场景,剩下70%-80%的部分,都需要垂直持续学习来优化。”陈锴杰提到。

海外市场已经先一步验证了这个趋势。Fireworks AI,一家做开源模型推理和后训练托管的硅谷公司,今年7月,其估值已经达到175亿美元,ARR突破10亿美元,日Token处理量超过40万亿。

Fireworks AI CEO乔琳在和红杉的对谈中提到:“后训练已经不是模型团队专属游戏了,AI产品在找到PMF、开始规模化后,后训练几乎是它们绕不开的一门必修课。”

具体来看,相比于模型厂商,AI产品公司的壁垒在于用户真实使用产生的数据、真实任务、反馈与偏好等。Fireworks平台上95%以上的流量,来自客户自己微调的专用模型,而不是通用基座。这一逻辑,被乔琳定义为“拥有自己的智能”。

“应用公司做模型”这一选择,正发生在越来越多的企业身上——AI应用的竞争点从产品本身,逐渐变成产品的经验智能,包括自己的判断、Taste、业务数据和对客户的理解等方面。

应用公司最独特的资产来自真实生产环境:它知道用户究竟想完成什么、哪些结果算好、哪里反复失败,以及专业人员真正怎样判断结果。如何让企业拥有自己的智能、把行业经验合并进基座模型中?

Mint Recursive在尝试的就是让企业建立起自己的评测体系、奖励机制、训练数据,把后训练做成一个持续迭代的闭环:模型在服务用户后积累下真实任务场景数据,每次交互的轨迹,无论成功还是失败,都会被完整记录下来。

这其中,失败的轨迹相当有价值,哪里做错了、为什么错、应该怎么改,平台在找到问题和解决方法后,这些判断和轨迹会直接变成新的训练数据;用新数据重新训练完上线后,又会产生新的反馈,新的反馈又变成下一轮训练的输入,如此循环往复。

平台中的Env Hub(环境)环节容易被忽略,但它尤其关键。英伟达的一篇Agentic RL技术博客中提到,做Agent强化学习需要环境来定义数据集、验证器和状态。环境不只是模型的训练场,也是评测场,评测、合成数据、强化学习,都可以在一套环境中完成。

尽管Mint Recursive中的Recursive(递归)还处于初级形态——人依然在递归的回路中,离模型全自动自己训练还比较遥远,但模型迭代方向已经很明确了。对客户而言,更为重要的不是模型本身,而是企业手里的一线业务现场与独一无二的真实业务数据。

图片来源|企业供图

欢迎交流~

本文来自微信公众号“智能涌现”,作者:王欣逸,36氪经授权发布。