“只有最小化单位智能成本,才有可能训练出最大化的智能水平;只有降低单位智能的供给成本,才有可能让更高水平的智能进入更广泛的生产和生活。”8月26日晚,MiniMax创始人、CEO闫俊杰在2026年中期业绩会上这样表示。
当晚,MiniMax在2026年中期业绩会上披露多项最新经营数据及模型研发进展。公司第二季度收入较第一季度环比增长81.8%。进入第三季度后,7月Token消耗量已达到1月的20倍,8月年度经常性收入(ARR)增长至8亿美元以上。
MiniMax的收入结构在快速变化。从最新ARR结构看,To B业务占比已达到约80%,To C业务占比约20%,对比去年同期To B业务占比约30%、To C占比约70%,企业和开发者对模型的采用速度明显在加快。随着M2系列持续升级以及M3、H3相继推出,模型智能水平和推理吞吐同步提升,企业及开发者的模型调用需求正在成为MiniMax新的收入主力。
8月ARR超8亿美元
MiniMax当日发布的中期业绩显示,2026年上半年,仅半年即达到2025年全年收入的1.5倍。其中,第二季度收入较第一季度环比增长81.8%,显示收入规模仍在逐季扩大。
报告期后,公司业务增长进一步加速。7月,MiniMax Token消耗量达到1月的20倍;8月ARR超过8亿美元。MiniMax表示,模型能力提升是 ARR 增长的核心驱动力。在M3相较M2系列价格不变的情况下,模型智能水平进一步提高,既吸引了更多新客户,也推动现有客户解锁更多使用场景。目前,MiniMax企业客户和开发者数量已突破200万,是2025年底的10倍。
与此同时,模型消费正从“人与AI的交互”拓展至“Agent 与AI的多轮交互”。人类提出的任务会被Agent展开为多轮模型请求、工具调用和子Agent任务。由Agent驱动的推理需求增长显著快于用户数和消息数增长,进而带动单用户Token消耗快速提升。
对于增长的可持续性,闫俊杰给出了更长期的判断:“大语言模型带动的智能提升几乎没有尽头”。从Coding和Agent能力的实用,到更自主、更具创造性地完成长程任务,再到未来端到端交付可依赖的结果,MiniMax持续在追求更高的智能。他还表示,随着M系列与H系列两条管线的持续完善,未来一段时间内模型的发布周期会显著缩短,智能提升速度会变快。
To B业务占ARR约80%
MiniMax的业务结构也在发生明显变化。当前ARR中,To B业务约占80%,To C业务约占20%。
从财报确认收入看,2026年上半年,MiniMax开放平台及其他AI企业服务收入达到7390万美元,同比增长703.1%,占总收入的比例由上年同期的30.3%升至63.4%。
从2025年B端与C端整体收入比例约为3:7,到2026年上半年B端确认收入占比超过60%,再到当前ARR中To B业务占比达到80%,反映出企业及开发者业务正在以更快速度扩张。
从地域结构看,国际化仍是MiniMax收入结构的重要特征。2026年上半年,公司海外收入占比约为60%,国内收入占比约为40%。从模态结构看,越来越多客户开始同时使用语言、视觉和声音能力,M3和H3正在共同推动模型调用及ARR增长。
MiniMax在业绩会上披露了M3.1和M3 Pro的研发方向。M3 Pro的参数规模预计提升至约3T,并进一步扩大强化学习和长程任务训练,以提高模型的泛化能力和智能上限。
为支撑后续模型迭代,MiniMax通过自主可控核心集群、云厂商供给及Token Factory 合作,搭建了综合算力供给网络。公司现有及规划算力能够支持3T级文本模型和视频模型持续迭代。公司也在推进M3和H3的国产芯片适配,大规模国产算力集群将很快上线,并逐步承担真实生产流量。
闫俊杰在会上再次阐释了公司的技术路线。通过“Minimize the Inference Cost,Maximize the Intelligence”实现 “Intelligence with Everyone”。在他看来,这不仅是提供有性价比的服务,更是面向更高级智能进行有效Scaling的核心能力,因为后训练的规模在模型能力中的作用越来越大,而inference的成本决定了后训练的规模。
H3开源三周下载量超过2400万次
多模态是MiniMax除语言模型之外的另一条主要技术管线。公司认为,多模态并非简单增加一种输入输出形式,而是通过语言模型与视觉生成模型的深度融合,帮助模型更完整地理解真实世界。
H3是MiniMax将语言模型能力与视觉生成能力结合的一次实践。语言模型不仅用于理解Prompt,也参与理解上下文、参考素材和用户意图,并将其转化为更精细的生成控制。
H3开源三个多星期以来,下载量已经超过2400万次,产生超过300个公开衍生模型,成为2026年全球下载量最高的模型。受模型口碑和性价比带动,其线上官方服务使用量也实现了快速增长。
MiniMax认为,开源能够降低开发者和企业的使用门槛,使模型更快进入云平台、开发者工具及企业工作流;长期定价能力则主要取决于模型效果、成本、稳定性、迭代速度及企业级交付能力。
“模型创新决定我们能够把智能推到多高,模型效率决定这种智能能够供给多大规模,强化学习和真实反馈决定下一轮智能能够进步多快,多模态和专业领域决定智能能够进入多深和多广阔的真实世界。” 闫俊杰表示,下一阶段将继续推进模型智能、推理效率和基础设施能力的协同提升,加快M系列与H系列模型的研发及发布周期。
以下为闫俊杰发言实录:
各位投资者、各位分析师,大家晚上好。感谢大家参加MiniMax 2026年中期业绩会。
今年以来,我们陆续升级了M2系列模型、推出了M3和H3等模型。随着模型智能水平的提升以及推理吞吐的增加,业务整体上实现了快速增长。 7月份Token消耗量已达到1月份的20倍,Q2收入相比于Q1环比增长81.8%,8月份ARR进一步提升至超8亿美元。随着M系列与H系列两条管线的持续完善,公司预计未来一段时间内模型的发布周期会显著缩短,智能提升速度会变快。
今天借助这个机会,我来分享下我们的定位和战略。
大语言模型带动的智能提升几乎没有尽头,从去年下半年开始Coding和Agent能力的实用,到后续更加自主性和创造性的完成长程任务,再到未来可预期的端到端交付可依赖的结果,我们持续在追求更高的智能。
但是算力对每家公司都是有局限的,通过“Minimize the Inference Cost,Maximize the Intelligence”实现“Intelligence with Everyone”,这是我们一直坚持的技术路线。 我们认为这不只是提供有性价比的服务,更是面向更高级智能进行有效Scaling的核心能力,原因是后训练的规模在模型能力中的作用越来越大,而inference的成本决定了后训练的规模。
对于模型来说,首先看智能的等级,其次看性价比。模型的智能等级跟模型的参数规模有直接关系。我们的选择是在模型规模是持续研发行业最大的一档的同时,探索最优的架构来实现预训练Loss与计算效率的平衡。然后借助于计算效率的优势,在后训练中尽可能的Scaling。
首先是预训练,在大参数模型的架构上,我们分步探索了两种极限,一是混合专家的稀疏,我们专家的稀疏度在2%以内依然能保持良好的收敛性。二是Attention的稀疏,我们提出了MiniMax Sparse Attention的架构,在保持训练稳定性的同时大幅压缩了长上下文的计算效率。在我们正在研发的旗舰模型中,我们提出了MSA 2.0,进一步压缩了KVCache需要的存储容量,从而使得在推理的时候增加Prefilling的缓存命中率以及增加batch size从而使得算力利用率变的更高。在最大的参数量这个档位,我们的计算效率相比于第一代架构有了3倍的提升,并且在越长程的任务上优势越大。
其次是在mid-training和post training的算力占比越来越多,这里面的训练Token有越来越多来自合成数据、强化学习训练过程中的Rollout,以及支撑实验的大量评测,这三种计算模式的实质都是推理。尤其是随着长程任务的占比越来越高,长上下文下的推理效率变成scaling的关键。推理高效的结构越容易在mid-training和post training中scaling的更快,长期就更占据优势。在相同的算力规模下,可以认为推理计算效率的提升倍数跟后训练的规模变大倍数基本线形相关。
大参数模型上架构带来的优势和后训练规模持续变大预计会在后续的模型更新中有直接的体现。
在跟云厂商加强合作的基础上,为了进一步增加算力供给,我们是国内最早两家建立规模化、长期稳定的基础设施的独立大模型公司之一。这是我们能够同时研发两款模型的关键支撑。我们基础设施已经能独立支撑我们最大的训练任务,其ETTR(Effective Training Time Ratio)已经可以达到97%。
全栈能力不仅能提升我们的训练规模,还使得我们在体系结构设计上有很多的灵活性,从而实现在AI原生的训练推理上有大幅的提升。比如借助于内存、SSD和网络的协同设计,可以实现KVCache的命中率显著提升,从而成倍降低Prefilling的成本。随着后训练中Agentic类任务占比越来越大,这需要大量的CPU为基础的沙盒,而我们的多模态推理集群有大量的CPU提供了混合调度的空间。线上推理流量的潮汐性质又给我们做小规模验证实验和强化学习训练的Rollout提供了更多的空间。基于我们在infra上的全栈能力,我们单位资金效率下的后训练规模至少还有3倍提升空间,以及推理效率的提升能持续增加我们的毛利水平。
最后我们讨论下多模态。跟大部分公司不同,我们设计模型的时候一直原生考虑多模态的信息,因为我们认为视觉的理解和生成是生产力的重要组成部分。多模态生成目前也是除了编程之外的AGI的第二大市场。H3是一个语言模型和视觉生成相结合的一个实践,这不只是把语言模型做为一个Encoder,更重要的是利用语言模型来做精细的上下文感知,从而实现全方位的参考和精细的生成能力。
H3的效果突破、开源策略以及性价比优势改变了这个领域的先进模型都属于大厂且走封闭路线的格局,创作者和开源社区的欢迎程度远程我们预期。从H3开源到今天三周多的时间,H3的下载次数已超过2400万次,诞生了超过300个公开的衍生模型,是今年全球下载量最大的模型之一。借助于优秀的口碑和性价比,我们线上提供的官方服务使用量也有了爆发式增长。
随着多模态和语言模型更加深度的融合,物理世界信息的引入,以及encoder、上下文、计算和数据等环节的scaling,我们认为接下来多模态模型还会有多次能力边界上的跃升。基于我们独特的在语言模型和视觉生成模型两方面的技术储备,我们后续在这个领域的技术领先性、市场份额、以及社区影响力会进一步增加。
更长远来看,我们认为类似语言模型和视觉生成模型的结合的范式在一些更加前沿的领域会持续涌现。
回到开头的问题,MiniMax追求的不是在智能与成本之间做取舍,只有最小化单位智能成本,才有可能训练出最大化的智能水平;只有降低单位智能的供给成本,才有可能让更高水平的智能进入更广泛的生产和生活。模型创新决定我们能够把智能推到多高,模型效率决定这种智能能够供给多大规模,强化学习和真实反馈决定下一轮智能能够进步多快,多模态和专业领域决定智能能够进入多深和多广阔的真实世界。
我们也清楚,单个模型版本并不意味着全部,核心是背后的基建和研发体系能否Scaling。 M3的研发过程中我们也曾经有过实践上的不足。对我们而言,更重要的是能不能持续定义和迭代自己的技术路线,能不能不断加速提升智能密度,能不能将更高水平的智能以更低的单位成本交付给更多用户。
这也是我们对“Intelligence with Everyone”的理解。感谢大家的关注和支持,我们会继续努力!
谢谢大家。
热门跟贴