智东西8月10日报道,今日,成立两年多的“Token超级工厂”魔形智能,再次拿到一笔新融资。
魔形智能宣布完成A轮融资,本轮由毅达资本领投,并引入多家战略资源方,老股东继续追加投资,部分股东还进行了超比例跟投。距离该公司今年5月公布数亿元Pre-A轮融资,过去仅三个月。
三个月连融两轮,在当前的融资环境下并不多见。更不寻常的是这家公司的体量——成立两年,日均Token调用量已达到数万亿级别,客户与合作伙伴覆盖互联网公司、大模型厂商及各行业头部企业。
资本追逐的,是一个看起来门槛似乎在降低的市场。
DeepSeek、Kimi、GLM、MiniMax等开源模型密集发布,企业可以直接下载权重,通用推理框架也越来越成熟。有人放言,大模型推理正在变成一门“有卡就能干”的生意。
但事实并非如此。“模型是开源的,但高效的部署方式并不会全部开源。”魔形智能创始人、CEO徐凌杰告诉智东西,模型能够运行,只代表生产出了Token;能否在大规模并发下守住延迟、吞吐、成功率和成本,才决定这些Token能不能卖出去。
▲魔形智能创始人金琛(左)和徐凌杰(右)的合影
这正是Token工厂走红的深层原因。
2026年,从芯片厂商、云服务商到运营商和AI基础设施公司,几乎人人都在讲Token工厂的故事,大额融资不断。行业竞争的焦点,正从拥有多少算力,转向每元钱、每瓦电力究竟能生产多少可用Token。
魔形智能提供了一个颇具代表性的商业样本。该公司目前每天卖出的Token已经达到数万亿级,收入已达数亿元,客户及合作伙伴包括互联网头部企业、大模型厂商等大B企业。其部分模型已经实现盈亏平衡,整体业务正在向规模化盈利靠近。
开源模型提供了共同的原料,高效部署则决定工厂之间的产量、质量和利润。
今年初不到三个月,魔形智能称其业务完成了“从1到10”的扩张。Token超级工厂为何突然得到资本追捧?热门概念怎样变成一门可以持续增长的生意?人人都能部署开源模型,真正的产业门槛又藏在哪里?
为了探讨这些问题,智东西与魔形智能两位创始人——CEO徐凌杰、CTO金琛进行了一次深入对话。
一、模型越开放,Token工厂为什么越受资本追捧?
Token工厂的走红,首先源于推理需求的快速膨胀。
过去一年,国内开源模型从少数头部产品一枝独秀,转向多家厂商密集发布。模型能力持续增强,AI编程、办公智能体等应用也开始进入企业生产流程。模型越好用,消耗的Token越多。
徐凌杰告诉智东西,从行业公开数据和魔形智能自己的业务变化看,Token需求在半年多时间里经历了数倍乃至数量级增长。尤其是AI编程,已经成为国内外都较为确定的商业方向,Agent对模型的高频、连续调用,又进一步放大了推理需求。
“对于Token工厂来说,几乎每半年都需要实现数倍甚至一个数量级的规模提升。如果没有这样的加速度,公司很可能会落后于市场。”徐凌杰说。
这也是魔形智能连续融资的产业背景。
魔形智能今年5月对外公布Pre-A轮融资,但该轮融资实际在春节前已经确定。春节之后的几个月里,公司的业务又向前跨了一步。
徐凌杰将春节前的阶段称为“从0到1”。公司通过技术能力获得首批大客户认可,验证了Token可以作为AI算力的高阶产品形态进行大规模售卖,也更确信了能把这套商业模式做大做强。
此后的“从1到10”,意味着客户和业务面同时扩张。魔形智能开始从一个客户拓展到多个客户,在同一客户内部,又从单个模型延伸到多个模型、多个业务场景。随着公司增加算力投入,Token销量和收入同步上升,并出现了营收增速快于算力投入增速的迹象。
“我们投入了更多资源,业务带来了相应比例甚至超比例的增长。投资人关心的核心问题,是资本投入能否带来更高的回报。”徐凌杰告诉智东西。
新股东的结构也释放出另一层信号。多家战略资源方入局,意味着魔形智能获得的不只有财务资金,还可能包括算力、数据中心和区域产业资源。老股东超比例跟投,则体现了早期投资者对公司下一阶段增长的预期。
融来的钱很快将变成Token产能。据悉,魔形智能计划继续扩充算力资源和技术团队,迭代自研推理引擎,推进国产超节点及相关硬件研发,同时覆盖更多开源模型和AI算力芯片的组合。
公司下一个目标,是将日均Token产量推向10万亿级。
开源模型的繁荣扩大了Token工厂的市场,也重新划定了产业分工。模型权重越容易获得,单纯“拥有模型”的稀缺性越低。资本开始把注意力投向模型之后的生产环节,谁能把相同模型运行得更快、更稳、更便宜,谁就更有机会获得客户和利润。
这也是魔形智能三个月内连续完成融资的底层逻辑。
二、日均卖出万亿Token,这门生意怎么跑通?
开源模型让Token生产的原料变得更加充足,却没有自动解决生产效率问题。
一家企业拥有服务器和GPU,可以从开源社区下载模型,也可以使用通用推理框架将模型运行起来。但模型成功启动,只代表能够生产Token,距离把Token稳定卖给大客户还有很长一段路。
魔形智能将开源模型、自研推理引擎、算力硬件和运营系统组合起来,再把底层复杂性封装成企业能够直接调用的Token产品。
魔形智能披露的日均数万亿Token,指客户已经调用并产生收入的实际用量,并非部署完成后的理论产能。按照目前业务增速,公司2026年营收预计将达到数亿元。
其市场策略是先服务大B客户。
大型互联网企业对稳定性和性能的要求极高,供应商通常要经过多轮测试,才能进入正式生产环境。一旦服务质量得到验证,客户可能增加采购份额,并将更多模型和业务迁移到同一平台。
“从0到1,是用技术实力获得客户认可,把商业模式走通。从1到10,是我们有了多个客户,并且能在一个客户内部持续扩展模型和业务。”徐凌杰告诉智东西。
魔形智能的Token已经进入部分互联网企业的核心业务,主要用于研发团队的日常工作、AI编程及内部办公流程。
金琛告诉智东西,科技互联网公司的核心生产力很大一部分来自开发者。Token服务进入开发者的编程工具和研发流程,相当于直接支撑企业核心团队的日常生产。
这类客户对价格敏感,但质量排在价格之前。
首先要守住接口成功率。AI编程和白领办公集中发生在工作时间,一旦接口频繁失败,工具就很难真正进入工作流。
其次是首Token延迟和解码速度。如果模型迟迟没有响应,或者生成速度跟不上人的阅读和操作节奏,使用效率会大幅下降。金琛认为,首Token延迟超过3秒,很多企业客户已经难以接受。
P50和P99延迟、KV Cache命中率、并发吞吐、模型精度,以及突发流量下的稳定性,也会影响客户选择。
“质量要求满足之后,双方才会进一步谈性价比。”徐凌杰说。
以某些公开的项目为例,有人使用80张桌面显卡运行最新的大模型,单路速度只能达到每秒20个Token。模型虽然跑起来了,速度难以满足商业场景要求,成本也很难支撑有竞争力的Token价格。
这正是Token生意的关键。
在部分业务场景中,算力采购和运行成本可以占Token总成本的八成甚至九成。选择哪种硬件运行哪种模型,怎样切分Prefill和Decode任务,如何提高单机吞吐和集群利用率,都会直接改变毛利。
魔形智能目前已有相当比例的模型已经达到盈亏平衡。模型受欢迎程度也会影响盈利水平。调用率高的模型可以充分利用算力,利用率较低的模型则更容易形成闲置。
徐凌杰在采访中对魔形智能的盈利预期保持乐观。他表示,国产算力芯片、国产AI基础设施、国产大模型已经进入了协同发展的阶段,国产生态的良性循环已经形成。通过坚定投入国产生态,他们已经获得了可观的收入。此外,他认为,AI基础设施企业只有采取稳健的扩张策略,注重资本效率,迅速实现自我造血,才能支撑起百亿营收、千亿市值的成功企业。
三、部署方式不会全部开源,真正的门槛藏在超节点里
Token工厂与传统算力租赁、大模型API平台究竟有什么区别?
徐凌杰认为,真正的差异来自全栈系统优化能力。
“模型是开源的,模型的高效部署方式并不会全部开源。”他说,简单采购硬件并部署通用框架,往往很难实现盈利。Token吞吐、响应延迟、稳定性和硬件成本需要同时优化,这要求团队同时理解模型、软件、芯片、集群和供应链。
第一层门槛是推理引擎。
魔形智能围绕Prefill和Decode分离、数据传输、内存管理、负载均衡、KV Cache感知调度及多硬件适配进行优化。
不同模型的负载特征差异明显。有的模型更依赖显存带宽,有的更依赖计算能力。长输入短输出和短输入长输出的成本结构也不同。Decode阶段通常更难提升利用率,短输入、长输出任务的单位成本往往更高。
魔形智能会根据模型特点选择不同硬件,也会将不同的计算任务部署到成本最合适的芯片上。其PD分离方案可以适配不同卡型和集群规模,调度系统则结合KV Cache状态和实时负载分配请求,尽量提高缓存命中率。
对于企业客户,弹性同样重要。客户不愿为一个模型同时接入大量供应商,因此供应商既要具备足够大的初始容量,也要在需求突然上升时快速扩容。
新模型发布后,魔形智能往往一至两天、甚至Day0就可以启动客户接入。在引入国产芯片时,魔形智能团队会深入分析硬件架构、迁移算子并跑出性能,迅速完成部署。
第二层门槛是超节点。
随着模型参数和Agent任务复杂度增长,单机八卡服务器逐渐遇到显存容量和卡间通信瓶颈。超节点将更多加速芯片通过高带宽、低时延互联组织起来,可以承载更大规模的并行计算。
金琛告诉智东西,人机交互场景达到每秒100至200个Token,已经能提供较流畅的体验。复杂Agent需要连续规划、调用工具和执行任务,未来可能追求每秒上千Token的生成速度。
“要面向Agent场景做极致优化,超节点是必须研究的硬件平台。我们的目标是达到每秒千Token。”金琛说。
魔形智能目前已有部分模型达到每秒数百Token,每秒千Token仍处于攻关阶段。
更强的互联也会带来新的问题。
传统八卡服务器中,一张卡发生故障,影响范围通常局限在单台机器。到了数十卡乃至更大规模的超节点,一颗芯片发生故障,可能干扰整个互联域,金琛将其称为更大的“爆炸半径”。
因此,超节点的竞争既要拼极致性能,也要拼故障隔离和容错能力。魔形智能已经围绕相关问题推出部分PoC产品,并在真实客户负载中持续验证。
“很多实验室里的优化可以宣称提升40%、50%,甚至两三倍,但放到真实业务中未必能够落地。”金琛告诉智东西,“我们有客户和真实场景,可以直接找到最尖锐的问题,再用较小的代价解决它。”
第三层门槛是软硬件协同。
魔形智能已经适配多家国产及海外芯片,同时与芯片厂商、AIDC、能源和冷却方案伙伴共同推进定制硬件。随着模型继续变大,硬件采购、互联、液冷和系统集成能力对Token成本的影响还会提高。
这与徐凌杰过去20年的经历有关。从英伟达、AMD到阿里云GPU基础设施、壁仞科技,再到创办魔形智能,他长期处于芯片、系统和云计算交叉地带。金琛则拥有高性能计算、芯片软件栈和推理优化经验。
徐凌杰将公司的技术演进总结为三个阶段:从0到1主要依靠软件优化,从1到10依靠规模落地和精细运营能力,长期竞争则要落在软硬件全栈协同上。
下一阶段,缓存系统可能成为新的降本重点。
长上下文和Agent任务中,大量输入内容会被重复使用。相比每次重新计算,将高频内容写入缓存并提高命中率,可以明显降低算力消耗。硬件选型、模型路由和超节点架构创新,则会继续提高单位机器的有效Token产量。
模型越大,并行规模越高,超节点的价值也会越明显。
徐凌杰总结道,全球AI产业的竞争格局已经从单纯的模型竞赛转向实际应用部署能力的比拼,作为智能时代的基础生产要素,Token生产能力正在成为衡量每个国家AI产业发展水平和竞争力的关键指标。未来基于超节点硬件集群和软硬件协同优化的算力基础设施将会呈现完全不同的技术范式与市场格局,而牵引这一变革正是魔形智能的愿景与责任所在。
结语:模型开源潮之后,Token工厂的竞争才真正开始
开源模型降低了AI应用的起点,也把竞争推向了更深的基础设施层。
之前,客户购买服务器、GPU卡时或算力集群,而如今他们更希望直接获得可调用、可计量、质量稳定的Token。评价一家Token工厂的标准也随之改变。它拥有多少张卡依然重要,更重要的是,在相同成本、功耗和服务质量下,这些卡究竟能够生产多少有效Token。
魔形智能已经完成了第一阶段验证。日均数万亿Token实际销量、头部客户和数亿元收入,说明Token可以被加工成一门规模化生意。接下来的考验仍然具有挑战。当日均产量迈向10万亿级,模型数量、硬件类型和客户负载将同步增加。公司能否继续守住成功率、延迟、成本和稳定性,决定其商业闭环能否持续放大。
徐凌杰希望,魔形智能最终成为一家软硬件全栈的AI基础设施公司,在Token供应和超节点产业链中同时占据关键位置。Token超级工厂的竞争,已经越过了争夺概念定义权的阶段。
真正的较量,是谁能把工厂稳定地开起来,并让每一台机器持续产出可销售的智能。
热门跟贴