打开网易新闻 查看精彩图片

摘要 ◎智效比,拐点来临? ◎居高声自远:金融、医疗场景验证。 ◎你应该看到的普惠时刻。

AI行业的竞争逻辑正在转变。过去三年,模型参数是硬通货,你追我赶,“大”几乎成了默认路径。

蚂蚁百灵团队很早就意识到这一趋势不对头。

“去年12月份发完当时的1T模型,我们就想,难道模型的size要一直这么长吗?”9月9日的外滩大会媒体沟通会上,百灵大模型负责人周俊(花名:西亭)说。

他打了个比方。到今天,人的大脑神经元数量也就维持在800多亿,并没有无限上涨,“好像有点不太符合生物学进化的基本规律”。

西亭将百灵选择的路径称为“智效比”。它指向的并非简单降本增效,而是用最经济的参数完成真实任务,让更多行业和用户用得起AI。

怎么衡量智效比有没有做到?西亭给了一个可以量化的标准。不是看模型单次生成有多快,而是看端到端的任务成功率。完成同样一个任务,总共花了多少钱、用户等了多少、中间重复了多少次、最后结果是不是可靠的。

当天,蚂蚁百灵发布了金融增强模型Ling-3.0-flash-Fin,同步开源了金融搜索评测基准FinFIRST。这一模型已率先在金融、医疗两大容错率极低的关键场景得以验证。

智效比的路径跑通、新模型的落地、两大关键场景的验证,不仅将驱动蚂蚁与整个行业的AI普惠落地,未来几年,更有望持续优化甚至重构蚂蚁AI服务模式,形成新的增长驱动。

智效比:拐点来临?

去年3到4月,百灵团队内部讨论过一个问题,一个聪明的模型应该是什么样的?最终落到三个核心理念,计算效率、参数效率、Token效率。

大多数团队习惯从“如何把模型做大”起步,百灵反过来,从“高智商物种应该具备什么特征”推导技术路线。

基于这三个理念,团队在技术层面做了两件事,在生态层面做了一个选择。

第一件是架构优化。延伸混合线性架构和高稀疏MOE结构,让每个Token、每一组参数都能对最终任务产出更高价值。西亭解释混合线性架构时打了个比方,人最重要的能力是忘掉一些事情,而不是记住所有事。不是把模型越做越大,而是把万亿模型里的智能压缩到小尺寸里,让小模型也能装下高密度的智能。

第二件是任务导向训练。把模型放进更多真实场景迭代,让它学会拆解任务、识别失败边界,遇到超出能力的地方知道暂停,或者主动寻求人类帮助。

技术之外,百灵选了开放体系的路。这不算三个理念之一,而是让技术能力能被更多行业用上的策略。不光开源最终的模型权重,连中间训练节点也一并开放,让模型能适配更多技术框架,离用户更近。

今年7月,蚂蚁百灵发布Ling-3.0-Flash。模型总参数124B,单token仅激活5.1B。它的上一代旗舰是1T模型,Ling-3.0-Flash总参数约为其12.4%,激活参数仅为其8.1%。

看公开评测数据,Ling-3.0-Flash在Artificial Analysis智能指数上得分38分,在200B以内的开放权重模型中位列组内智能SOTA,单任务成本约0.04美元。同系列的Ling-3.0-tiny在40B以内的开放权重模型中拿下智能SOTA和成本第一,移动端64K最大上下文测试以66分排名第一,进入iPhone 17 Pro速度-智能帕累托前沿。

打开网易新闻 查看精彩图片

需要说明的是,这些数据证明的是它在小尺寸模型里的领先位置。它与上代1T模型的直接对比评测,目前公开数据中还没有完整的同基准得分披露。但从参数压缩比和组内评测表现来看,方向很明确,用更小的尺寸实现尽可能高的智能密度。

OpenRouter的真实Agent会话成本排名从另一个维度验证了这条路线。Ling 2.6 Flash位列第一,Ling 3.0 Flash位列第二。连续两代位居前二,意味着成本效率优势得到了跨代验证。

系统推理效率同样扎实。在SGLANG与ANT LING INFRA协同优化下,搭载4×Blackwell的Ling模型峰值吞吐达到1945 tokens/s,进入开放模型GPU推理第一梯队。

这些能力指标只是基础。真正决定百灵走向的,是把它用在哪里。

2026年,国内大模型厂商开始集体转向。同年8月,阿里和智谱同日发布Flash系列模型。阿里Qwen3.8-Flash总参数125B,单token激活6B,训练成本比前代降了近90%。智谱GLM-5.3-Flash总参数320B,单token激活18B,API价格只有前代的十分之一。DeepSeek V4-Flash总参数284B,每次推理仅激活13B。用更少的计算资源做更多的事,Flash成了行业默认的新方向。

但百灵的侧重点与同行不同。别人做Flash是在通用场景里追求效率,百灵是把效率优势直接嵌入金融、医疗这类对容错率要求极高的场景中。这决定了它不是通用模型的能力溢出,而是从最难的地方长出来的效率。

过去两年行业比参数规模,现在比的是每份算力能完成多少真实任务。企业买AI,越来越不看参数表,而是看任务成本。参数规模是模型公司的语言,任务成本才是客户的语言。

当客户开始用后一套标准做决策,整个行业的竞争维度就跟着换了。

2026年全国两会期间,“从算力比拼转向智效竞争”已成为产业共识。同期政策研究也在推动将“单位算力投入对经济增长的拉动”纳入统计考量。百灵的智效比,正好踩在这个节奏上。

效率问题解决后,接下来的问题是,这些能力该用在哪?

居高声自远:金融、医疗场景验证

百灵没有从最容易的场景切入,而是选了金融和医疗。

核心原因不是行业历史更长,而是它们对模型的要求最严、容错率最低。西亭说得很直白,Coding确实是当下这个时代人类创造的一种在语言之上力度非常高的东西,但不代表Coding是这个世界上唯一的一种东西。

金融任务影响面广,判断会顺着市场、产业和企业经营层层传导。约束也多,结论必须有证据支撑,符合安全、合规、可追溯的要求。通用模型能聊金融,不代表能做专业的金融任务。

谈及竞品场景选择,百灵金融模型负责人张晓露(花名:月引)表示,其他几家的营收大头来自银行,主要是客服和信贷审批。这些偏工作流,不需要那么长和那么难的东西,锤炼不出模型在复杂任务中的核心能力。百灵选了行研作为切入点,因为它可校验。

打开网易新闻 查看精彩图片

Ling-3.0-flash-Fin覆盖信息检索、研究推理、估值建模、研报撰写四大能力,尝试打通从找资料到形成研究成果的完整任务链。同步开源的FinFIRST评测基准,由中金公司提供专业支持,50多位金融专业人士参与设计。基准包含123道真实金融任务,拆解成701个评分点,经过六阶段质控,采用率9.78%。在9项金融评测中,Ling-3.0-flash-Fin表现突出,覆盖投研、搜索、表格与银行任务,通用智能得分从38分提升至43分以上。

研究推理的DEMO展示了一个案例。Spire把Storage业务重新分类后,模型核对财报、业绩公告和监管文件,重建可比盈利。原Midstream盈利5630万美元,其中68.4%来自已终止业务,重建后为1780万美元。模型最终判断,这个历史重构值可用于同口径比较,但不能直接外推。

金融考验的是推理链的完整性,医疗考验的是对不确定性的审慎表达。西亭举过一个例子,很多模型上来就开始作答,但专业的医生不是这样工作的,多问一句会比着急给一个答案重要得多。

阿福模型技术负责人顾进杰(花名:进捷)展示了Ling-3.0-flash-Sante的评测数据。

这是一个1240亿参数的模型,在1.6万亿参数以下的模型里性能最优。在DiagnosisArena-MCQ上得分83.8.高于GPT-5.6 Sol的81.9、Kimi K3的78.4和Gemini 3.6 Flash的76.2.它每次推理只调动51亿参数,效果却和调动490亿甚至1040亿参数的模型不相上下。评测覆盖8个全球权威医疗健康评测集,再加4个阿福自有高质量医疗安全评测。

产品层面的数据同样说明问题。进捷透露,阿福累计服务用户超过1.5亿,日均处理超2000万次健康咨询。韩歆毅在外滩大会上补充了更具体的用户画像,阿福用户中超过一半来自三四线城市,约16%的咨询发生在凌晨0点之后。

《Natural Health》的一篇论文对比了四家医疗AI系统,另外三家主要面向北美市场,功能集中在回答问题。蚂蚁阿福理论上面向全球,用户主要来自中国,覆盖健康问答、报告解读、用药指导、咨询预约等多个环节。从拍照咨询到真人医生复核,再到用药和配送,阿福已经打通了从问一个问题到解决问题的完整链路。

打开网易新闻 查看精彩图片

这两个场景不只好用,还能反过来把模型本身练强。失败案例沉淀成专业数据闭环,专业评测反过来提升通用能力,专业训练环境变成强化学习,让模型学会预判动作后果,而不是只记住标准答案。

市面上的行业模型,大多是在通用模型上加行业插件,换一个行业就要重做一套。百灵的金融和医疗模型,从预训练阶段就嵌入了行业数据,能力是从底层长出来的。专业能力打磨的同时,通用能力也跟着提升。字节豆包主打C端入口,阿里Qwen走云服务和开发者生态,DeepSeek以极致训练效率见长,精力主要放在通用基座。百灵从一开始就选产业场景,2023年首次对外披露的就是金融大模型,之后再延伸到医疗,选的都是容错率极低、专业门槛极高的场景。

零幺在回答这个问题时,没有从技术路线讲起,而是回到了公司的基因。他回忆说,在没有支付宝的时候,大家都付现金,有移动支付这件事情,它就是快,效率的提升。包括很多年前交水电煤,大家可能要跑到营业厅或者某些办事的地方,花一天的时间或者半天的时间,走线上也是快。所以,快这件事情确实存在公司的基因里头。

除了组织基因,蚂蚁在行业里还有一个其他模型公司不具备的条件。月引说得很直接,他们真的有在一级市场和二级市场浸淫了十年、二十年的专家,跟他们一起来做这个事情。金融专家的知识沉入到Pre-Train的环节,从数据知识输入的环节就开始做。这是场景牵引模式与Anthropic能力溢出路径的根本区别。后者是在通用模型之上叠加行业插件,百灵是从基座层面嵌入行业能力。

至于为什么敢选金融和医疗这两个最难的行业,西亭说,中国很多领域都有约束,尤其金融、医疗行业,约束更多,但机会往往就在困难里面。这对模型提升能力非常有利。

两大场景的验证,给百灵提供了一个信任起点。一个模型在金融行研中能做到信源可追溯、推理可复现,在医疗咨询中能审慎表达不确定性、明确能力边界,这为它进入法律、政务、教育等其他高价值场景积累了信任基础。当然,不同行业的监管规则、数据格式和容错标准各不相同,真正落地时仍需针对性适配。

西亭被问到什么才是好模型时,给出三个标准,智效比、专业性、开放性。如果要再加一个,就是反馈机制。金融和医疗的验证,恰好对应了这三个标准。智效比让单任务成本压到0.04美元,专业性让模型在行研和医疗诊断中比肩旗舰级模型,开放性让能力可以被更多行业复用。而反馈机制,则是模型在真实环境中持续变好的前提。

两大场景跑通之后,接下来的问题是如何把能力开放给更多行业,以及如何让这门生意持续下去。

你应该看到的普惠节点

金融和医疗跑通之后,百灵手里握住的不是两个行业模型,而是一套可复用的能力体系,一种“智效比”的方法论。

它解决的是同一个问题。即如何让AI的使用门槛降到足够低,让没有GPU机房的县医院、没有技术团队的中小金融机构、没能力自建模型的中小企业,也能用上过去只有大机构才养得起的AI能力。

这套体系能不能驱动AI普惠落地千行百业,取决于百灵开放得够不够彻底。

今年以来,百灵在开源社区的动作很密集。从Ling-1T到Ling-2.6-Flash,再到Ling-3.0-Flash和Ling-3.0-Flash-Fin,每隔几个月就有新的权重和训练节点放出来。与此同时,一些头部模型公司因为经营压力转向垂直一体化,开放性在弱化。百灵选了相反的路。

百灵的开放同时推进三个层面。

模型开源方面,不光开源最终权重,Base模型、预训练和中期训练的权重checkpoint全部开放,一共6个,Ling-3.0-flash开源当天,华为昇腾就同步完成了0 Day适配。评测基准开源方面,FinFIRST覆盖中国内地、美国、中国香港等市场,给全行业提供统一的专业金融AI评测标尺。端侧部署开放方面,进捷描绘过一个很具体的场景,未来可能就是拿一个主机进医院,里面装着模型,接入院内病历系统和医学文献数据库,在本地就能完成推理,现在Tiny模型已经可以跑在苹果电脑和手机上。

采访结束,追问过西亭,他没直接评价同行选择,只讲了百灵的开放逻辑。

开源对百灵来说不是姿态,而是一种商业理性。模型足够小、成本足够低,开源才不会成为财务负担,生态才能跑起来。要是自己的推理成本都压不住,开源等于给自己挖坑。从这个角度看,开放能力本身就是智效比的延伸。

“事实上,一些大模型在开放上越来越保守了。”他说。

这三层开放指向同一个目标,让金融和医疗里锤炼出的能力,能够被法律、政务、教育等更多高价值场景复用。一个模型在金融行研中能做到信源可追溯、推理可复现,在医疗咨询中能审慎表达不确定性、明确能力边界,这些能力迁移到其他行业时,信任基础已经建立。当然,不同行业的监管规则、数据格式和容错标准各不相同,真正落地时仍需针对性适配,但最难的那一步,也就是从零到一建立可信执行,百灵已经在金融和医疗里完成了。

能力开放出去之后,定价方式也必须跟着变。

接受夸克点评采访时,谈及商业模式,西亭表示,智效比的量化目标总结起来就是端到端的任务成功率。生成成功率不等于任务成功率,一个任务往往要跑几十轮。同样任务完成率下成本是多少,固定成本下能完成多少任务,才是下一步更关心的商业标准。这相当于把收费的基准,从模型消耗了多少,转到了任务完成了多少。

西亭坦承,这目标很难马上实施。因为,完整任务不只靠模型,还要乘上Harness、评估、行业安全规则,是联合起来解决的问题。

但他判断,今天模型还是一个产品,不是严格意义上的商品,从产品到商品是必须发生的。

零幺补充了一个视角。

token可以被量化,但任务完成率并不那么确定,因为智能本身在很多维度上是不确定的。但随着模型能力提升,不同维度任务的确定性一定会变高,高到一定程度就可能变成标品,就可以更好地被量化。

按效果收费要落地,前提是任务质量可以清晰计量。金融行研的交付物可审计,医疗咨询的结论可追溯,这两大场景天然具备按效果计量的基础。而智效比则提供了三个落地条件。单任务成本压到0.04美元,按效果定价才有利润空间。任务可校验、可审计、可复核,客户才愿意为结果买单。模型能可靠完成完整任务,而不是只做其中一个环节。

定价方式的变化,最终会反映到收入结构上。

过去蚂蚁的收入来自支付手续费和金融服务,金融业务受资本金约束,做一块钱生意就要对应一定比例的资本支撑。AI业务的核心成本是算力和研发,模型训练完成之后,每一次推理的边际成本极低,在规模化之后有了比传统金融业务更大的利润空间。公开信息显示,蚂蚁数科2025年营收约50亿元,2026年目标约80亿元。IDC报告显示,它以13.3%的市场份额排在2025年中国金融大模型、智能体应用及服务市场第一位。

值得注意的是,蚂蚁在商业模式上一直低调。整个行业还在初期,远没到规模化门槛,许多商业化不止缺乏基础,也很难真正落地。但蚂蚁的路径与长期经营战略,决定了它更擅长用平台化与智能体生态策略变现。这个过程需要比其他企业承担更多化解行业壁垒的责任,而不是像某些闭源模型上来就收费。

普惠怎么变成收入?

逻辑其实很清晰。单任务成本压到足够低,过去被成本挡在门外的中小金融机构、县级医院、中小企业,第一次有能力为AI付费。他们可以按效果付费,可以按调用量付费,也可以选私有化部署。客户基数扩大,调用量上升,收入自然增长。目前这条路径还在验证过程中,但方向是明确的。

韩歆毅在外滩大会上有句话,可以作为上述话题的注脚。他说,AI的价值最终要由真实增长来检验,也要由更多人的获得感来衡量。当AI不再靠烧钱换规模,它靠什么让更多人受益,同时让自己增长。

夸克,最小的粒子,微末的洞察