henry 发自 凹非寺
量子位 | 公众号 QbitAI
“这是目前中国算力性能最强的AI芯片,性能达到M890的3倍。”
9月22日的云栖大会上,阿里巴巴集团CEO吴泳铭这样介绍新一代真武V900。
这款最强AI芯片的出鞘,将平头哥的算力「硬实力」推到了聚光灯下。但对于考虑换用真武的客户,还有另一件事要确认:过去写下的代码、积累的工具和开发经验,能不能一起带过来?
芯片之外,软件生态的「软实力」同样决定着客户的选择。
一天后的9月23日,平头哥公布了AI软件栈T-Head SAIL的最新开源进展,进一步扩大框架适配、加速库、工具链和通信库等领域的开放范围。
在平头哥的比喻里,AI芯片是发动机,软件栈则相当于“变速箱+传动系统+驾驶系统”。
发动机性能再强,最终能发挥多少,还取决于软件能否让模型顺利迁移、运行和优化。
现在,这套配套软件正进一步向开发者开放。
据悉,真武AI芯片已服务20多个行业的650多家客户,蚂蚁、小红书、小鹏汽车等头部企业已经开始使用T-Head SAIL。
其中,小红书还基于T-Head SAIL开源代码,开发了模型迁移与算子优化Agent,用来加速生成式推荐模型在真武上的部署。
可以说,平头哥提供基础软件能力,客户则把自己的业务经验写进工具,继续做迁移和优化,芯片背后的生态软实力,也在这样的参与中逐渐积累。
而以阿里为代表的大厂造芯,也正在从交付芯片,走向更广泛的开放共建阶段。
这次,平头哥具体打开了什么?
简单说来,T-Head SAIL可以理解为阿里平头哥围绕真武AI芯片打造的一套类“CUDA”软件栈。
它连接PyTorch等上层AI框架和底层真武硬件,负责模型迁移、编译执行、计算加速和开发调试。
今年7月WAIC上,平头哥宣布启动T-Head SAIL开源,并向开发者提供SDK、驱动、性能分析与调试工具,以及相关技术文档的下载。
两个多月后的云栖大会,团队公布了进一步的开源进展。已开源项目包括PyTorch-for-sail框架适配、sailify源码迁移工具、Triton-for-sail算子开发工具,以及DeepGEMM-for-sail、FlashAttention-for-sail等计算加速项目。
从调试工具、技术文档到开源框架,随着更多工具和资源的开放,SAIL让开发者能够深入了解软件的具体实现,并根据业务需要查看、修改代码。
而这些工具和资源,回应的正是开发者在实际业务中遇到的几个关键问题:
1、先解决迁移:过去攒下来的东西,别因为换芯片全重来。
“最大的诉求,从业务角度来说,就是迁移成本有多大。”在公开演讲时,平头哥半导体软件生态资深总监陆生华这样表示。
这并不难理解。不少客户的软件已经在线上跑了很多年。代码改过一轮又一轮,工具早就用顺手了,团队也有自己的一套调优经验。
换一款芯片,意味着这些积累都要重新接受检验,业务还不能因此中断。
框架适配、源码迁移和算子开发工具,首先要做的就是尽可能保留这些积累。开发者可以继续沿用熟悉的模型开发方式,由迁移工具辅助处理已有代码,再根据新硬件的特点完成必要的适配。
只有过去的积累越容易带走,中国芯片才更有机会成为实际可用的选择。
2、模型跑起来之后,还得继续抠性能。
然而,迁移跑通,只是第一步。如果换了芯片之后,效率只剩原来的30%-40%,那即便模型能跑起来,实际业务里也很难接受。
所以接下来马上就会碰到第二个问题:同一个模型,能不能跑得更快?资源还能不能再省一点?
这时候,只靠厂商把工具做好还不够,DeepGEMM-for-sail、FlashAttention-for-sail这类计算加速项目开源的意义,也就显现出来了。
开源之后,开发者不只是把现成工具下载下来用,还可以直接看到里面是怎么实现的,再根据自己的模型和业务负载继续改。
过去需要交回芯片厂商的问题,现在业务团队有机会自己定位、自己优化。更了解模型的人,可以直接参与决定模型怎样在芯片上运行。
换句话说,T-Head SAIL开源不是多了一个下载入口,而是让开发者真正参与到芯片性能优化里。
3、新模型出来后,最好Day 0就能跑。
对于不少开发者来说,还有一个迫切需求就是——
新模型发布当天,最好就能在自己的算力平台上试起来。
现在模型的更新节奏基本上是几周一更。如果适配慢了一轮,业务团队尝试新技术的时间也会跟着推迟。尽快支持新模型,甚至做到Day 0可用,已经成为客户对算力平台的期待。
平头哥也在持续提供面向真武适配的模型资源。按照现场演讲披露的数据,截至2026年9月,其在ModelScope上已提供39个量化模型,覆盖Qwen、DeepSeek、Kimi等系列,累计下载超过34.8万次。
这些已经完成适配的模型,可以减少用户自行准备的工作,让部署和测试更早开始。
与此同时,TensorFlow、JAX适配版本、自研推理引擎,以及PCCL、DeepEP-for-sail等通信组件和调试监控工具,也还在推进开源。
未来,随着更多代码和工具开放,开发者能够参与的工作也在增加:把原有业务迁到真武上,再按自己的需求修改、优化,甚至开发新的工具。
而这种变化,已经能从小鹏、蚂蚁和小红书等客户的实践中看到。
代码打开之后,开发者开始自己动手
小鹏解决的,是把已有业务迁到新平台上。
借助SAIL,小鹏将原先运行在GPU平台上的业务模型迁到真武云端集群,开展智能驾驶模型训练。
迁移之后,团队继续利用SAIL的性能分析工具定位训练瓶颈,再围绕算子和框架进行优化。
训练任务换了硬件,开发者仍希望沿用熟悉的工作方式。SAIL支持C++、Triton、TileLang等开发方式,目的就是减少重新学习的负担,让团队把精力放在模型和业务本身。
蚂蚁面对的,则是模型适配之后的持续调优。
目前,蚂蚁集团推理服务团队已经基于SAIL,在真武810E和M890上完成主要前沿模型的推理适配。接下来,量化、推理阶段分离、专家并行负载均衡、稀疏注意力接入等工作仍在继续。
模型能返回正确结果,只解决了功能问题。面向真实的推理服务,团队还需要不断改善处理效率和资源开销,软件优化会伴随业务持续进行。
小红书又往前走了一步,把迁移和优化做成了自己的工具。
基于SAIL开源代码,小红书面向真武架构开发了模型迁移与算子优化Agent,用自动化方式辅助优化,加速生成式推荐模型的部署上线。
在这个过程中,客户可以把自己的模型经验和业务需求写进工具,形成适合自身场景的优化方法。厂商提供的基础实现,成为了下一轮开发的起点。
这也回应了陆生华在采访中提到的一个矛盾:
客户想针对芯片开发高性能算子,往往又需要保护自己的算法和知识产权。算法细节不方便交出去,芯片厂商却需要了解这些细节,才能代为优化。
开放软件代码和架构信息后,客户就有条件自己完成这项工作。核心业务逻辑可以留在内部,团队根据公开的硬件信息编写定制算子,再检查和调整软件实现。
涉及核心算法的改动,可以留在企业内部;愿意公开的工具和优化,则可以提交给社区。T-Head SAIL为此建立了贡献流程:
开发者可以提出问题、修改代码、提交贡献,经过自动化测试和维护者、社区评审后,改进可以合入主线,随版本发布。
据介绍,T-Head SAIL开源后,已经有阿里内部和外部客户提交代码贡献。
平头哥收到的反馈也相当具体:有人希望把自己的项目贡献出来,有人需要更多硬件架构信息,以便开发定制算子;还有人希望新模型、新框架得到更快支持。
与此同时,这些需求也在改变平头哥的软件开发安排。
真武的架构信息已经公开,社区治理和贡献规则仍在完善;团队正推动软件组件解耦发布,让不同项目能够分别更新,并将面向真武的适配成果逐步提交回上游社区。
客户自己解决一个问题之后,如何让其他人也用上这项改进,就是代码开放之后需要继续完成的工作。
阿里为什么选择在这个时候进一步开放?
要理解这个时间点,得先回到芯片本身:已经有足够多的人拿到硬件、用进业务,适配和优化的需求才会真正出现。
从2019年的含光800,到2021年的倚天710,再到如今的真武系列,平头哥走了多年。其中一条持续的路径,是从业务需求出发设计芯片,先在阿里内部验证,再通过云等方式服务外部客户。
陆生华谈到,外部客户接触新芯片时,常会先确认一件事:阿里自己用过没有?
淘宝、搜索、推荐、广告等业务承担了早期生产验证的角色。经过实际流量和集群稳定性的考验,产品再逐步向外推广。
到真武M890,团队已经完成两代完整芯片交付。在陆生华看来,软件的成熟度和客户对二次开发的需求,共同促成了此时的开放。
650多家客户意味着产品得到了使用,也意味着厂商要面对越来越多不同的问题。
汽车企业训练模型,互联网企业优化推荐,模型团队尝试新算法,各自的计算方式和性能瓶颈并不相同。同一套基础软件之上,还会有大量贴近具体业务的开发。客户越多,把这些工作全部留给芯片厂商就越难持续。
这时扩大开放,既有经过验证的软件可以拿出来,也有真正需要它、愿意继续开发的用户。
此外,对平头哥来说,还有一笔长期维护的账。
芯片厂商基于主流框架做适配,通常需要修改一部分代码。如果长期维护自己的独立版本,上游每次更新,都要重新同步代码、处理差异、测试验证。独立版本和上游分开的时间越长,这项工作就越重。
把适配和优化提交回PyTorch、vLLM、Triton等上游社区,是为了让真武的支持能够随主流软件一起演进。客户希望更快用上新技术,平头哥也需要减少重复维护,才能腾出精力支持更多模型和业务。
当然,代码开放之后,厂商的工作仍然要继续。原先统一发布的软件包拆成多个独立组件,需要新的检查和测试安排;社区提交的改动,也需要有人评审、维护并对产品质量负责。开放能扩大参与范围,也要求平头哥建立长期协作的能力。
再把视线拉远,SAIL的选择,也与阿里的整体AI布局相接。
今年云栖大会上,吴泳铭明确提出,阿里将长期投入AI模型、AI芯片和AI云。
△图源:阿里
而早在2025年2月,阿里就宣布了三年内至少投入3800亿元建设云和AI基础设施的计划,随后又提出将在这一计划上进一步增加投入。
模型带来新的算法、计算精度和并行需求,芯片提供计算、内存和互联能力。SAIL通过编译器、算子库和通信库,让模型的这些需求在硬件上得到实现,再由云将整套计算能力组织成服务,交付给用户。
这层软件能否及时跟上,影响着新模型能多快用上硬件的性能,也影响着云上业务的运行效率。
阿里内部已经在做这种协同。按照陆生华的介绍,平头哥正在与千问团队合作,探索让模型生成高性能算子。生成一段功能正确的代码相对容易,要让它充分发挥芯片性能,还需要模型理解底层架构。
但千问的需求无法涵盖所有行业。小红书的生成式推荐、小鹏的智能驾驶训练,各有自己的模型、数据和优化目标。T-Head SAIL进一步开放,是让这些团队也能参与连接模型与硬件的软件开发,把对业务的理解转化为具体实现。
总的来说,阿里在模型、芯片和云上的持续投入,最终要由更多业务来检验。芯片交付之后,软件能否持续跟上,客户能否按自己的需求开发,都会影响这些投入最终能服务多广的市场。
“生死看淡,不服就干”的平头哥,用多年投入积累了造芯和用芯的能力。走到今天,它开始把更多经过业务验证的代码和工具,交到开发者手中。
而大厂造芯,也终于到了生态建设的时刻。
SAIL的全称是Seed of AI Library。按照平头哥的解释,每一行开源代码,都是一颗种子。
芯片已经进入真实业务,接下来,就是期待这些种子在更多开发者手里,长出自己未曾预设的工具、优化和应用。
热门跟贴