在刚刚落下帷幕的2026世界人工智能大会上,大模型与算力底座的交锋依然是全场的核心命题。

当大多数目光聚焦于如何寻找或替代通用GPU时,中昊芯英带来一份不一样的答案:新一代全自研高性能 TPU 架构 AI 专用算力芯片“须臾®”正式亮相。

从“刹那”到“须臾”:

想要在当下内卷的AI芯片市场站稳脚跟,仅仅停留在PPT上的理论参数是不够的。

中昊芯英创始人、CEO杨龚轶凡在采访时介绍,第二代芯片“须臾”的所有功能性调整和硬件结构改动,并非闭门造车,而是全部来源于上一代芯片“刹那”在过去一年多市场化落地中的真实反馈。

打开网易新闻 查看精彩图片

“我们在和各类合作伙伴、大模型客户对接的全过程里,收集到了大量关于算力利用率、多卡通信、存储吞吐、大模型推理调度的优化痛点。基于这些需求,我们完成了芯片底层的硬件重构。”杨龚轶凡说道。

从数据来看,“须臾”实现了质的飞跃。其混合精度浮点算力达到 896 TFLOPS,8-bit 推理算力达1792 TOPS。在性能分为两个版本的情况下:单核标准版单芯片的综合算力较上一代提升1.5倍;而重点推出的双片芯粒合封版本,则直接将综合算力性能拉升至上一代芯片的 3 倍以上。

中昊芯英CTO郑瀚寻将这种提升归功于软件驱动硬件架构的三重创新:一是重构了矩阵计算核心单元等,从底层大幅提升基础算子执行效率;二是采用了先进的双芯粒同基板封装方案,配合自研低延迟片间互联通道,直接释放双倍算力;三是拓展了片上高速存储容量与读写带宽,大幅降低了数据交互延迟。

更让业界关注的是其在成本与能耗上的控制。“须臾”单芯片额定功耗仅为600W,相较于算力性能持平的传统算力芯片,功耗降低了50%。杨龚轶凡表示,虽然双芯粒版本算力翻了三倍,但硬件成本只是小幅有限上浮。“哪怕客户不升级配套软件,直接沿用原有程序,整机综合性价比也能直接提升两倍。”

这种性价比优势在当前的 Token 经济下尤为关键。随着 Agent应用的全面爆发,业务呈现出“输入Token规模远大于输出Token”的不均衡特征,行业主流的应对方案是 Prefill-Decode(预计算与解码生成)分离调度。

传统GPU架构想实现这一点需要大量上层软件改造,而中昊芯英的 TPU 底层架构则做到了原生适配,落地门槛更低,调度效率更高。

硬核外表下的浪漫:为什么是“须臾”

对于一家死磕底层硬科技的芯片公司来说,中昊芯英在内部文化与产品命名上,却透着一股浓厚的文科浪漫与武侠情结。

杨龚轶凡在接受采访时分享了一个细节。无论是初代芯片“刹那”,还是二代芯片“须臾”,这两个代表“极短时间”的文言词汇,其实都蕴含着团队对芯片极致计算速度的隐喻——以最短耗时完成海量大模型运算任务。

不仅如此,中昊芯英会议室名称等,都采用了《仙剑奇侠传》的经典地名来命名;员工花名也是非常文艺化,采用了“颜色+动物名称”的组合。

这种在命名上不拘一格和追求独特的特质,透出了中昊芯英在技术路线选择上一种叛逆与前瞻。

打开网易新闻 查看精彩图片

时间倒回至 2018 年,当时国内绝大多数初创芯片企业的核心诉求是“弥补国内 GPU 空白”,对标海外巨头,解决供应链卡脖子问题。但拥有谷歌TPU原厂研发经验的杨龚轶凡,在回国创业之初就做出了一个大胆的产业预判。

“GPU 架构经过三十年迭代,底层架构创新空间已经极度狭窄。”杨龚轶凡回忆道,“我们当时就判断,基于Attention机制的Transformer架构大模型,必然成为未来 AGI 技术核心载体。而这种模型算力消耗巨大,传统 GPU 会面临严重的成本和算力利用率瓶颈。面向大模型专用设计的TPU架构,必然会成为行业长期刚需。”

这是一个孤独且艰难的决定。早期,国内TPU赛道专业人才极度匮乏,半导体产业链对这一新兴架构的认可度不足,商业化举步维艰。从2018年创业到2023年第一代“刹那”芯片落地,中昊芯英熬过了漫长的五年“从 0 到 1”的周期。

如今,时间证明了他们的判断。全球算力市场格局正在重塑,随着大模型商业化的全面铺开,行业越来越意识到通用GPU在承载海量Token推理时的局限性,TPU已经成为除GPU之外,全球唯一实现大规模量产、且被市场高度认可的成熟算力架构。

“我们创业的目标从来不是复刻一个成熟的 GPU,而是打造具备底层架构颠覆性创新的算力芯片。”杨龚轶凡说道。

跨越生态护城河:不卷全面兼容,专注轻量化闭环

当然,任何一款非传统GPU架构的芯片,都绕不开软件生态这座大山。长期以来,软硬件生态薄弱、适配开发难度高是国产算力芯片普遍的痛点。

对此,中昊芯英采取了极其务实的策略。杨龚轶凡指出,他们主动规避了传统国产芯片“一上来就要适配市面上所有深度学习框架”的巨大压力,而是将业务重心聚焦于Token经济赛道。

在开发者生态方面,中昊芯英选择对外统一封装标准化 API。客户无需在底层痛苦地适配各类异构框架,仅需调用API即可完成模型部署和性能测试,这极大削减了研发工作量。对于当前国内主流的开源大模型,比如如 Qwen、DeepSeek、GLM 等,“须臾”基本能做到Day 0或Day 1的快速跑通。

而在备受关注的CUDA(即英伟达发明的一种并行计算平台和编程模型)兼容问题上,郑瀚寻表示,TPU与CUDA是两套独立体系。TPU架构原生适配PyTorch等主流 AI 开发框架,常规AI模型只需简单调整代码即可在 TPU上运行;针对带有定制 CUDA 加速算子的复杂模型,我们配备完整编译开发工具链并提供技术支持,可以协助开发人员完成算子重构适配改造,保障业务平稳迁移。

这种策略让中昊芯英在现阶段实现了快速的商业化闭环。芯片的国产化替代,不再只是停留在“能用”的口号上,而是真刀真枪地迈向了“好用”的阶段。

未来的小目标:要做AI界的X86

当谈及未来三到五年的发展规划时,杨龚轶凡把视野投向了更大规模的集群建设与产业愿景。

今年WAIC期间,中昊芯英与杭州电信合作落地的千卡集群就已经发布,但这只是一个开始,在集群部署层面,“须臾”芯片单个超节点最高可实现2048片芯片直联,其采用的3D Torus拓扑结构,天然适配万卡级别的大型超节点集群搭建。

中昊芯英的目标,是从万卡集群商业化落地过程中沉淀工程经验,最终实现对国产大模型算法从计算到推理的全流程完整支撑,彻底摆脱对海外高端算力芯片的依赖。

当前海外同类产品在 Agent 场景下单用户每日算力开销高达5-10美金,高昂的成本严重限制了商业化普及。如果依托国产TPU,有望把单日算力成本压缩至0.5美金左右,这将让大量中小企业和普通用户真正用得起AI。

“我们的初衷,也是我们的希望,就是把 TPU 做成 AI 界的 X86。”杨龚轶凡说道。在通用计算时代,X86 架构在 PC 市场占据了超过 90% 的绝对主导地位,在服务器市场也切下了约 79%的巨大份额。凭借着这种市占率,X86 建立起了极其深厚的软硬件生态壁垒,成为了整个 IT 产业无可争议的通用底层标准。

中昊芯英把“AI界的X86”作为接下来的目标,是希望他们的TPU 架构能像当年X86“统治”PC和服务器市场一样,成为未来AI算力领域通用的底层标准。这颗充满浪漫主义与极客精神的TPU芯片,正试图在AI版图上,刻下属于自己的标准坐标。