7月18日,云天励飞亮相2026世界人工智能大会,董事长兼CEO陈宁重磅发布公司AI推理基础设施路线图。未来两年多,企业将推出DeepVerse100P、DeepVerse100D、DeepVerse100L三款云端大算力推理芯片,分别针对Prefill、Decode、Decode FFN三大推理环节的负载特征做专项优化。
依托三款专用芯片,云天励飞将搭建万卡(十万卡)级异构集群分离式AI推理基础设施。通过解耦各推理阶段,为不同负载匹配适配的芯片与算力资源,有效提升集群系统运行效率,持续压降Token生成成本。
本次发布完善了云天励飞全栈推理算力布局,实现从单芯片到超大规模集群的完整技术闭环,补齐国产云端推理规模化部署短板。同时为国内大模型产业筑牢自主可控算力底座,助力AI推理赛道国产技术突破。
推理负载持续分化,算力优化走向精细化
当前大模型推理场景加速分化,随着AI任务上下文扩容、推理链路趋复杂、实时交互要求提升,推理系统对吞吐、延迟、成本的综合门槛持续提高。规模化部署下,推理效率不再依赖峰值算力,而是由计算、访存、芯片互联与系统调度共同决定Token生成效率与部署成本。
模型推理各阶段资源需求差异极大:Prefill阶段算力密集,侧重上下文集中计算;Decode阶段依赖高内存带宽与高速访存。伴随MoE架构普及,Decode的Attention与FFN模块资源需求进一步细分,推理负载愈发精细化,传统通用算力已无法适配差异化场景需求。
针对推理负载细分演进趋势,云天励飞推出DeepVerse100P、DeepVerse100D、DeepVerse100L三款云端大算力推理芯片,精准匹配不同推理环节的专属需求。
DeepVerse100P面向百万级长上下文Prefill场景打造,有效解决传统混部架构下Prefill与Decode资源抢占痛点,规避长文本预处理拖累整体推理吞吐的问题,适配超大上下文预处理需求。
DeepVerse100D聚焦Decode环节,搭载专用推理引擎,内存性能大幅领先主流芯片,支持1024卡大规模扩容与光互联架构。通过动态光路直连与实时网络重构,规避传统组网的转发拥堵与延迟损耗,降低通信尾延迟,显著提升Token输出稳定性。
DeepVerse100L针对Decode阶段FFN计算密集特性定制,采用3D Memory架构,大幅提升内存带宽。依托低延迟互联与激活数据高速传输能力,提升计算与通信并行处理效率,精准适配高密度推理计算场景。
构建面向万卡(十万卡)异构集群的分离式AI推理基础设施
随着AI推理进入规模化部署阶段,算力系统的优化范围正在由单颗芯片向集群和基础设施延伸。
在万卡规模的推理集群中,系统效率并非单卡性能的简单叠加。不同推理负载对计算、内存和通信资源的需求存在明显差异。与此同时,随着集群规模扩大,通信阻塞、资源等待和尾延迟等问题也会进一步影响整体推理效率。
因此,提升Token生成效率,除了优化单颗芯片性能,还需要对推理过程中的计算、访存、互联和资源配置进行系统级设计。
基于DeepVerse100P、DeepVerse100D和DeepVerse100L,云天励飞计划构建面向万卡(十万卡)异构集群的分离式AI推理基础设施。按照Prefill、Decode和Decode FFN的不同负载特征,分别配置相应芯片和资源池,并通过高速互联形成协同运行的异构算力系统。
这一架构围绕Token生成全过程进行系统优化。通过对不同推理阶段进行分离,降低不同负载之间的资源干扰,并根据实际需求配置计算、访存和通信资源,从而提升集群资源利用率和整体推理效率。
从面向特定推理负载进行芯片优化,到不同芯片之间的协同,再到万卡级异构集群,云天励飞正在将AI推理算力的优化范围由单颗芯片扩展至整个基础设施。
软件栈支撑异构集群落地
硬件异构程度和集群规模提升,也对模型适配、算子优化、编译部署和系统调度提出了更高要求。围绕DeepVerse芯片及其集群应用,云天励飞持续建设IFWA软件栈,覆盖AI模型开发、编程和系统等层级。
在兼容性方面,IFWA围绕Transformer主流架构完善PyTorch ATen算子的适配和性能优化,并加强对vLLM、SGLang等主流推理框架的支持。公司还通过开源Houmao多Agent异构编程框架,以及将成熟的Triton算子能力融入FlagOS,提高模型和算子的适配效率。
从三款专用芯片到万卡异构集群,再到IFWA软件栈,云天励飞此次公布的路线图并非单一芯片的性能升级,而是围绕Token生成全过程展开系统级优化。面向“百亿Token一分钱”的长期目标,公司希望通过芯片、互联、软件和系统协同,形成服务于大规模Token生成的“推理工厂”,持续提高集群资源利用率和算力产出效率。
“百亿Token一分钱”的愿景
Token成本优化是一项贯穿软硬件、技术研发与场景落地的全产业链系统工程。今年5月,云天励飞牵头联合联想集团、龙芯中科、新华三半导体、通富微电、硅基流动等数十家产业链龙头企业、科研院校及行业机构,共同发起签署“1001计划”产业倡议,搭建国产AI算力协同降本的产业生态平台。
该计划核心围绕提升Token生成效率、极致压降Token使用成本,打破产业协同壁垒。通过生态深度联动,将终端应用与模型研发需求前置到芯片设计、系统架构搭建源头,复用成熟软件技术能力,加速国产AI芯片与算力基础设施的场景落地与规模化商用。
云天励飞提出“百亿Token一分钱”的愿景目标,重塑了国产AI算力的产业发展范式。目标直指AI算力高成本、难规模化的核心痛点,引领算力普惠化发展新赛道。通过全栈技术创新与产业链协同降本,打破高端算力成本壁垒,推动国产AI算力从“可用”迈向“普惠可用”。这将大幅降低全社会智能化转型成本,筑牢我国AI产业规模化、高质量发展的核心算力根基。
编辑:芯智讯-浪客剑
热门跟贴