今年WAIC最拥挤的地方,依然集中在机器人、大模型和智能体展台。

这些展品足够直观:机器人可以走路、握手,模型可以对话,智能体可以现场完成任务。相比之下,一套由大量机柜组成的AI基础设施,并不天然具备吸引观众的能力。

但在中科曙光展台,情况有些不同。

首次公开亮相的曙光8000(登峰)被评为大会“镇馆之宝”,展台前持续聚集着观众。这套中国首个全国产十万卡AI超集群受到关注,不只是因为“十万卡”这个数字足够大,更因为它开始回答一个比规模更现实的问题:这么多算力,究竟准备拿来做什么?

打开网易新闻 查看精彩图片

7月18日,曙光8000公布最新运行数据。自7月9日上线以来,系统首周即进入满载状态,日均处理作业超过15万个,单日峰值超过50万个。

目前,曙光8000已完成近千项超智融合应用适配,其中包括大模型训练、高通量推理、科学计算等不同类型的任务。

对一套十万卡系统来说,建成只是一个工程节点。能不能迅速装入真实任务,才决定它是基础设施,还是一座昂贵的技术展品。

十万卡开始寻找具体用途

过去几年,AI基础设施最容易传播的指标是规模。

多少张卡、多少算力、多少参数,构成了行业最直观的竞赛方式。规模扩张有其合理性:没有足够大的算力集群,就无法支撑大模型训练和复杂科学计算。

但当集群进入十万卡阶段,规模本身已经不能完整解释价值。

一个更现实的问题是,是否存在足够多的任务,持续消耗如此庞大的计算资源。

从曙光8000目前承接的应用来看,十万卡的需求来源正在变得更加分散。

其中既有大模型训练和推理,也有机器人、创新药、新材料、汽车研发、气象流体、能源勘探等产业任务;既有大量中小规模作业,也有需要数万张卡协同运行的科学计算任务。

目前,曙光8000已完成300余项重点应用深度优化,覆盖20余个科研和产业领域,超过70项应用实现万卡规模扩展。

这些应用中,有蛋白质折叠模拟、万亿原子级水分子动力学模拟,也有超大规模湍流模拟和科学智能体。

这些名字距离普通消费者很远,却可能是十万卡算力真正能够长期获得需求的地方。

大模型训练具有明显的阶段性。一个模型完成训练后,算力需求会进入推理和迭代周期。而科学研究、工业仿真和行业智能化,则会持续产生大量计算任务。

药物研发需要反复筛选分子结构,汽车研发需要持续进行仿真,气象预测需要不断更新模型,材料研究则要计算不同微观结构的变化。

十万卡不再只服务于某一次超大模型训练,而是开始承载一批不断发生、不断更新的计算任务。

这可能也是曙光8000上线后迅速满载的重要原因:算力需求并没有集中在单一行业,而是从多个领域同时涌入。

应用越复杂,越考验算力是否“好用”

应用数量增加之后,十万卡面对的另一个问题是,任务并不整齐。

大模型训练追求大规模并行,模型推理强调吞吐效率,科学计算看重精度和稳定性,工业用户则更加关心成本、周期和部署门槛。

这些任务很难用一套单一标准调度。

因此,十万卡是否好用,不只是看峰值性能,而是看系统能不能处理混合负载:既要承接一次占用数万张卡的大任务,也要同时处理大量中小规模作业。

曙光8000首周日均处理超过15万个作业,单日峰值超过50万个。这组数据的意义,不在于数字本身有多大,而在于它说明这套系统承接的并不是少数几个超大任务,而是大量并发、规模不同的真实需求。

为了让这些任务同时运行,曙光8000采用智能调度引擎、数据亲和性算法和多元融合调度策略,根据任务类型、数据位置和资源状态进行分配。

这套机制解决的,不只是“有没有空闲卡”,而是如何减少数据搬运和等待时间,把合适的资源交给合适的任务。

底层的网络、存储和散热,也都服务于同一件事:让任务持续跑下去。

曙光8000通过scaleFabric类IB原生RDMA高速互连,解决大规模节点之间的数据交换;ParaStor分布式存储负责持续供给数据;浸没式相变液冷则支撑高密度系统在高负载状态下运行。

这些技术单独拿出来,都不是一个容易进入公众讨论的话题。但对于使用者而言,它们最终会转化成更直接的体验:任务是否需要长时间排队,扩展到数千卡后效率是否明显下降,运行过程中是否频繁中断。

从这个角度看,十万卡真正的门槛,不在于能否把足够多的卡装进机房,而在于能否把它们组织成一种稳定、可调用的生产工具。

比造出十万卡更难的是让更多人用上

曙光8000此次释放出的另一个信号,是超大规模算力正在从封闭集群转向公共服务。

过去,万卡级算力通常属于少数大型科技公司或科研机构。要使用这类资源,往往需要自建数据中心、采购设备、部署软件,并承担长期运维成本。

这种模式决定了,大规模算力很难被更广泛的企业和开发者使用。

曙光8000接入国家超算互联网后,试图把十万卡能力转化为可按需调用的服务。企业、科研团队和开发者无需自行建设超大集群,也可以在已有环境中获得相应算力。

围绕十万卡共创者、智能体生态和核心生态伙伴等计划,曙光8000也在吸引更多应用进入平台。

这件事的重要性在于,十万卡能否持续满载,最终取决于它能否形成一个循环:更多用户带来更多任务,更多任务推动软件和系统优化,更成熟的系统又进一步降低使用门槛。

相比建成一套十万卡系统,建立这样的应用循环更难,也更需要时间。

目前,曙光8000首周满载、近千项应用适配,只能说明它完成了早期验证。后续还要面对成本、商业模式、开发环境和生态迁移等问题。

但至少从WAIC现场可以看到,十万卡竞争的叙事正在变化。

过去行业更关心,谁能建出更大的集群;现在开始关心,这些集群是否有足够多的任务,是否能被不同用户使用,以及最终能产生多少科研成果和产业价值。

机器人和智能体展示的是AI如何进入现实世界,而曙光8000所代表的,是支撑这些应用持续运行的另一面。

十万卡不是答案。

让十万卡持续装入真实任务,才是下一阶段真正需要回答的问题。