编者按:

2025中国智算中心全栈技术大会以“全栈智算算存网加速进化”为主题。字节跳动服务器架构师高晓军,在此次大会上做了主题为《字节跳动“大禹” 服务器架构》的精彩演讲。

本文根据高晓军的演讲全文进行整理,略有删减。

在此次大会上,跟大家着重分享字节跳动的基础设施服务器架构。

该架构之所以被命名为“大禹”,主要原因有两个,一是在于面对各种各样的算力,如何才能用好?字节跳动希望通过疏而不是堵的方式,也就是更开放的将算力用起来,这是“大禹治水”的理念;二是我们认为“大禹”代表了一种智慧,代表了团结的态度,字节跳动考虑通过更加开放的、积极的态度,和业界同行协作,共同将基础服务器产业做大、做好、做强。

大禹架构设计理念

字节跳动的服务器设计理念,总结起来可以分为四条。

第一,从业务需求出发。 由于过去几年业务快速增长,字节跳动在全球建设了大量的数据中心和服务器集群。因此拥有丰富的数据中心集群建设经验。因此,字节跳动会基于业务的优化,从场景出发来进行最合适的服务器设计,不是一定追求先进的技术,但一定是和业务的需求紧密的结合在一起。在此基础上再考虑更好地支持多样性算力,以及对未来跨代的演进提出想法,确保在演进的过程中最大化基础设施的投资收益;

第二,沿绿色低碳方向。 字节跳动始终是致力于建设一个比较低碳的绿色数据中心,已经部署了几十万台液冷服务器,后续还会加大液冷服务器部署的力度,占比在未来还会持续上升。

第三,推进极速交付。 字节跳动在服务器交付的过程中发现,更快交付以快速满足业务需求这个非常重要。因此,字节跳动那个一直在推进L11、L12级别的整机柜模式的交付方式,以快速的缩短交付周期、提升交付质量,实现全球范围规模化部署。

第四,促进开放协同 。在行业生态方面,字节跳动会更加积极、开放的形成统一的解决方案。在这个基础上,实现开放系统的弹性扩展,满足业务增长的需求,快速地使能各种各样的应用。

AI液冷整机柜架构分享

大禹架构的AI液冷整机柜有如下几个特点。

一是算力解耦,弹性扩展。我们的整机柜在U位的设计上,与其他公司的略有不同。在计算区有24个U位,支持机头通过机头+BOX的配置组合,实现资源的灵活配比。

二是多样性算力兼容,支持国内外主流GPU/NPU,U位功能可扩展。

三是扩展性强。在AI基础设施中,Scale-up非常重要,我们在机柜中保留了一定的扩展性。典型情况下会用到8台或者4台交换机,如果需要更多交换机,也能够向上或者向下扩展灵活的组合。

四是机柜预留扩展性大。机柜的深度上为1.4米,保证在供电、制冷方面有充分的空间。

当前整机柜典型的配置功耗在100千瓦,下一代升级之后,会有200-240千瓦的供电需求。通过PowerShelf的数量和PowerShelf PSO 功率模块等比较容易升级替换。

在尺寸方面,我们的整机柜借鉴了行业典型的2286毫米的 高度,U位设计为通用的48毫米。在位置设计方面,也尽可能跟行业内很多设计保持了一致,方便GPU的灵活扩展,能够支持单机柜64卡或者128卡,也可以通过两柜背靠背的方式一直到256卡的规模,扩展性能够满足当前以及未来2-3年的业务需求。

在模块化方面,无论是Cable Tray、Busbar还是Manifold,我们都进行了模块化的设计,支持各种独立演进和跨代演进。

通用计算液冷整机柜架构分享

字节跳动的通用计算液冷整机柜借鉴了AI液冷整机柜的架构,它的高度、深度、外缘尺寸等都跟AI液冷整机柜保持了一致,确保在数据中心的部署时能够统一。

通用计算液冷整机柜采用了24个U位做计算节点,每个U位可以放两个逻辑节点,因此整个机柜可以提供48个通用处理器节点,相比传统的风冷机柜能够实现4倍以上密度提升。

通用计算液冷整机柜的很大一部分收益来自于密度和网络。传统的风冷 多机柜方式 ,网络端口利用率在70-80%,而液冷整机柜的方式,能够把利用率提升到95%以上,能够节约大量的网络成本。

此外,我们会预留10U的空间,去支持存储服务器,来支持业务存算混合部署场景,以提高集群的性能。这里预留的空间可以方便地部署两台或者三台HDD存储服务器,也可以部署NVMe的SSD存储服务器。当然,机柜下方的空间也可以保留支持CDU。

在整机柜的后部,我们采用了跟AI整机柜同样的设计理念,实现了Manifold和Busbar模块化的设计,功率等级略低于AI整机柜,单机柜按照66千瓦规划。

整机柜的极速交付 便捷运维

除了以上提及的整机柜设计理念,字节跳动在交付部分也进行了较多的尝试,在全球多地实现了L11级整机柜模式的交付实践。

我们认为,首先在规划方面,需要数据中心和服务器进行较好的协同,包括单机柜的功率等级、散热、网络架构等。

通用计算的很多设计是只给CPU做液冷,这部分风液比大概在50-60%,而AI的机柜通常AI算力的液冷已经可以占到80-90%。

其次,要实现服务器的标准化,这一点非常关键。不管是机柜、供电、快接规格、机柜管理方法等,都需要在较长的时间内保持延续性,避免部署的过程中跨代的变更但来的成本;

在预集成的管理。在工厂端的预集成包括了各个部件的集成,整机柜的测试等;

另外,上线的自动化部署、整机柜质量的测试等,都是比较重要的能力。

通过一系列的工作,我们实现了交付周期的大规模缩短,从平均两个月到了一个月,收益非常大。同时,服务器的故障率也得到了明显的改善,随着AI机柜和通用机柜的持续规模化部署,我们相信未来在全球整机柜的交付模式会持续推进。

服务器整机柜规模部署挑战和展望

我们认为,当前在整机柜的部署中,既有挑战,也面临着很大的机会,应该着重在如下三个方面发力:

第一,规划协同。这需要数据中心、服务器和网络等各个方向上共同做好规划,比如说在未来三年的规划应该今早做好协同。在此基础上,需要服务器架构设计有更多的开放和弹性。在业务发生变化和数据中心建设发生变化时,服务器端能够很容易的调整和适配。

第二,业务优化。业务的需求在持续不断的变化,在服务器的准备上一定要契合业务的需求变化快速灵活的做好响应,这样才能够提升业务的效率、质量和运维的体验。

第三,规范保驾。这就需要大家一起努力,在全行业推进整机柜规范的建设,通过规范的建设做好行业经验的共享,较好的使能各种算力,保障整机柜服务器在数据中心大规模的可靠、稳定、快速的应用。

整体而言,字节跳动希望跟大家一起,共建共享行业生态,从CPU、GPU的算力,液冷、供电、机柜等部件的生态,跟大家共同推进整个智算、通算生态的发展。

7月27日, 由全球计算联盟(GCC)在2025世界人工智能大会(WAIC)主办、益企研究院协办的论坛——“智算技术创新与行业实践”,将于7月27日下午在上海世博中心展览馆召开。届时,字节跳动技术专家将会现场分享《面向未来的智算基础架构》。

欢迎扫码莅临现场参加!