人工智能基础设施市场正跨越一道重要门槛。行业讨论的焦点已从采购GPU转向构建能够稳定、高效、规模化生成Token的完整AI工厂。

这是下一个瓶颈所在。GPU或许是引擎,但AI工厂是一个系统。计算、网络、存储、散热、软件与运维必须从第一天起就协同运转,贯穿整个生产周期。任何一个环节掉链子,昂贵的算力就会白白闲置,营收随之流失。

在一系列theCUBE独家专访中,记者与思科网络工程高级副总裁Will Eatherton、英伟达网络高级副总裁Gilad Shainer,以及英伟达解决方案架构与工程副总裁Marc Hamilton进行了深度对话,探讨两家公司如何应对新兴云服务商、主权AI项目与企业客户将基础设施推向生产阶段时所面临的执行挑战。对话围绕机架级AI工厂在工程、运营和财务层面的核心要求展开。

这也是思科与英伟达将"思科安全AI工厂"扩展至机架级系统这一战略布局背后的深层逻辑。此次合作将液冷计算、AI优化网络、经过验证的设计方案与统一运维整合为一体,致力于压缩从订购基础设施到产出首个Token之间的时间差。完整的机架级安全AI工厂解决方案将于9月通过思科渠道开放订购。

市场已进入执行时代,谁能最快将资本支出转化为有效产能,谁就能笑到最后。

首Token生成时间成为基础设施新标尺

新兴云服务商的处境最能说明问题的紧迫性。很多服务商在GPU到货之前客户已经排队等候,这意味着部署延误直接等同于营收延误。企业客户面临类似压力,通过外部API调用模型的成本持续攀升。主权AI项目则又增加了一层约束——必须在性能、数据管控与国家基础设施需求之间寻求平衡。

这些不同类型的市场正在围绕同一个核心问题汇聚:一个组织从签订采购订单到建成可投产的AI工厂,究竟需要多长时间?

"当我们与新兴云服务商合作时,他们往往从提交GPU采购订单的那一刻起,终端客户就已经就位,"思科网络工程高级副总裁Will Eatherton表示,"挑战之一就是速度——从项目规划完成、GPU到货,到完成所有软件部署、系统启动,再到交付给最终用户,整个过程都要与时间赛跑。"

更深层的转变是经济逻辑的重塑。传统企业基础设施往往被视为需要压降的成本中心,而AI工厂的设计目标是生产一种数字产品:Token。这些Token驱动应用、智能体和业务流程,让基础设施与营收直接挂钩。

这改变了评价维度。利用率、可用性、每秒Token数、每瓦Token数,不再只是工程指标,而是切切实实的业务指标。

"AI工厂真正的价值不在于节约成本,而在于Token的生产效率以及如何将其转化为营收——关键是要有一套可复制的方法论,"英伟达解决方案架构与工程副总裁Marc Hamilton说道。

一堆组件堆不成AI工厂

这一轮建设浪潮不能沿用旧有的数据中心建设思路。AI工厂作为一个庞大的计算系统,由成千上万乃至数十万个组件构成,GPU、网卡、交换机、线缆、存储系统、模型与软件库必须协同运转。

这使得架构设计至关重要。英伟达将AI工厂描述为五层蛋糕结构,依次涵盖数据中心的土地、电力与外壳;芯片;基础设施;模型;以及应用。每一层的优化都影响整体性能。

"构建AI工厂,不是把组件连起来然后碰运气,"英伟达网络高级副总裁Gilad Shainer表示,"构建AI工厂意味着你需要建造一台超级计算机——它必须建得快,必须提供最高的每秒Token数和最优的单位能耗Token数,以此类推。"

思科的扩展方案将机架级系统与液冷技术引入支持HGX和MGX形态的架构,涵盖英伟达NVL72系统,并预留了向Vera Rubin平台演进的路径。思科在这些系统之上叠加了网络、软件、销售与技术支持能力。

网络架构方面,方案融合了英伟达Spectrum-X以太网与思科技术。Spectrum-X提供分布式AI计算所需的自适应路由、拥塞控制、远程直接内存访问与无损传输能力;思科Silicon One满足前端、存储及数据中心互联需求;NX-OS或SONiC则提供熟悉的操作模式。

这正是双方合作的独特价值所在:英伟达带来专为AI打造的基础设施,思科带来连接AI工厂与现有业务数据所需的网络覆盖能力、企业级运营模型与丰富的落地经验。

参考架构降低财务与运营风险

参考架构有时被简单视为技术清单,但这种理解低估了它在AI工厂市场中的真实作用。

英伟达云合作伙伴参考架构明确了整套系统的构建、测试与运营方式。思科验证设计与思科验证基础设施服务则将这些要求适配到思科的网络与管理技术之上。其目标是实现可复制性:客户每次部署集群时无需从零重来。

认证还具有财务层面的意义。基础设施贷款方希望确信所融资的资产能够达到支撑投资回报所需的利用率、性能与可用性水平。遵循既定参考架构,因此可能影响融资条款,不仅仅是技术表现。

"全球一些规模最大的金融贷款机构已经明确表示,只有遵循英伟达云合作伙伴参考架构的客户,才能获得优惠利率融资,"Hamilton表示,"这已经成为所有思科客户和思科销售团队的重要卖点。"

可用性是风险最直观的体现。一座价值数十亿美元的AI工厂,如果因线缆、固件或软件问题导致可用性仅有50%至60%,其经济账就会彻底崩盘。首个Token固然重要,但第十亿个Token更加关键。

经过验证的基础设施减少了不确定变量,为部署团队提供经过测试的架构、基准测试工具,以及贯穿思科与英伟达的统一问题升级路径。在记者看来,这种运营纪律将成为AI基础设施栈中最具价值的层次之一。

Day 2运营决定最终胜负

让AI工厂上线只是开始。模型快速迭代,推理软件持续演进,组织不断引入新负载,系统必须在不牺牲可用性的前提下完成升级与优化。

"回顾Blackwell这一代GPU,在产品整个生命周期内,我们通过软件优化将推理成本压缩了数倍——不是1到2倍,而是10倍、20倍、30倍,"Hamilton表示,"因此,在AI工厂部署完成后持续升级的能力至关重要。"

思科正将Nexus One与Cisco Cloud Control定位为覆盖路由、前端网络、存储网络及Spectrum-X后端的统一管理层。AgenticOps的加入,则为跨基础设施的AI辅助监控与全生命周期管理创造了条件。

"行业大量关注的是点亮集群、跑出第一个Token这一节点——这很重要,"Eatherton说,"但围绕监控、健康状态、可用性与软件升级的Day 2运维,是思科多年来持续深耕的领域。"

随着推理场景向本地部署、新兴云服务商和边缘侧延伸,这一点变得愈发关键。企业希望在不引入全新操作环境的前提下调用外部算力;新兴云服务商希望以日益精细的安全与计费管控,同时服务多个客户、部门和开发环境。

统一架构可以让这些边界变得不那么明显。企业应当能够在本地运行敏感推理任务,在需要时突发至新兴云服务商,并将智能延伸至工厂、医院、电信网络及其他边缘场景。

长远来看,机会远不止于销售机架,而是建立一套可复制的智能运营模型。

AI基础设施建设浪潮或许是计算史上规模最大的资本部署周期之一,但资本本身决定不了结局,执行力才能。市场正从GPU稀缺转向系统工程竞争,网络、软件与运维决定了每一美元、每一瓦电能产生多少有效智能。

首Token生成时间让AI工厂进入赛道,持续优化、可用性与规模化才是制胜之道。

Q&A

Q1:AI工厂和传统数据中心有什么本质区别?

A:传统数据中心通常被视为需要压降的成本中心,而AI工厂的核心目标是生产Token这一数字产品,直接与营收挂钩。AI工厂要求计算、网络、存储、散热、软件与运维全层协同,任何一个环节出问题都会导致昂贵算力闲置。评价指标也从传统的IT指标扩展为利用率、可用性、每秒Token数、每瓦Token数等业务级指标。

Q2:思科与英伟达合作的安全AI工厂方案具体包含哪些内容?

A:该方案将液冷计算、AI优化网络、经过验证的设计与统一运维整合为一体。网络架构融合了英伟达Spectrum-X以太网(提供自适应路由、拥塞控制、无损传输等能力)与思科Silicon One及NX-OS/SONiC操作层。硬件支持HGX、MGX形态及英伟达NVL72系统,并预留向Vera Rubin平台演进的路径。完整的机架级解决方案将于2026年9月通过思科渠道开放订购。

Q3:参考架构认证为什么会影响AI工厂的融资条款?

A:金融贷款机构在为AI基础设施融资时,需要确信资产能够达到支撑投资回报所需的性能与可用性水平。遵循英伟达云合作伙伴参考架构,意味着系统经过完整测试与验证,能够降低部署失败风险。据Marc Hamilton透露,全球一些规模最大的金融贷款机构已明确表示,只有遵循该参考架构的客户才能获得优惠利率融资,这使得架构认证从技术选型问题升级为财务决策因素。