“原生代币定价的成本已经完全失控了。”戴尔科技集团基础设施解决方案事业部产品营销高级副总裁瓦润·查布拉(Varun Chhabra)在AMD Advancing AI活动上,对theCUBE的戴夫·维兰特(Dave Vellante)直言不讳。他负责的团队正面对一个现实:企业将AI从概念验证推向生产部署时,规模化之路远比想象中复杂。
在概念验证阶段,AI项目通常在一小群用户中运行顺畅。一旦试图把这类工作负载推广到整个企业,成本、数据和治理三座大山立刻横亘在前。查布拉把话题直接指向了最先失控的环节——原生代币定价。“尤其在顶级用户开始从工作流中看到巨大价值的时候,它的开销会急剧攀升,很容易就高到无法接受。”他说。企业不得不开始问两个基本问题:怎么才能把成本控制住?又该怎么为AI的使用编制预算?
第二个挑战锁定在数据层面。光是让算力靠近企业数据还不够,组织还需要建立一整套数据治理策略,并确保AI模型通过检索增强生成(RAG)流水线等技术,得到“正确数据”的喂养。查布拉没有展开描述RAG的具体架构,但明确了一点:数据质量与供给方式,是决定模型能否在企业环境中稳定输出的核心环节。
紧随其后的第三个挑战是安全与治理。“当你规模化的时候,怎么去考虑那些非预期的后果?”查布拉这样发问。在他看来,成本、数据和治理这三者不是独立难题,而是一张配方里不可省去的原料,缺任何一样,企业级生成式AI工作负载都无法真正铺开。
一个正在发生的行业变化是,随着推理工作负载持续增长,并吞噬越来越大的AI算力份额,更多企业开始把目光从云端API拉向本地部署。为什么不继续走云这条路?逻辑并不复杂:企业想让自己成为“代币生成器”,而不是始终被云厂商的计价所牵制。查布拉的判断是,大型企业最终不会只拥抱一种部署模式,而是会针对不同工作负载,采取不同的AI基础设施和部署方案。
这也就催生了对模块化架构的直接需求。查布拉对客户行为的观察很直接:“我们发现客户想要的是模块化解决方案,他们希望从整个平台的角度去思考问题。”计算、存储、网络、GPU,再加上上层经过测试和验证的软件框架与模型——所有这些组件必须协同运转。戴尔与AMD正是基于这一思路,共同设计了Dell AI Platform with AMD,让用户能够从较小的AI部署起步,之后在同一平台上扩容,无需重新架构基础设施。查布拉提到的“模块化AI工厂”,就是这种思路的具象体现:用预集成的存储、计算、网络组合单元,搭配AMD Instinct加速器和EPYC CPU,再结合ROCm软件栈,搭建起可渐进扩展的基础。
把这句话拆开来看,意味着企业不必一开始就承担高昂的前期建设成本,也不必在规模扩大后推倒重来。模块化AI基础设施试图回答的,正是那个被反复提及的问题:如何在控制成本的同时,让AI从一个小型实验顺利走向全员生产环境。戴尔给出的解法是——让基础设施本身具备可编排的弹性,而编排的起点,可以很小。
热门跟贴