来源:市场资讯

(来源:边小缘 边缘计算社区)

深夜十一点,一家亚太情感陪伴 App 的后台数据还在往上跳。

日活又破了新高,运营团队在群里发庆祝的表情包,CFO 在另一个群里沉默地看着账单。

用户越多,本该越赚钱。可这家公司的真实处境是,用户涨得越快,亏得越狠。

语音要实时合成,图片和视频要多模态生成,用户和虚拟角色的对话二十四小时不打烊。每一次开口,背后都是一次模型调用、一次数据传输、一笔真金白银的开销。增长曲线越陡,亏损贴得越紧。

打开网易新闻 查看精彩图片

撞过这面墙的出海 AI 团队不少。

产品测试期,账单还能忍。用户规模一起来,推理成本就像开了闸。有人怀疑模型选错了,有人砍功能省钱,却很少有人继续往下追问:问题会不会出在更底层,出在真正跑推理的 GPU,以及围绕它的一整套基础设施上?

后来,这家公司把推理迁到了 Akamai 的 AI 推理云。GPU 换型号,精度换方案,流量成本重新算了一遍。半年后回头看,整体 AI 与 IT 成本砍掉了大约六成,项目从亏损变成了盈利。

同一个模型,同一批用户,账单为什么能差出这么多?

很多时候,这本账的第一处差距,就从 GPU 选型开始。选错一张卡,后面的显存、并发、流量和架构成本,都可能被一起放大。

01

选 H100,可能从一开始就选错了

去问正在做 AI 出海的团队,跑推理用什么卡?

很多人的第一反应会是 H100。

这几乎变成一种惯性:沾了 AI,不上顶配,好像还没开跑就输了。

问题是,训练和推理本来就是两类不同的任务。

训练更看重多卡互联、显存容量和大规模计算能力;到了推理阶段,真正影响成本的,是单张卡能不能装下完整模型、有限显存里能扛多少并发,以及每一个 token 到底要花多少钱。

拿训练时代的顶级卡直接套到所有推理场景里,有点像开越野车挤城市早高峰。车当然是好车,但未必最经济。

差距往往藏在一个容易忽略的细节里:精度。

2026 年 3 月,Akamai 把 NVIDIA RTX PRO 6000 部署到自己的全球节点。这张卡原生支持 FP4,而 H100 所在的 Hopper 架构主要支持到 FP8。

打开网易新闻 查看精彩图片

精度从 FP8 往 FP4 降,最直接的变化是模型占用显存减少。对于不少推理模型来说,在可接受的精度损失下,省下来的显存可以承载更多并发、更长上下文,甚至让原本需要多卡的模型压进单卡。

数字更直观。

Akamai 公布的 Benchmark 显示,其部署的 RTX PRO 6000 推理吞吐最高可做到 H100 的 1.63 倍。跑 Llama 3.3 70B 时,每百万 token 成本约 0.31 美元,比 H100 低约 14%。

时租上,Akamai 大部分数据中心节点的 RTX PRO 6000 为 3 美元/小时起,部分主流云厂商的同款 GPU 价格则在 5 美元/小时以上。

对一项每天跑二十四小时的推理服务来说,每小时几美元的差距,乘上几十张、上百张卡和整个月的利用率,很快就会变成一笔不小的成本。

真正需要问的问题因此不是:哪张卡最强?

而是哪张卡每一美元能产出最多有效推理?

02

便宜的卡,不一定带来更便宜的推理

顺着省钱往下想,很多团队会冒出一个自然的念头:既然企业级 GPU 贵,直接上消费级游戏卡行不行?

比如 RTX 5090。

创业初期拿它跑 Demo、做内部测试,没有问题。可一旦进入稳定运营阶段,事情就不只是比较一张卡多少钱了。

打开网易新闻 查看精彩图片

首先是显存。消费级卡能够支撑不少中小模型,但面对更大的模型、更长上下文和更高并发时,显存很快会成为瓶颈。

其次是稳定性和扩展能力。单机测试跑得起来,不等于多卡、长时间、高负载环境下依然适合生产。用户规模上来之后,架构重构、故障排查和工程维护本身都会变成成本。

这也是为什么企业推理选卡,不能只盯采购价或者小时租金。

Akamai 部署的 RTX PRO 6000 提供 96GB GDDR7 显存。对于 30B 到 70B 级别的推理模型,量化之后有机会直接在单卡中运行,并留下更多空间给上下文和并发。

它解决的不是“怎样买到一张更便宜的卡”,而是:

怎样用更少的卡,把同样的业务稳定跑起来。

03

流量费这本账,比算力更容易被忽略

但选对卡,只是把这本账算对了一半。

还有一笔支出尤其容易被忽视:出站流量费,也就是 egress。

对于纯文本模型,这笔钱未必显眼。但到了语音、图片和视频生成场景,一次请求传出去的数据量可能迅速增加。

用户越活跃,生成内容越丰富,数据传输就越频繁。

这时候,GPU 并不是唯一一台不停转动的计价器。

不少主流云平台的公网出站流量价格大约在每 GB 0.08 到 0.10 美元,Akamai 的相关价格可以低到每 GB 0.005 美元。

两者之间不是几个百分点的差异,而可能是一个数量级以上。

对多模态 AI 产品而言,这一点尤其重要。一段实时语音、一批生成图片、一条短视频,单次传输看起来都不夸张,但乘上几十万甚至几百万用户之后,网络成本很容易从账单里的小项,变成不能忽略的固定支出。

Akamai 能把这部分价格压下来,与它近三十年积累的 CDN 和边缘网络基础设施有关。

过去,它把网页、图片和视频送到全球用户手里;今天,换成把模型生成的回答、语音和画面送出去。内容变了,底层仍然有很大一部分是同一本网络账。

所以,AI 推理的成本不能只算:

GPU 一小时多少钱。

更完整的公式应该是:

GPU + 网络 + 并发效率 + 利用率 + 运维成本。

04

推理节点离用户多远,也会写进成本里

除了钱,还有另一个容易被低估的变量:延迟。

用户并不关心后端用了什么模型,也不关心跑在什么 GPU 上。

用户只知道一件事:

我问完以后,它多久开始回答。

首个 token 慢上几秒,聊天的流畅感就会明显下降;到了实时语音、在线客服、AI NPC 这类场景,几百毫秒的差异都可能被感知。

要降低延迟,一个最直接的方法,就是让推理尽可能靠近用户。

Akamai 已经把 RTX PRO 6000 部署到全球多个数据中心节点,覆盖新加坡、东京、孟买、雅加达、法兰克福、洛杉矶等城市。

打开网易新闻 查看精彩图片

对于一款服务全球用户的 AI 应用,这意味着请求不必默认跨越半个地球,集中进入少数几个核心区域,再把结果原路传回来。

物理距离是一部分,网络路径则是另一部分。

一次内部测试中,同样从美国节点为南美西语用户提供服务,切换到 Akamai 网络的对应路径后,延迟缩短了约 15%。

服务器和用户的地理坐标都没变,变化的是数据在互联网上实际走过的那条路。

算力决定模型多久算完,网络决定结果多久真正到达用户。

对全球化 AI 产品来说,这两部分最终共同决定用户感受到的速度。

05

三本真实账

技术原理讲得再多,最终还是要落回具体业务。

下面三个案例来自 Akamai 的实际客户实践,并按客户要求进行了匿名处理。

账本一:情感陪伴 App

文章开头那家亚太情感陪伴企业,原先使用较老一代的旗舰训练卡承担多模态语音交互。

算上 GPU 和较高的出站流量成本之后,每生成一百万 token 的综合成本一度接近 4.5 到 5 美元。

迁移到 Akamai 后,团队换用 RTX PRO 6000,并采用 FP4 方案,同时降低网络传输成本。最终,每百万 token 的综合成本降到约 1.8 美元,整体 AI 与 IT 开销下降约六成,项目也从亏损转向盈利。

这个案例真正改变的,不只是 GPU,而是把模型精度、算力和网络放回同一张成本表里重新计算。

账本二:韩国头部游戏公司

另一家韩国头部游戏公司,在一款全球运营的实时在线游戏里同时运行两个 AI 场景。

游戏内 NPC 的实时对话,背后是一个 70B 大模型,对响应速度和显存要求都很高,因此跑在 RTX PRO 6000 上。

而离线生成游戏素材的文生图任务,模型更小,对实时响应要求也更低,于是使用上一代 RTX 4000 Ada。

一个实时任务用高端 GPU,一个离线任务用更经济的 GPU。

这里的原则很简单:

不是所有 AI 任务,都值得上最贵的卡。

账本三:家庭安防摄像头

第三家客户是一家全球家庭安防摄像头企业。

做 AI 异常入侵检测时,它没有把整条视频处理链路全部堆给 GPU,而是先拆工作流。

大量原始视频先经过专用视频处理芯片 VPU 完成抽帧和初步筛选,只有真正包含异常信息的关键帧,才继续送进 GPU 做精细识别。

相比传统的纯 CPU + GPU 方案,VPU + GPU 的混合架构节省了约 30% 到 60% 的成本。

这又把问题往前推进了一步:

前两个案例问的是,该选哪张 GPU。

这个案例问的是,哪些工作根本不需要交给 GPU。

推理的性价比,很多时候不是把一张卡跑得更满,而是先把工作流拆开,每一段任务交给最适合它的硬件。

06

卖 CDN 和卖智能,算的是同一本账

出海企业今天算 AI 推理这笔账,和很多年前算 CDN 流量账,本质上没有那么不同。过去,是把网页和视频更快、更便宜地送到全球用户眼前;今天,换成了模型生成的回答、语音和画面。

技术对象变了,底层还是同一本账。

所以,真正的推理成本从来不只是“GPU 一小时多少钱”。显存、并发、流量、网络路径,以及不同任务该用什么硬件,最后都会写进同一张账单。

用户规模小时,这些差异并不起眼;到了几十万、几百万用户,每一次不起眼的资源浪费都会被成倍放大。

这时候,基础设施优化就不再只是工程问题,而是一道商业模式题。

一张 GPU 卡的选择,可能就是这本账开始分叉的地方。

选错了,用户越多,成本放大得越快;选对了,再把网络和工作流一起算进去,增长才更有机会变成利润。

单个 token 的价格还会继续下降,但一家 AI 公司最终是赚钱还是烧钱,取决于有没有把整本推理账算对。