事件现场:一条推文炸出11倍性能跃升

9月7日下午,AMD官方账号甩出一组数据:在MI355X加速卡上,vLLM框架跑MiniMax M3模型的智能体工作负载,性能直接提升11倍。从开始优化到公布结果,全程不到19天

打开网易新闻 查看精彩图片

这条消息没有发布会,没有预热,就是一条带感叹号的推文。但数字本身足够刺眼——11倍不是跑分里的理论值,是真实工作负载下的实测提升。

软件优化怎么做到11倍?

AMD在推文里把路径说得很清楚:这次提升完全靠软件优化,没有换硬件。核心动作是优化长上下文注意力算子,再叠加其他几项优化。

上下文注意力算子是智能体工作负载里最吃计算资源的部分。MiniMax M3这类现代模型要处理很长的上下文窗口,注意力计算量随序列长度增长得飞快。算子层面的优化,相当于把这条最堵的通道重新设计了一遍。

AMD没有公布具体改了什么参数、用了哪些技巧,但结果摆在那里:同样的MI355X,同样的模型,跑同样的任务,速度快了11倍。

ROCm软件栈的算盘:硬件买一次,性能免费涨

推文里AMD特意点了一句:这就是ROCm软件栈的威力——硬件买一次,后续通过软件优化持续获得性能更新,不用再花钱

这句话的潜台词很直白:买卡不是一次性消费,软件团队会持续把硬件潜力挖出来。对预算敏感又需要跑大模型推理的团队来说,这个逻辑有吸引力。

19天完成11倍提升,说明AMD在vLLM和ROCm的配合上已经有一套快速迭代的打法。不是等季度更新,而是发现问题就上,优化完就发。

值得注意的三个点

  • 时间极短:不到19天,从优化到公布,节奏快得不像传统硬件厂商。
  • 纯软件收益:没有新卡、没有新驱动版本号,就是算子层面的改动。
  • 针对智能体负载:不是通用跑分,是Agentic Workloads,说明AMD在盯AI智能体这个具体场景。

对买卡的人意味着什么

如果你手里已经有MI355X,这次优化等于白捡了11倍性能。如果你在评估要不要上AMD的卡,这条消息至少说明一件事:ROCm软件栈的优化速度比很多人以为的快。

当然,11倍提升发生在特定模型、特定负载、特定框架的组合下,不能直接外推到所有场景。但AMD选择公开这个数字,本身就是一种信号——软件优化正在成为硬件竞争力的核心变量。