抛开营销规格,锚定推理指标

Redis创始人萨尔瓦托雷·桑菲利波没有跟着苹果的宣传节奏走。他把新款Mac Studio M5 Ultra的价值判断,直接拉回到一个具体问题上:这台机器跑大语言模型推理,到底行不行。

他关注的不是纸面参数,而是三个可验证的指标:GLM 5.3的实际运行速度、在最优批处理下能同时支撑多少路会话、以及本地部署大模型服务的隐含成本效益。

从“规格表”转向“生产环境”

这种视角的切换,把讨论从硬件参数表带进了真实使用场景。桑菲利波提出的核心问题是:在保证终端用户可接受速度的前提下,Mac Studio M5 Ultra最多能并行处理多少个会话。

换句话说,单次推理快不快只是起点,真正决定这台设备能否用于生产环境推理的,是它在持续负载下的吞吐量和并发能力。

本地大模型服务的成本账

桑菲利波还把目光投向了一个容易被忽略的维度——成本效益。本地跑大模型,省下的不只是API调用费,还有数据出域的顾虑和网络延迟。

但前提是硬件本身要能扛住真实负载。如果并行会话数上不去,或者GLM 5.3的速度达不到可用线,那么再强的单核性能也难以转化为实际生产力。

专家视角的提醒

这条来自一线开发者的评估思路,给关注AI硬件的人提了个醒:别只盯着峰值算力,要看它在具体模型、具体批处理策略下的实际表现。

Mac Studio M5 Ultra到底值不值得买,答案不在发布会里,而在GLM 5.3跑起来之后的那组数字里。