没有新显卡,也没有跑分轰炸,这场 IFA 2026 的 AMD 开幕演讲只讲了一件事:Personal AI(个人 AI)。支撑它的三样新品分别是 Ryzen AI Max 400(代号 Gorgon Halo)平台、下一代 HP ZBook 笔记本的首度曝光,以及一台 96 核、全液冷的“桌上超算”Threadripper Halo Station。
AMD 高级副总裁、计算与图形总经理 Jack Huynh 在 45 分钟的演讲里,从绕月飞行的 Artemis II、手术机器人讲到芬兰的 LUMI 超算和 PlayStation 5 Pro,回顾了一遍 AMD 的算力版图。随后,他把问题落到了每个人的电脑上:当 AI 像员工一样整天规划、调用工具和修改结果,这些计算究竟应该放在哪里?
AI 是新的电力,但电费快付不起了
Jack 把生成式 AI 过去几年的变化压缩成四步:先学会对话,再获得视觉和语音能力,随后开始推理;到了 2025 年,AI 从回答问题的模型变成了能够规划、调用工具、检查结果并继续工作的 Agent。类似的转变除了带来更好的用户体验,更多的是工作负载的增加。
一次普通 ChatGPT 对话只要几百到几千 token,而一个“帮我规划全家意大利旅行”的 agent 任务,要查日历、订机票、改酒店,一次就是数十万甚至上百万 token。按 AMD 给出的数字,消费者级用户每天将消耗数百万 token,创作者是数千万,开发者和创业者则是 5000 万起步。
宏观数据则显示,过去一年全球月度 AI token 处理量从约 0.7 quadrillion(700 万亿)蹿升到 1.7 quadrillion(1700 万亿);到 2030 年,预计达到每月 120 quadrillion(12 亿亿)。与此同时,93% 的企业正在超支 AI 预算。Jack 提到一个活跃用户每天 1500 万输出 token,走云端大约是 300 欧元一天;一年为一个人的 AI 用量买单,需要支付接近 10 万欧元。
“我们不能只是花更多钱,必须算得更聪明。”这句话,大概就是 AMD 整场发布会的题眼:如何把 AI 从云端拉回本地。
模型在变小,PC 在变大
本地化叙事能成立的前提,是本地模型和闭源的前沿模型相比足够好,即模型体积要变小、性能要变强。去年 8 月 OpenAI 放出的开放权重模型 GPT-OSS-120B 在 GPQA(研究生级推理基准)上曾拿到 80 分,已经作为很多开发者的本地部署首选。几个月后,阿里的 Qwen3.5-9B 只用 90 亿参数,就在同一基准上拿到了更高的分数,参数少了 13 倍,成绩反而更好。
放眼最近这几个月,开源模型和闭源模型的竞争更是如火如荼,从 Kimi K3 对标 Fable 5,到 DeepSeek、GLM,甚至 Flash 模型都开始对标 Claude Opus 系列模型。AMD 的路线图也是沿着这条曲线展开,当前 Gorgon Point 处理器,也就是 Ryzen AI 400 系列可以本地跑 240 亿参数模型;128GB 统一内存的 Strix Halo 则可以运行 2000 亿参数模型。
这些本地模型的表现,AMD 在现场也给出了对比:完全跑在 Strix Halo 上的开源模型 Laguna S 2.1,在一项软件工程基准上超过了云端的 Claude Sonnet 5(70.3 分)。1000 万输出 token,Claude Sonnet 5 云端约 90 欧元,本地为零。
个人 AI 的三个关键词
把计算搬回电脑,而不是放在数据中心,这是 AMD 针对本地计算的想法。而在本地计算解决速度与成本之后,隐私与控制也是 Agent 比较敏感的一方面。AMD 希望这些资料先留在用户身边,由用户决定什么内容可以离开设备、发往哪里。
最后是个人上下文,这是 Jack 眼中比应用、模型和算力多出来的第四层。同一句“帮我准备明天”,对上班族可能意味着客户会议和三个待定事项,对学生则可能意味着考试与学习小组。模型知道世界知识还不够,它还得知道提问的人明天要面对什么。本地计算、隐私与控制、个人上下文,这就是 AMD 所押注的个人 AI 三个关键词。
从 192GB 统一内存到万亿参数工作站
在具体的产品上,AMD 介绍了 Gorgon Halo,对应的市场名是 Ryzen AI Max 400 系列。统一内存从 128GB 提升到 192GB,本地可运行模型从 2000 亿推到 3000 亿参数。在现场,AMD 还展示了来自智谱的 GLM-5.3-Flash,3200 亿参数可以在 Gorgon Halo 上本地运行,并展示了在同一基准上,本地模型的表现甚至要优于云端的 Claude Fable 5;作为对照,Fable 5 跑 1000 万输出 token 大约要花 500 欧元。
应用该芯片的电脑也有联想在 IFA 2026 旗舰发布的 ThinkCentre X Ultra,搭载 Gorgon Halo,小到可以摆在桌面上,最多四台可以组成集群。此外,Jack 还首次公开了代号 Sundance 的下一代 HP ZBook:192GB 统一内存,现场用一条 prompt 在本地实时生成了一整个 3D 世界,然后又用它流畅跑了《微软飞行模拟》。“白天创造世界,晚上打游戏。一手是真实世界,一手是我想象的世界。”
Gorgon Halo 仍然是一台面向个人的紧凑型电脑。演讲接近尾声时,Jack 把“个人 AI”推到了另一种尺寸。首次亮相的 Threadripper Halo Station,把 96 核 Threadripper PRO 和数据中心级 AMD Instinct MI350P 放进一台桌边工作站。现场展示机装有两张 MI350P,并预留了扩展到四张的空间;系统内存最高 2TB,四卡配置下的 HBM3E 总容量最高 576GB,整机采用液冷。AMD 称,它可以运行超过 1 万亿参数的模型,并称其为“全球最强工作站”。
DeepSeek、千问、GLM、gpt-oss 和 Laguna 也出现在台上,但它们在这场演讲里成了新的衡量指标。刚发布一周多的 Qwen3.8-Flash-Next 就能放进 AMD 的新平台里运行、拥有 3200 亿总参数的 GLM-5.3-Flash 也能装进统一内存里。AMD 用这些开放权重模型证明,从普通 AI PC 到桌边工作站,任何硬件确实都有任务可跑。对这些电脑芯片厂商来说,过去他们都在比游戏帧率,现在已经变成了比较我的电脑到底能装下多大的模型。
热门跟贴