Groq 3 LPX 扩展 Vera Rubin 平台,为下一代智能体 AI 提供超快 Token 生成能力,Nebius 率先采用
- 在 Artificial Analysis 基准测试中,Groq 3 LPX 在智能体编程及其他延迟敏感型工作负载中,展现出行业领先的速度。
- NVIDIA Groq 3 LPX 通过大幅提升 Token 生成速率,进一步扩展了 NVIDIA Vera Rubin 系统的推理性能。
- Nebius 成为首家采用 NVIDIA Groq 3 LPX 的 AI 云服务商。
NVIDIA 在 Hot Chips 大会上宣布,其交互式 AI 推理加速器 NVIDIA Groq 3 LPX 现已全面量产。作为 NVIDIA Vera Rubin 平台的扩展,Groq 3 LPX 通过实现超快的 Token 生成速度,大幅提升了 AI 推理性能,从而为高度响应的智能体系统提供强力支持。
智能体系统能够在数百乃至数千个推理步骤中生成海量 Token,因此,更快的 Token 生成速度对于智能体进行实时推理、执行任务以及完成复杂任务至关重要。
Vera Rubin 系统为各类 AI 工厂提供了最通用的训练与推理平台。NVIDIA Groq 3 LPX 通过大幅提升 Token 生成速率,进一步扩展了 Vera Rubin 的推理性能,为上下文密集型工作负载提供卓越的用户体验,使智能体能够以极高的速度执行任务。
NVIDIA Groq 3 LPX 正在不断突破 AI 推理的性能边界。在 Artificial Analysis 基准测试中,在运行开源智能体模型 Gemma 4 31B 并处理 10 万 Token 的上下文时,Groq 3 LPX 创造了每秒 3,400 个输出 Token 的纪录——这是该模型迄今为止记录到的最快性能表现。
Groq 3 LPX 能将智能体编程等任务的完成时间从数小时缩短至数分钟。其在智能体及延迟敏感型工作负载上的响应速度比同类型平台快了 4 倍。
NVIDIA 创始人兼首席执行官黄仁勋表示:“推理是 AI 的增长引擎。NVIDIA Grace Blackwell 和 NVL72 以前所未有的性能和效率飞跃,彻底改变了大语言模型的推理方式。Vera Rubin 在此基础上进一步发展,通过专为智能体 AI 时代打造、针对工作负载优化的 AI 工厂配置、并借助 LPX 实现超快的 Token 生成速度,不断突破性能边界。这正在改变智能的生成方式,在全球 AI 算力需求加速飙升的当下,为 AI 吞吐量、效率和响应速度带来了又一次巨大的飞跃。”
以上为摘要内容,点击链接阅读完整内容:NVIDIA Groq 3 LPX 现已全面量产,以行业领先的速度赋能智能体 AI | NVIDIA 英伟达博客
热门跟贴