英伟达发布了Groq 3 LPU芯片,能够将AI模型推理加速到每秒数千个令牌的水平。

英伟达发布了Groq 3 LPU芯片,能够将AI模型推理加速到每秒数千个令牌的水平。

23 software

Nvidia公布Vera Rubin平台的新功能

在今年的GTC会议上,Nvidia首席执行官Jen-Hsun Huang宣布扩展Vera Rubin平台。新功能基于从Groq公司获得的知识产权,并且Rubin中加入了*Groq 3 LPU*芯片——一种面向高速度、低延迟令牌输出的推理加速器。

Vera Rubin已有的内容
该平台由六个关键组件组成,Nvidia将其集成到机架系统,并扩展至大型AI工厂:

组件描述
GPU Rubin配备288 GB HBM4的视频卡
CPU Vera中央处理器
NVLink 6系统内缩放系统
ConnectX‑9智能网络适配器
BlueField‑4数据处理器
Spectrum‑X集成光学的跨系统缩放交换机

Groq 3 LPU现已作为新的构建块加入,将在部署大型系统时使用。

为什么Groq 3 LPU脱颖而出
主要区别在于内存架构。大多数加速器使用HBM作为工作内存,而每个Groq 3 LPU包含500 MB SRAM。对比如下:

参数GPU Rubin (HBM4)Groq 3 LPU (SRAM)
容量288 GB0.5 GB
带宽~22 TB/s150 TB/s

对于对带宽敏感的推理任务,SRAM优势显而易见。这正是Nvidia将Groq 3纳入Rubin的原因——提升令牌输出速度。

Groq 3 LPX机架
该机架包含256颗Groq 3 LPU芯片,提供:

- 128 GB SRAM
- 40 PB/s 总带宽
- 640 TB/s 系统内接口

超大规模解决方案副总裁Ian Buck将此机架称为Rubin的协处理器,强调其在每个模型层和令牌解码性能提升中的作用。

对多代理系统的影响
Buck指出,Groq 3 LPX将成为未来AI市场——多代理系统的关键组件。当代理直接交换数据而非通过聊天机器人时,对响应速度的要求从100 tokens/s提升至1500+ tokens/s甚至更高。

竞争者与前景
文中提到竞争对手Cerebras,使用Wafer‑Scale Engine(WSE)配备巨大的SRAM以实现低延迟推理。OpenAI已在其尖端模型中采用Cerebras,以获得有利的延迟表现。

Buck还指出,Groq 3 LPU的出现可能降低对Rubin CPX加速器的依赖。目前Nvidia正专注于将Groq 3 LPX机架与平台集成,两颗芯片旨在增强推理性能,而无需大量GDDR7内存。

结论:

新型Groq 3 LPU芯片及其LPX机架强化了Vera Rubin在低延迟推理领域的能力,为更快速的多代理AI系统铺平道路,并与Cerebras等玩家展开竞争。

评论 (0)

分享你的想法——请保持礼貌并围绕主题。

暂无评论。留下评论,分享你的观点!

要发表评论,请先登录。

登录后发表评论