英伟达发布了Groq 3 LPU芯片,能够将AI模型推理加速到每秒数千个令牌的水平。
Nvidia公布Vera Rubin平台的新功能
在今年的GTC会议上,Nvidia首席执行官Jen-Hsun Huang宣布扩展Vera Rubin平台。新功能基于从Groq公司获得的知识产权,并且Rubin中加入了*Groq 3 LPU*芯片——一种面向高速度、低延迟令牌输出的推理加速器。
Vera Rubin已有的内容
该平台由六个关键组件组成,Nvidia将其集成到机架系统,并扩展至大型AI工厂:
| 组件 | 描述 |
|---|---|
| GPU Rubin | 配备288 GB HBM4的视频卡 |
| CPU Vera | 中央处理器 |
| NVLink 6 | 系统内缩放系统 |
| ConnectX‑9 | 智能网络适配器 |
| BlueField‑4 | 数据处理器 |
| Spectrum‑X | 集成光学的跨系统缩放交换机 |
Groq 3 LPU现已作为新的构建块加入,将在部署大型系统时使用。
为什么Groq 3 LPU脱颖而出
主要区别在于内存架构。大多数加速器使用HBM作为工作内存,而每个Groq 3 LPU包含500 MB SRAM。对比如下:
| 参数 | GPU Rubin (HBM4) | Groq 3 LPU (SRAM) |
|---|---|---|
| 容量 | 288 GB | 0.5 GB |
| 带宽 | ~22 TB/s | 150 TB/s |
对于对带宽敏感的推理任务,SRAM优势显而易见。这正是Nvidia将Groq 3纳入Rubin的原因——提升令牌输出速度。
Groq 3 LPX机架
该机架包含256颗Groq 3 LPU芯片,提供:
- 128 GB SRAM
- 40 PB/s 总带宽
- 640 TB/s 系统内接口
超大规模解决方案副总裁Ian Buck将此机架称为Rubin的协处理器,强调其在每个模型层和令牌解码性能提升中的作用。
对多代理系统的影响
Buck指出,Groq 3 LPX将成为未来AI市场——多代理系统的关键组件。当代理直接交换数据而非通过聊天机器人时,对响应速度的要求从100 tokens/s提升至1500+ tokens/s甚至更高。
竞争者与前景
文中提到竞争对手Cerebras,使用Wafer‑Scale Engine(WSE)配备巨大的SRAM以实现低延迟推理。OpenAI已在其尖端模型中采用Cerebras,以获得有利的延迟表现。
Buck还指出,Groq 3 LPU的出现可能降低对Rubin CPX加速器的依赖。目前Nvidia正专注于将Groq 3 LPX机架与平台集成,两颗芯片旨在增强推理性能,而无需大量GDDR7内存。
结论:
新型Groq 3 LPU芯片及其LPX机架强化了Vera Rubin在低延迟推理领域的能力,为更快速的多代理AI系统铺平道路,并与Cerebras等玩家展开竞争。
评论 (0)
分享你的想法——请保持礼貌并围绕主题。
登录后发表评论