Nvidia表示,由于Blackwell架构的改进,神经网络推理成本已降低到十倍水平,他们将成功归因不仅仅是硬件。

Nvidia表示,由于Blackwell架构的改进,神经网络推理成本已降低到十倍水平,他们将成功归因不仅仅是硬件。

31 hardware

在 Nvidia Blackwell 架构上降低推理成本

Nvidia Blackwell 新加速器可将已训练 AI 系统的运行成本降低 4–10 倍。这些数据来自 Nvidia 自己发布。然而,没有配套的软件和基础设施改进,这种提升是难以实现的。

如何实现显著成本下降
指标 | 帮助因素
---|---
架构 | Blackwell 加速器
模型 | 开源代码(MoE、NVFP4 等)
平台 | Baseten、DeepInfra、Fireworks AI、Together AI
软件栈 | 针对低精度的优化管道

* 在 Blackwell 上的迁移使效率比上一代加速器翻倍。
* 使用低精度格式(如 NVFP4)进一步降低成本。

实际案例
| 公司 | 任务 | 结果 |
|---|---|---|
| Sully.ai | 医疗,Baseten 开源模型 | 推理成本节省 90 %(降至 10 倍),响应时间缩短 65 %。代码和医疗记录自动化节省 3000 万分钟工作。 |
| Latitude (AI Dungeon) | 游戏,DeepInfra MoE 模型 | 1 百万 token 的推理费用从 $0.20 降至 $0.05:先是 MoE(降至 $0.10),随后 NVFP4。 |
| Sentient Foundation | 代理聊天,Fireworks AI | 成本效益提升 25–50 %。平台每周处理 560 万请求,无延迟增加。 |
| Decagon | 客服语音支持,Together AI | 请求成本降低六倍,得益于 Blackwell 上的多模型堆栈。即使在数千 token 的情况下,响应时间也低于 400 毫秒。 |

工作负载特性的重要性
* 推理型模型生成更多 token,需要更强大的加速器。
* 平台采用 *分离式服务*:单独处理预热上下文和 token 生成,以高效处理长序列。
* 在大规模生成时可实现最高 10 倍效率提升;在小规模时仅能达到 4 倍。

Blackwell 的替代方案
将工作负载迁移到 AMD Instinct MI300、Google TPU、Groq 或 Cerebras 加速器也能降低成本。关键是为特定工作负载挑选硬件、软件和模型的组合,而不是单纯使用 Blackwell。

结论:

推理成本下降需要综合方法:硬件能力(Blackwell)、开源模型、优化栈以及任务分配策略。这使企业在医疗、游戏、代理 AI 和语音支持等领域实现十倍以上节省,同时不牺牲质量或速度。

评论 (0)

分享你的想法——请保持礼貌并围绕主题。

暂无评论。留下评论,分享你的观点!

要发表评论,请先登录。

登录后发表评论