史上最强 AI 基建方案：英伟达发布 Vera Rubin 平台，单 Token 成本降至 1/10

英伟达在GTC 2026上发布Vera Rubin AI平台，面向智能体AI全生命周期，从大规模预训练到实时推理。核心包括NVL72机架（72块Rubin GPU + 36块Vera CPU，NVLink 6），公司宣称相比Blackwell平台训练MoE模型所需GPU降至1/4、每瓦推理吞吐量提升10倍、单Token成本降至1/10；Vera CPU机架集成256块液冷CPU，能效提高约2倍、速度提升50%；Groq 3 LPX推理机架（256个LPU）可使每兆瓦推理吞吐量最高提升35倍；BlueField-4 STX存储与DOCA Memos用于高效KV缓存管理，推理吞吐量最高提升5倍并降低能耗。报道以产品规格与性能宣称为主，侧重AI基础设施与企业部署。

3 月 17 日消息，今天（3 月 17 日）在美国加州圣何塞举行的 2026 年 GTC 大会上，英伟达为推动智能体 AI（Agentic AI）发展，发布 Vera Rubin AI 平台。

英伟达创始人兼首席执行官黄仁勋强调，Vera Rubin 是一次代际飞跃，标志着其史上最大规模基础设施建设的开端，全面覆盖从大规模预训练到实时智能体推理的 AI 全生命周期。

在核心算力层面，新一代 NVL72 机架实现了效率的突破性提升。该机架通过 NVLink 6 连接 72 块 Rubin GPU 与 36 块 Vera CPU。

与上一代 Blackwell 平台相比，该系统仅需四分之一的 GPU 即可完成混合专家大模型（MoE）训练，同时每瓦推理吞吐量提升高达 10 倍，单 Token 成本降至十分之一。

此外，专为验证 AI 模型结果设计的 Vera CPU 机架集成了 256 块液冷 CPU，其运行效率达到传统 CPU 的两倍，速度提升 50%。

为应对智能体系统低延迟和长上下文的需求，英伟达推出了 Groq 3 LPX 推理加速机架。该系统包含 256 个 LPU 处理器，与 Vera Rubin 结合后，每兆瓦推理吞吐量飙升至最高 35 倍。

在数据存储方面，全新 BlueField-4 STX 机架构建了 AI 原生存储基础架构。借助全新的 DOCA Memos 框架，该系统能够高效处理大型语言模型生成的海量键值（KV）缓存数据，在大幅降低能耗的同时，将推理吞吐量提升最高 5 倍，从而实现更快速的 AI 多轮交互。

英伟达 GTC 2026 大会专题