🐯較早收集於 26m

NVIDIA Rubin+Groq 衝刺萬億美元 GPU

NVIDIA Rubin+Groq 衝刺萬億美元 GPU
PostLinkedIn
🐯閱讀原文: 虎嗅

💡Rubin+Groq 提供 350 倍 token 產出—擴展 agentic AI 推理的關鍵。(38字)

⚡ 30-Second TL;DR

有什麼變化

Vera Rubin GPU:台積電 3nm、336B 晶體管、288GB HBM4、50 PFLOPs NVFP4 推理(Blackwell 的 5 倍)。

為什麼重要

Rubin+Groq 組合重新定義 AI 推理擴展,實現低延遲/成本的高階 agentic 模型,對自訂 ASIC 競爭者構成壓力。企業可依互動速度分層服務,捕捉複雜推理的高定價。

下一步行動

測試 NVIDIA Dynamo 進行解耦推理,提升 LLM token 生成速度。

誰應關注:Enterprise & Security Teams

關鍵要點

  • Vera Rubin GPU:台積電 3nm、336B 晶體管、288GB HBM4、50 PFLOPs NVFP4 推理(Blackwell 的 5 倍)。
  • Groq 3 LPU 陣列:1,200TB/s SRAM 頻寬(Rubin 的 55 倍),透過 Dynamo 軟體實現低延遲 decode。
  • NVL72 系統:100% 液冷、3.6TB/s NVLink,Groq 整合解鎖 3000 億美元市場。
  • 2027 年 GPU 營收預測達萬億美元,來自推理效能階層(Free 至 Ultra 定價)。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

🔑 增強重點摘要

  • NVIDIA 於 2025 年 12 月與 Groq 簽署授權協議,初期 LPX 機架整合 64 個 LPU(封裝為 32 個 RealScale ASIC 晶片),每個 LPU 包含數百 MB 片上 SRAM,可在毫秒級延遲內生成小批次 token,Groq 演示顯示 10,000 個「思考 token」可在約 2 秒內生成[5]
  • Vera Rubin NVL144 機架級系統達成 3.6 exaflops FP4 推理和 1.2 exaflops FP8 訓練性能,相比 GB300 NVL72 提升 3.3 倍,搭載 13TBps HBM4、260TBps NVLink 6 和 28.8TBps CX9 互連[2]
  • Rubin 架構將 Tensor Core 寬度在 FP4/FP8 上翻倍至 32,768 FP4 MACs/時鐘,時脈速度提升 25% 至 2.38GHz,搭配第三代 Transformer Engine 支援硬體加速自適應壓縮,可達 50 petaflops NVFP4 推理性能[1][4]
  • Vera CPU 採用 88 個自訂 Olympus ARM 核心、176 個處理執行緒、1.8TBps NVLink-C2C 連接,L3 快取增加 40% 至 162MB,記憶體匯流排寬度翻倍至 1024 位元、速度提升至 9600MT/s,最大容量三倍增至 1.5TB(8 個 SOCAMM 模組)[1]
  • LPX 機架採用液冷冷板技術(微通道冷板 MCCP),應對 256 個 LPU 同時運作產生的數十千瓦功耗,該冷卻創新與 NVL72 VR200 平台相同[5]

🛠️ 技術深入

Vera Rubin GPU 架構創新

  • SM 數量從 160 增至 224
  • Tensor Core 寬度在 FP4/FP8 上翻倍至 32,768 FP4 MACs/時鐘
  • 時脈速度提升 25%,從 1.90GHz 至 2.38GHz
  • FP4/FP8 FLOPS 相比 GB200 增加約 3.5 倍,FP16 FLOPS 增加 1.6 倍
  • BF16 和 TF32 性能擴展僅 1.6 倍(與 Blackwell 相同),反映 NVIDIA 預期工作負載將轉向 FP8/FP4[1]

記憶體系統升級

  • HBM 容量保持 288GB(與 B300 相同),但頻寬從 8TB/s 提升至 13TB/s
  • 從 HBM3/HBM3e 轉換至 HBM4,Rubin Ultra 採用 HBM4e[3]
  • 記憶體匯流排寬度翻倍至 1024 位元,速度提升至 9600MT/s,實現 2.5 倍頻寬提升[1]

互連與網路架構

  • NVLink 6 吞吐量翻倍至 260TB/s(NVL72 機架級)
  • CX9 機架間互連達 28.8TB/s(相比 B300 和 CX8 翻倍)[2][3]
  • Vera CPU 透過 1.8TBps NVLink-C2C 與 Rubin GPU 連接[2]

Groq LPU 整合特性

  • 初期 LPX 機架配置 64 個 LPU(32 個 RealScale ASIC 晶片)
  • 每個 LPU 包含數百 MB 片上 SRAM,採用確定性執行優化序列推理
  • 編譯器在編譯時排程所有計算和資料移動,消除執行時頻寬競爭[5]

第三代 Transformer Engine

  • 支援硬體加速自適應壓縮
  • 取代先前世代的 2:4 結構化稀疏性
  • 可達 50 petaflops NVFP4 推理性能[1][4]

🔮 前景展望AI analysis grounded in cited sources

LPU 與 GPU 混合架構將成為推理基礎設施標準
Groq LPU 的毫秒級延遲和 SRAM 頻寬優勢(1,200TB/s)補足 GPU 在高速 token 生成的限制,預示推理工作負載將分層至專用加速器。
FP4/FP8 低精度計算將主導訓練與推理工作負載
Rubin 在 FP4/FP8 上的 3.5 倍性能提升,而 BF16/TF32 僅 1.6 倍,反映 NVIDIA 預期產業將全面轉向低精度,推動模型量化標準化。
1GW 資料中心的 token 產出能力將成為競爭指標
Vera Rubin 與 Groq LPU 整合承諾 350 倍 token 產出提升,將使單位功耗的推理成本成為 GPU 採購決策的核心指標。

時間線

2025-12
NVIDIA 與 Groq 簽署授權協議,啟動 LPU 整合計畫
2026-03
GTC 2026 大會上正式發佈 Vera Rubin 超晶片與 LPX 機架配置
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。