🐯虎嗅•較早收集於 26m
NVIDIA Rubin+Groq 衝刺萬億美元 GPU

💡Rubin+Groq 提供 350 倍 token 產出—擴展 agentic AI 推理的關鍵。(38字)
⚡ 30-Second TL;DR
有什麼變化
Vera Rubin GPU:台積電 3nm、336B 晶體管、288GB HBM4、50 PFLOPs NVFP4 推理(Blackwell 的 5 倍)。
為什麼重要
Rubin+Groq 組合重新定義 AI 推理擴展,實現低延遲/成本的高階 agentic 模型,對自訂 ASIC 競爭者構成壓力。企業可依互動速度分層服務,捕捉複雜推理的高定價。
下一步行動
測試 NVIDIA Dynamo 進行解耦推理,提升 LLM token 生成速度。
誰應關注:Enterprise & Security Teams
關鍵要點
- •Vera Rubin GPU:台積電 3nm、336B 晶體管、288GB HBM4、50 PFLOPs NVFP4 推理(Blackwell 的 5 倍)。
- •Groq 3 LPU 陣列:1,200TB/s SRAM 頻寬(Rubin 的 55 倍),透過 Dynamo 軟體實現低延遲 decode。
- •NVL72 系統:100% 液冷、3.6TB/s NVLink,Groq 整合解鎖 3000 億美元市場。
- •2027 年 GPU 營收預測達萬億美元,來自推理效能階層(Free 至 Ultra 定價)。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 6 個來源。
🔑 增強重點摘要
- •NVIDIA 於 2025 年 12 月與 Groq 簽署授權協議,初期 LPX 機架整合 64 個 LPU(封裝為 32 個 RealScale ASIC 晶片),每個 LPU 包含數百 MB 片上 SRAM,可在毫秒級延遲內生成小批次 token,Groq 演示顯示 10,000 個「思考 token」可在約 2 秒內生成[5]。
- •Vera Rubin NVL144 機架級系統達成 3.6 exaflops FP4 推理和 1.2 exaflops FP8 訓練性能,相比 GB300 NVL72 提升 3.3 倍,搭載 13TBps HBM4、260TBps NVLink 6 和 28.8TBps CX9 互連[2]。
- •Rubin 架構將 Tensor Core 寬度在 FP4/FP8 上翻倍至 32,768 FP4 MACs/時鐘,時脈速度提升 25% 至 2.38GHz,搭配第三代 Transformer Engine 支援硬體加速自適應壓縮,可達 50 petaflops NVFP4 推理性能[1][4]。
- •Vera CPU 採用 88 個自訂 Olympus ARM 核心、176 個處理執行緒、1.8TBps NVLink-C2C 連接,L3 快取增加 40% 至 162MB,記憶體匯流排寬度翻倍至 1024 位元、速度提升至 9600MT/s,最大容量三倍增至 1.5TB(8 個 SOCAMM 模組)[1]。
- •LPX 機架採用液冷冷板技術(微通道冷板 MCCP),應對 256 個 LPU 同時運作產生的數十千瓦功耗,該冷卻創新與 NVL72 VR200 平台相同[5]。
🛠️ 技術深入
Vera Rubin GPU 架構創新
- SM 數量從 160 增至 224
- Tensor Core 寬度在 FP4/FP8 上翻倍至 32,768 FP4 MACs/時鐘
- 時脈速度提升 25%,從 1.90GHz 至 2.38GHz
- FP4/FP8 FLOPS 相比 GB200 增加約 3.5 倍,FP16 FLOPS 增加 1.6 倍
- BF16 和 TF32 性能擴展僅 1.6 倍(與 Blackwell 相同),反映 NVIDIA 預期工作負載將轉向 FP8/FP4[1]
記憶體系統升級
- HBM 容量保持 288GB(與 B300 相同),但頻寬從 8TB/s 提升至 13TB/s
- 從 HBM3/HBM3e 轉換至 HBM4,Rubin Ultra 採用 HBM4e[3]
- 記憶體匯流排寬度翻倍至 1024 位元,速度提升至 9600MT/s,實現 2.5 倍頻寬提升[1]
互連與網路架構
- NVLink 6 吞吐量翻倍至 260TB/s(NVL72 機架級)
- CX9 機架間互連達 28.8TB/s(相比 B300 和 CX8 翻倍)[2][3]
- Vera CPU 透過 1.8TBps NVLink-C2C 與 Rubin GPU 連接[2]
Groq LPU 整合特性
- 初期 LPX 機架配置 64 個 LPU(32 個 RealScale ASIC 晶片)
- 每個 LPU 包含數百 MB 片上 SRAM,採用確定性執行優化序列推理
- 編譯器在編譯時排程所有計算和資料移動,消除執行時頻寬競爭[5]
第三代 Transformer Engine
🔮 前景展望AI analysis grounded in cited sources
LPU 與 GPU 混合架構將成為推理基礎設施標準
Groq LPU 的毫秒級延遲和 SRAM 頻寬優勢(1,200TB/s)補足 GPU 在高速 token 生成的限制,預示推理工作負載將分層至專用加速器。
FP4/FP8 低精度計算將主導訓練與推理工作負載
Rubin 在 FP4/FP8 上的 3.5 倍性能提升,而 BF16/TF32 僅 1.6 倍,反映 NVIDIA 預期產業將全面轉向低精度,推動模型量化標準化。
1GW 資料中心的 token 產出能力將成為競爭指標
Vera Rubin 與 Groq LPU 整合承諾 350 倍 token 產出提升,將使單位功耗的推理成本成為 GPU 採購決策的核心指標。
⏳ 時間線
2025-12
NVIDIA 與 Groq 簽署授權協議,啟動 LPU 整合計畫
2026-03
GTC 2026 大會上正式發佈 Vera Rubin 超晶片與 LPX 機架配置
📎 來源 (6)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- newsletter.semianalysis.com — Vera Rubin Extreme Co Design an Evolution
- datacenterdynamics.com — Nvidia Announces Vera Rubin Superchip for Late 2026
- Tom's Hardware — Nvidia Announces Rubin Gpus in 2026 Rubin Ultra in 2027 Feynam After
- nvidianews.nvidia.com — Rubin Platform AI Supercomputer
- tspasemiconductor.substack.com — Gtc 2026 Outlook How Nvidia Is Redefining
- ainvest.com — Nvidia Gtc Coming Rubin Groq AI Demand Hype Send Nvda Soaring 2603
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅 ↗
每週 AI 簡報
每週一封,可隨時退訂。

