Groq 3 LPX 驅動低延遲 AI 推論

💡Rubin 平台全新機架加速器,用於超低延遲代理式 AI 推論(22字)
⚡ 30-Second TL;DR
有什麼變化
Vera Rubin NVL72 的機架規模加速器
為什麼重要
加速 AI 工廠中代理式 AI 部署,提升即時應用推論速度與擴展效率。
下一步行動
在 NVIDIA Developer Blog 探索 Groq 3 LPX 與 Vera Rubin 設定的整合文件。
關鍵要點
- •Vera Rubin NVL72 的機架規模加速器
- •針對低延遲大上下文推論最佳化
- •實現快速可預測權重生成
- •補充通用訓練工作負載
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 7 個來源。
🔑 增強重點摘要
- •NVIDIA Groq 3 LPX 每個機架包含 256 個互連的 LPU 加速器,每個加速器提供 500MB SRAM 和 150TB/s SRAM 頻寬,遠高於傳統 GPU 的 HBM 頻寬[1][2]
- •與 Vera Rubin NVL72 配對時,Groq 3 LPX 可為萬億參數模型實現 35 倍更高的推論吞吐量(每瓦特 300 個令牌/秒),相比前代 Blackwell NVL72 提升 35 倍[4]
- •LPX 機架採用融合記憶體架構,提供 128GB 片上 SRAM 用於低延遲處理,12TB DDR5 記憶體用於大型模型,以及 640TB/s 的晶片間直連頻寬[1][3]
- •Groq 3 LPU 針對代理式 AI 系統優化,這類系統消耗的令牌數量比傳統 AI 應用多達 15 倍,支援百萬令牌上下文窗口[1][3]
- •LPX 將於 2026 年下半年推出,採用液冷設計並基於 MGX 基礎設施,可與 Vera Rubin AI 工廠無縫集成,支援跨多個機架擴展至 1000+ LPU[3][4][5]
📊 競品分析▸ Show
| 特性 | NVIDIA Groq 3 LPX | Cerebras 晶圓級引擎 | 說明 |
|---|---|---|---|
| 記憶體架構 | 128GB 片上 SRAM(256 LPU) | 大量片上 SRAM | Groq 強調高頻寬;Cerebras 強調融合設計 |
| 推論延遲 | 低延遲確定性推論 | 低延遲推論 | 兩者都針對低延遲優化 |
| 應用場景 | 萬億參數模型、代理式 AI | 先進模型推論 | Cerebras 已獲 OpenAI 等大型客戶採用[2] |
| 與 GPU 整合 | 與 Vera Rubin GPU 共同設計 | 獨立晶圓級引擎 | Groq 作為 GPU 協處理器;Cerebras 為獨立解決方案 |
🛠️ 技術深入
• SRAM 設計:每個 Groq 3 LPU 包含 500MB SRAM(與 CPU/GPU 快取相同技術),提供 150TB/s 頻寬,遠超 Rubin GPU 的 HBM4(288GB、22TB/s)[1][2] • 機架規模配置:256 個 LPU 加速器、128GB 總 SRAM、40PB/s 總 SRAM 頻寬、12TB DDR5 記憶體[1][4] • 晶片間互連:640TB/s 直連晶片間頻寬用於低延遲通訊[1] • 推論優化:Groq 3 LPX 與 Vera Rubin 共同計算每層 AI 模型的每個輸出令牌,優化解碼性能[3][5] • 冷卻與基礎設施:完全液冷設計,基於 NVIDIA MGX 基礎設施,通過 Spectrum-X 乙太網互連與 Vera Rubin NVL72 連接[4][5] • 可擴展性:單個機架支援 256 LPU;數據中心可跨多個機架擴展至 1000+ LPU[4]
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
📎 來源 (7)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- NVIDIA — Lpx
- Tom's Hardware — Nvidia Groq 3 Lpu and Groq Lpx Racks Join Rubin Platform at Gtc Sram Packed Accelerator Boosts Every Layer of the AI Model on Every Token
- nvidianews.nvidia.com — Nvidia Vera Rubin Platform
- crn.com — Nvidia Puts Groq Lpu Vera Cpu and Bluefield 4 Dpu Into New Data Center Racks
- stocktitan.net — Nvidia Vera Rubin Opens Agentic AI J6xtv7x20jq2
- open.substack.com — Gtc 2026 Outlook How Nvidia Is Redefining
- groq.com
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: NVIDIA Developer Blog ↗
每週 AI 簡報
每週一封,可隨時退訂。