🟩較早收集於 5m

Groq 3 LPX 驅動低延遲 AI 推論

Groq 3 LPX 驅動低延遲 AI 推論
PostLinkedIn
🟩閱讀原文: NVIDIA Developer Blog
#ai-factory#low-latencygroq-3-lpxnvidiagroq-3-lpxvera-rubin

💡Rubin 平台全新機架加速器,用於超低延遲代理式 AI 推論(22字)

⚡ 30-Second TL;DR

有什麼變化

Vera Rubin NVL72 的機架規模加速器

為什麼重要

加速 AI 工廠中代理式 AI 部署,提升即時應用推論速度與擴展效率。

下一步行動

在 NVIDIA Developer Blog 探索 Groq 3 LPX 與 Vera Rubin 設定的整合文件。

誰應關注:Enterprise & Security Teams

關鍵要點

  • Vera Rubin NVL72 的機架規模加速器
  • 針對低延遲大上下文推論最佳化
  • 實現快速可預測權重生成
  • 補充通用訓練工作負載

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • NVIDIA Groq 3 LPX 每個機架包含 256 個互連的 LPU 加速器,每個加速器提供 500MB SRAM 和 150TB/s SRAM 頻寬,遠高於傳統 GPU 的 HBM 頻寬[1][2]
  • 與 Vera Rubin NVL72 配對時,Groq 3 LPX 可為萬億參數模型實現 35 倍更高的推論吞吐量(每瓦特 300 個令牌/秒),相比前代 Blackwell NVL72 提升 35 倍[4]
  • LPX 機架採用融合記憶體架構,提供 128GB 片上 SRAM 用於低延遲處理,12TB DDR5 記憶體用於大型模型,以及 640TB/s 的晶片間直連頻寬[1][3]
  • Groq 3 LPU 針對代理式 AI 系統優化,這類系統消耗的令牌數量比傳統 AI 應用多達 15 倍,支援百萬令牌上下文窗口[1][3]
  • LPX 將於 2026 年下半年推出,採用液冷設計並基於 MGX 基礎設施,可與 Vera Rubin AI 工廠無縫集成,支援跨多個機架擴展至 1000+ LPU[3][4][5]
📊 競品分析▸ Show
特性NVIDIA Groq 3 LPXCerebras 晶圓級引擎說明
記憶體架構128GB 片上 SRAM(256 LPU)大量片上 SRAMGroq 強調高頻寬;Cerebras 強調融合設計
推論延遲低延遲確定性推論低延遲推論兩者都針對低延遲優化
應用場景萬億參數模型、代理式 AI先進模型推論Cerebras 已獲 OpenAI 等大型客戶採用[2]
與 GPU 整合與 Vera Rubin GPU 共同設計獨立晶圓級引擎Groq 作為 GPU 協處理器;Cerebras 為獨立解決方案

🛠️ 技術深入

SRAM 設計:每個 Groq 3 LPU 包含 500MB SRAM(與 CPU/GPU 快取相同技術),提供 150TB/s 頻寬,遠超 Rubin GPU 的 HBM4(288GB、22TB/s)[1][2]機架規模配置:256 個 LPU 加速器、128GB 總 SRAM、40PB/s 總 SRAM 頻寬、12TB DDR5 記憶體[1][4]晶片間互連:640TB/s 直連晶片間頻寬用於低延遲通訊[1]推論優化:Groq 3 LPX 與 Vera Rubin 共同計算每層 AI 模型的每個輸出令牌,優化解碼性能[3][5]冷卻與基礎設施:完全液冷設計,基於 NVIDIA MGX 基礎設施,通過 Spectrum-X 乙太網互連與 Vera Rubin NVL72 連接[4][5]可擴展性:單個機架支援 256 LPU;數據中心可跨多個機架擴展至 1000+ LPU[4]

🔮 前景展望AI analysis grounded in cited sources

Groq 3 LPX 可能取代 Rubin CPX 推論加速器
NVIDIA 高管暗示公司目前專注於整合 Groq 3 LPX 與 Rubin,因為兩者提供相似的推論增強,但 LPU 不需要 CPX 所需的大量 GDDR7 記憶體[2]
萬億參數模型推論的經濟效益將大幅提升
Vera Rubin NVL72 與 Groq 3 LPX 結合可為萬億參數模型提供 10 倍更多收入機會,每百萬令牌可產生 45 美元收益[4]
代理式 AI 系統將成為主流推論工作負載
代理式系統消耗的令牌數量比傳統 AI 應用多 15 倍,推動對低延遲、大上下文推論的需求,LPX 專為此優化[1][3]

時間線

2016
Groq 公司創立並推出首款 LPU(語言處理單元),首個專為推論設計的晶片[7]
2025
NVIDIA 宣布收購 Groq 技術,將 LPU 整合至 Vera Rubin 平台[3][5]
2026-03
NVIDIA 在 GTC 2026 大會上正式發布 Groq 3 LPX 機架和 Vera Rubin 平台,展示 35 倍推論吞吐量提升[3][4][5]
2026-06
Groq 3 LPX 預計在下半年推出,與 Vera Rubin AI 工廠集成[3][5]
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: NVIDIA Developer Blog

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。