🟩NVIDIA Developer Blog•最新收集於 31m
Groq 3 LPX 帶來高速長上下文推論

#long-context#latencynvidia-groq-3-lpxnvidiagroq-3-lpxvera-rubinnvl72
💡長上下文常會拖慢回應;Groq 3 LPX 瞄準 Vera Rubin 上的快速互動式推論。
⚡ 30-Second TL;DR
有什麼變化
Groq 3 LPX 專為互動式 AI 推論而設計。
為什麼重要
較低的互動延遲可改善使用者代理、程式碼助理及其他依賴快速多輪回應的應用程式。該平台也可能讓基礎設施團隊有更多選項,將高吞吐推論與對延遲敏感的推論分開處理。
下一步行動
在 Groq 3 LPX 搭配 Vera Rubin NVL72 上執行最長上下文的互動式推論工作負載,並比較首 token 時間與端到端延遲。
誰應關注:Developers & AI Engineers
關鍵要點
- •Groq 3 LPX 專為互動式 AI 推論而設計。
- •該加速器將與 Vera Rubin NVL72 搭配,用於長上下文工作負載。
- •NVIDIA 將此組合定位為支援廣泛的開放與封閉模型。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 8 個來源。
🔑 增強重點摘要
- •Groq 3 LPX 已於 2026 年 8 月的 Hot Chips 大會正式進入全面量產階段。
- •在 Artificial Analysis 基準測試中,該加速器運行 Gemma 4 31B 模型並處理 10 萬 token 上下文時,創下了每秒 3,400 token 的輸出紀錄。
- •該硬體專為代理式 AI(Agentic AI)設計,旨在滿足多步驟推理過程中對即時回應的極致需求。
- •NVIDIA 透過與 Groq, Inc. 簽署非獨家授權協議,將 LPU 技術整合至 Vera Rubin 架構中。
- •Nebius 已成為首家部署 Groq 3 LPX 的 AI 雲端供應商,並將其納入「Nebius Token Factory」平台。
📊 競品分析▸ Show
| 特性 | Groq 3 LPX | 傳統 GPU 推論平台 | 專用 ASIC 加速器 |
|---|---|---|---|
| 輸出速度 | 3,400 tokens/s | 較低 | 中等 |
| 核心架構 | LPU (語言處理單元) | CUDA GPU | 定製 ASIC |
| 代理 AI 優化 | 極高 | 中等 | 高 |
| 價格 | 依據 Vera Rubin 系統整合定價 | 隨市場波動 | 較高初期成本 |
🛠️ 技術深入
- 採用 LPU (Language Processing Unit) 架構,專為序列處理與低延遲推論優化。
- 支援機架級部署,單一機架可串聯高達 256 個 LPU 加速器。
- 透過高頻寬晶片互連技術(High-bandwidth chip interconnects)實現節點間通訊。
- 深度整合 Vera Rubin AI 工廠架構,包含 BlueField-4 DPU 與 Spectrum-6 乙太網路支援。
🔮 前景展望AI analysis grounded in cited sources
代理式 AI 的回應延遲將降低至毫秒級。
Groq 3 LPX 提供的 3,400 tokens/s 吞吐量足以支撐複雜代理系統在即時互動中的推理需求。
NVIDIA 將透過 Vera Rubin 平台壟斷高階推論市場。
將 LPU 技術納入 Vera Rubin 生態系後,NVIDIA 成功補足了其在超低延遲推論領域的技術缺口。
⏳ 時間線
2025-12
NVIDIA 與 Groq, Inc. 簽署 LPU 技術非獨家授權協議。
2026-08
Groq 完成 3.5 億美元 A 輪融資,NVIDIA 參與投資。
2026-08
於 Hot Chips 2026 大會正式發表並宣布 Groq 3 LPX 進入量產。
📎 來源 (8)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: NVIDIA Developer Blog ↗
每週 AI 簡報
每週一封,可隨時退訂。



