🟩最新收集於 31m

Vera Rubin 提升代理式 AI 能源效率

Vera Rubin 提升代理式 AI 能源效率
PostLinkedIn
🟩閱讀原文: NVIDIA Developer Blog
#agentic-ai#inference-efficiency#performance-per-wattnvidia-vera-rubin-and-blackwellnvidiavera-rubinblackwellopenrouter

💡代理工作負載正放大上下文與 token 成本;NVIDIA 說明每瓦效能為何變得關鍵。

⚡ 30-Second TL;DR

有什麼變化

代理式工作流程將推論從單輪問答擴展至多步驟執行。

為什麼重要

推論成本與電力規劃將越來越取決於工作流程長度與上下文增長,而不只是模型大小。因此,能源效率將成為生產級代理系統的核心部署指標。

下一步行動

在評估 Vera Rubin 所需容量前,先於現有 Blackwell 部署上測量每個代理任務完成所需的 token、延遲與能源。

誰應關注:Developers & AI Engineers

關鍵要點

  • 代理式工作流程將推論從單輪問答擴展至多步驟執行。
  • 文章引用 OpenRouter 資料指出,在 100 兆 token 的使用量中,平均提示 token 數約成長四倍。
  • Vera Rubin 與 Blackwell 被定位為提升代理式推論每瓦效能的平台。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 18 個來源。

🔑 增強重點摘要

  • Vera Rubin NVL72 系統在代理式 AI 工作負載下,每兆瓦吞吐量較 GB300 NVL72 提升高達 30 倍。
  • 代理式 AI 任務因涉及持續推理、工具呼叫與子代理生成,其資源需求約為標準對話請求的 15 倍。
  • Vera CPU 是首款專為 AI 代理設計的處理器,內建 88 個 Olympus 核心與 LPDDR5X 記憶體,專責編排與程式碼執行。
  • Vera Rubin 平台採用全液冷架構(支援 45°C 水冷)及模組化無纜線設計,將運算托盤組裝時間從兩小時縮短至五分鐘。
  • SpaceXAI 已採用 Vera Rubin 平台擴展 Grok AI 基礎設施,並計畫將此技術應用於首代 Starmind AI 衛星。
📊 競品分析▸ Show
特性/平台NVIDIA Vera Rubin NVL72AMD Helios (預計)
核心架構72 Rubin GPU + 36 Vera CPU尚未公開詳細規格
互連技術第六代 NVLink (260TB/s 銅背板)預計採用 Infinity Fabric
散熱設計100% 全液冷預計支援高密度液冷

🛠️ 技術深入

  • 系統整合:單一機櫃規模超級電腦,包含 72 個 Rubin GPU 與 36 個 Vera CPU。
  • 互連架構:採用第六代 NVLink 技術,透過 260TB/s 的銅背板實現統一記憶體空間。
  • 推論加速:推出 Groq 3 LPX 加速器,創下每秒 3,400 個輸出 token 的基準測試紀錄。
  • 記憶體配置:Vera CPU 搭載 LPDDR5X 記憶體,專為處理代理式 AI 的複雜邏輯與資料處理優化。

🔮 前景展望AI analysis grounded in cited sources

代理式 AI 將成為資料中心運算的主流負載
代理式任務對 token 消耗與推理步驟的指數級需求,迫使硬體架構從單純的 GPU 運算轉向 CPU-GPU 協同的機櫃級設計。
液冷技術將成為高階 AI 伺服器的標準配置
為應對 Vera Rubin 等高密度運算平台的熱設計功耗,傳統氣冷已無法滿足每瓦效能需求。

時間線

2026-02
NVIDIA 正式發表 Vera Rubin 架構與 Vera CPU
2026-05
Vera Rubin 平台進入全面量產階段
2026-07
Microsoft 完成 Vera Rubin 系統在資料中心的初步部署與驗證
2026-08
SpaceXAI 宣布將 Vera Rubin 技術整合至 Starmind AI 衛星計畫
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: NVIDIA Developer Blog

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。

Vera Rubin Raises Agentic AI Efficiency | NVIDIA Developer Blog | SetupAI | SetupAI