📱較早收集於 46m

英偉達或推出新推理晶片

英偉達或推出新推理晶片
PostLinkedIn
📱閱讀原文: Ifanr (爱范儿)

💡英偉達推理晶片傳聞預示更廉價/更快的AI服務硬體(58字)

⚡ 30-Second TL;DR

有什麼變化

英偉達或推出專用推理晶片

為什麼重要

英偉達推理晶片可加速AI模型部署效率,應對日益增長的推理需求。李斌獲獎凸顯蔚來在電動車領域的AI策略進展。

下一步行動

追蹤英偉達GTC公告,獲取推理晶片規格以對比現有GPU基準。

誰應關注:Developers & AI Engineers

關鍵要點

  • 英偉達或推出專用推理晶片
  • 蔚來李斌獲中國最高人工智能獎
  • 周意保展示Find N6真機,折痕控制「久用平整」

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

🔑 增強重點摘要

  • NVIDIA Rubin平台包含六款晶片,包括Rubin GPU、Vera CPU、NVLink 6交換器、ConnectX-9 SuperNIC、BlueField-4 DPU及Spectrum-6乙太網路交換器,透過極端共同設計實現推理成本降低10倍。[1][3]
  • Rubin GPU採用第三代Transformer Engine,支持NVFP4及NVFP8低精度格式,每顆GPU提供高達50 PFLOPS NVFP4推理運算性能,並具備硬體加速自適應壓縮。[1][3]
  • Rubin已進入全面生產階段,合作夥伴將於2026年下半年推出相關產品,Microsoft的Fairwater AI超級工廠將部署數十萬顆Vera Rubin NVL72系統。[3]
  • NVIDIA與Groq簽署授權協議,將Groq低延遲推理處理器整合至AI工廠架構,支持更廣泛的即時推理應用。[2]
📊 競品分析▸ Show
特徵/廠商NVIDIA RubinAMDIntelGoogle
推理專用優化Rubin GPU 50 PFLOPS NVFP4,10x低於Blackwell token成本收購Untether AI及MK1,提升GPU推理軟體Gaudi加速器及Xeon AMX,強調CPU推理TPU最新晶片針對推理競爭
基準性能MoE訓練需4x少GPU,推理10x性能/瓦特優於Blackwell高速度企業推理優化多種推理選項嚴重推理競爭者
定價未公布,強調TCO降低未公布未公布未公布

🛠️ 技術深入

  • Rubin GPU:第三代Transformer Engine,支持NVFP4/NVFP8量化,每GPU 50 PFLOPS推理、35 PFLOPS訓練,具硬體自適應壓縮。[1][3]
  • Vera CPU:內部設計,優化AI工廠工作負載,擴展LPDDR5X SOCAMM容量用於模型權重及KV快取,減少PCIe/CXL依賴。[1]
  • NVLink 6:雙向SerDes帶迴音消除,網路內計算支援all-reduce及MoE路由。[1]
  • Inference Context Memory Storage:BlueField-4處理器加速代理AI推理,KV快取層提升5x tokens/秒及TCO效率。[3][4]
  • Spectrum-X Ethernet:光子學共同封裝,提升百萬GPU規模環境。[4][6]

🔮 前景展望AI analysis grounded in cited sources

Rubin平台將使MoE模型推理token成本降至Blackwell的1/10
透過極端共同設計及NVFP4計算,Rubin實現10x推理性能提升及4x更少GPU訓練需求。[1][3]
NVIDIA將主導企業級推理,從試點轉向生產部署
Rubin針對超大上下文及預填充階段優化,結合Groq整合擴展即時推理市場份額。[2]
機密計算將保護最大專有模型訓練與推理
Vera Rubin NVL72首創跨CPU、GPU及NVLink領域機密計算,確保資料安全。[3]

時間線

2024-01
英偉達高管表示資料中心收入40%來自推理,認可專用推理處理器需求
2025-09
英偉達宣布Rubin CPX GPU,針對超大上下文推理
2025-11
英偉達與Groq簽署授權協議,整合低延遲推理至AI工廠
2025-12
CES特別發表會揭曉Rubin平台為Blackwell後繼者,已進入全面生產
2026-01
NVIDIA正式推出Rubin六晶片平台,支持代理AI及MoE模型加速
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Ifanr (爱范儿)

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。