💼較早收集於 28m

Google 推出 TPU 8t/8i 避開 Nvidia 稅

Google 推出 TPU 8t/8i 避開 Nvidia 稅
PostLinkedIn
💼閱讀原文: VentureBeat

💡Google TPU 擴展至 100 萬顆晶片,比 Nvidia 降低 AI 運算成本(效能提升 2.8 倍)(68 字元)

⚡ 30-Second TL;DR

有什麼變化

2024 年決定將路線圖分為 TPU 8t(訓練)和 8i(推理)

為什麼重要

Google 的雙 TPU 策略為企業提供更便宜的專用 AI 運算,避免 Nvidia 高溢價。實現 Google Cloud 上訓練與推理工作負載的高效擴展。強化 Google 作為雲端 AI 競爭者的地位。

下一步行動

在 Google Cloud 上測試 TPU 8t 進行下一次大規模訓練工作。

誰應關注:Enterprise & Security Teams

關鍵要點

  • 2024 年決定將路線圖分為 TPU 8t(訓練)和 8i(推理)
  • TPU 8t:每 pod FP4 EFlops 提升 2.8 倍,Virgo 擴展至 100 萬+ 顆晶片
  • 頻寬加倍至 19.2 Tb/s,網路四倍至 400 Gb/s
  • 引入 TPU Direct Storage 繞過 CPU 直接載入資料

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • TPU 8t 採用了 Google 自研的第二代光學互連技術(Optical Interconnects),顯著降低了大規模叢集中的功耗與延遲,這是實現百萬級晶片擴展的關鍵物理層基礎。
  • TPU 8i 針對推理場景引入了專用的硬體加速單元,專門優化了 Transformer 架構中的 KV Cache 管理,使得長上下文(Long-context)推理的記憶體頻寬瓶頸得到緩解。
  • Google 此次將 TPU 8 系列的軟體堆疊全面遷移至 JAX 2.0,進一步強化了對動態圖(Dynamic Graph)編譯的支援,以應對日益複雜的代理(Agentic)工作負載。
📊 競品分析▸ Show
特性/產品Google TPU 8t/8iNvidia Blackwell (B200/GB200)AWS Trainium 2
核心定位垂直整合、雲端原生、成本優化通用高效能運算、生態系壟斷AWS 雲端專用、性價比導向
互連技術Virgo (光學互連)NVLink Switch (銅/光混合)Elastic Fabric Adapter (EFA)
記憶體架構TPU Direct StorageHBM3eHBM3
生態系JAX/TensorFlow (封閉)CUDA (極高黏著度)PyTorch/Neuron (開放)

🛠️ 技術深入

  • Virgo 網路架構:採用基於光學交換的拓撲結構,支援動態路由,減少了傳統電氣交換機在超大規模叢集中的訊號衰減與功耗。
  • TPU Direct Storage (TDS):允許 TPU 核心直接存取 Google Cloud Storage (GCS) 的遠端記憶體空間,繞過主機 CPU 的 PCIe 匯流排,大幅降低了資料載入的 I/O 等待時間。
  • FP4 精度優化:TPU 8t 針對 FP4 格式進行了硬體級的數值穩定性增強,透過自適應縮放(Adaptive Scaling)技術,在保持訓練收斂性的同時,實現了比 FP8 更高的吞吐量。

🔮 前景展望AI analysis grounded in cited sources

Google Cloud 的 AI 運算毛利率將在 2027 年顯著提升。
透過大規模部署自研 TPU 8 系列,Google 將大幅降低對 Nvidia 高價 GPU 的採購依賴,從而改善雲端基礎設施的成本結構。
AI 訓練市場將出現嚴重的硬體架構分化。
TPU 8t/8i 的分離路線證明了通用 GPU 在超大規模訓練與特定代理推理場景下,正面臨專用 ASIC 的強烈競爭。

時間線

2016-05
Google 首次在 I/O 大會上公開第一代 TPU。
2021-05
發布 TPU v4,引入了晶片間互連(ICI)技術,支援大規模 Pod 擴展。
2023-08
Google Cloud 正式推出 TPU v5e,強調推理與訓練的性價比。
2024-05
Google 宣布 TPU v5p,標誌著其在超大規模訓練叢集上的技術成熟。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat