🌍The Next Web (TNW)•較早收集於 46m
Google TPU 產能供不應求,內部研究團隊面臨排隊

💡了解 AI 巨頭的龐大雲端需求如何導致連基礎設施擁有者都面臨運算資源短缺的問題。
⚡ 30-Second TL;DR
有什麼變化
來自 Anthropic 和 Meta 等外部合作夥伴的高需求佔用了大量 TPU 產能。
為什麼重要
內部運算資源的稀缺顯示 Google 可能會優先考慮外部營收而非內部研發速度,這可能會拖慢其自身的模型開發週期。
下一步行動
透過評估多雲或混合 GPU/TPU 架構來分散訓練基礎設施策略,以避免特定供應商的運算瓶頸。
誰應關注:Enterprise & Security Teams
關鍵要點
- •來自 Anthropic 和 Meta 等外部合作夥伴的高需求佔用了大量 TPU 產能。
- •Google 內部研究團隊正面臨運算資源受限的問題。
- •Google 十年來在自研晶片上的投入,現已成為關鍵的競爭瓶頸。
🧠 深度解析
Web-grounded analysis with 32 cited sources.
🔑 增強重點摘要
- •Anthropic與Google簽署了一項大規模協議,承諾在五年內向Google Cloud支付高達2000億美元,其中包括從2027年開始的多吉瓦級下一代TPU容量,這佔Google雲端收入積壓的40%以上,凸顯了外部合作夥伴對TPU的巨大需求。
- •Google面臨的挑戰不僅是內部資源排隊,更是一個廣泛的基礎設施擴展挑戰,目標是每六個月將AI服務能力翻倍,並在4-5年內實現1000倍的增長,同時保持成本和能源效率,這被視為「AI基礎設施競賽」中最關鍵且最昂貴的部分。
- •TPU供應瓶頸的部分原因在於關鍵硬體組件的限制,特別是來自三星、美光和SK海力士等供應商的高頻寬記憶體(HBM),這被認為是供應鏈中的一個主要瓶頸。
- •為應對不斷增長的需求,Google正在擴展其客製化晶片計畫,並已推出第八代TPU(TPU 8t用於訓練,TPU 8i用於推理),首次將TPU產品線分為兩種具有不同架構的晶片,這標誌著AI加速器設計朝向工作負載專業化的結構性轉變。
- •Google內部研究團隊面臨的運算資源排隊問題,部分源於內部市場機制,其中運算資源的分配是根據管理層級而非外部客戶合約所依循的單位成本經濟學來進行配給。
📊 競品分析▸ Show
| 特性/產品 | Google TPU | NVIDIA GPU (H100/B200) | AWS Trainium/Inferentia | Azure Maia 200 |
|---|---|---|---|---|
| 架構專業化 | 專為AI工作負載設計的ASIC,採用脈動陣列、光學電路交換、bfloat16/FP8/FP4精度。 | 通用型GPU,但廣泛應用於AI,擁有成熟的CUDA生態系統。 | Trainium專為訓練,Inferentia專為推理。 | 專為推理工作負載設計。 |
| 性能基準 | TPU v7 (Ironwood) 在9,216晶片超級Pod中提供42.5 FP8 ExaFLOPS,單晶片性能比Trillium高4倍,比TPU v5p高10倍;性能與NVIDIA Blackwell B200 GPU相當,每瓦性能比H100高2.8倍。TPU 8t訓練性能比Ironwood提升2.7倍。 | H100是行業標準,生態系統廣泛。Blackwell B200提供類似HBM記憶體規格和更高的頻寬。 | Trainium2據稱性能是第一代的4倍。 | Microsoft聲稱Maia 200在某些AI任務上比Google TPU和AWS Trainium處理器性能更好,並為GPT-3.5推理工作負載提供30%的每美元性能提升。 |
| 成本效益 | 對於符合條件的工作負載,通常提供更好的性價比。TPU v6e在大型語言模型訓練、推薦系統和大型批次推理方面,每美元性能比NVIDIA H100高達4倍。TPU v5e在批次處理方面比A100節省40%成本。 | 通常按需價格較高,但生態系統成熟度高。 | Trainium2集群的訓練性能據稱與H100集群相似,但成本約為四分之一。 | Maia 200聲稱在GPT-3.5推理工作負載上提供30%的每美元性能提升。 |
| 生態系統 | 原生支援TensorFlow和JAX,並支援PyTorch和vLLM引擎。 | 擁有廣泛的CUDA軟體生態系統,包括優化的函式庫、開發工具和社群支援。 | 針對AWS生態系統優化。 | 針對Microsoft生態系統優化,用於Copilot和OpenAI模型。 |
| 供應鏈控制 | Google控制從晶片到網路和排程器的整個堆疊,減少對外部GPU供應商的依賴。 | 依賴台積電等代工廠的先進封裝技術,NVIDIA預訂了2026年超過一半的CoWoS產能。 | AWS開發自己的客製化晶片。 | Microsoft開發自己的客製化晶片。 |
🛠️ 技術深入
- 脈動陣列 (Systolic Array):TPU的核心計算引擎是矩陣乘法單元 (MXU)。在TPU v5p之前,MXU是一個128x128的脈動陣列,包含16,384個乘法累積器。從Trillium (v6e) 開始,MXU擴展到256x256,將每個週期的運算次數增加了四倍。
- TensorCore:每個TensorCore包含一個或多個MXU、一個向量處理單元 (VPU) 和一個純量單元。
- 高頻寬記憶體 (HBM):TPU晶片上用於儲存模型權重和激活的記憶體。其容量和頻寬隨世代增加,例如TPU v5p每個晶片有95 GB HBM,頻寬為2,765 GB/s;Trillium將HBM容量翻倍至每個晶片32 GB;Ironwood配備192 GB HBM3E;TPU 8t配備216 GB HBM3e,TPU 8i配備288 GB HBM3e。
- 晶片間互連 (ICI):連接Pod內晶片的網路,其頻寬決定了訓練期間晶片同步梯度的速度。TPU v4引入了光學電路交換 (OCS) 技術,用於5維環面拓撲的動態重新配置,實現了大規模擴展。TPU v5p使用OCS連接8,960個晶片。Trillium將ICI頻寬翻倍至每個晶片3,200 Gbps。TPU 8t的ICI頻寬為每個晶片19.2 Tb/s。
- 稀疏核心 (SparseCore):在TPU v4中引入,並在v5p中改進,專為嵌入密集型工作負載設計。
- 精度支援:支援bfloat16、INT8和FP8。TPU 8t的MXU原生支援FP4。
- Pod架構:TPU晶片被組織成模組,然後組裝成Pod,實現大規模並行計算。例如,TPU v5p Pod可擴展至8,960個晶片,Ironwood超級Pod包含9,216個晶片,TPU 8t超級Pod包含9,600個晶片。
- 網路結構 (Network Fabric):TPU 8t/8i引入了Virgo網路結構,理論上可在單一資料中心連接超過134,000個晶片,甚至跨站點連接超過100萬個晶片。TPU 8i還引入了「Boardfly」網路拓撲和集體加速引擎 (CAE)。
- 主機處理器:TPU 8t使用基於Axion Arm架構的主機處理器。
🔮 前景展望AI analysis grounded in cited sources
Google將加速其AI基礎設施的擴張,並可能尋求更多外部合作夥伴來共同開發晶片。
為了應對激增的需求和內部瓶頸,Google需要每六個月將AI服務能力翻倍,並在4-5年內實現1000倍的增長,這將需要巨大的資本支出和潛在的外部晶片設計合作夥伴(如與Marvell的合作)。
AI加速器市場將進一步走向專業化,針對訓練和推理工作負載設計不同的晶片。
Google第八代TPU(8t和8i)的發布,明確區分了訓練和推理晶片,這表明AI工作負載的計算特性已經分化,單一架構難以同時最佳化兩者。
雲端供應商將更強調垂直整合的AI硬體堆疊,以提供成本效益和性能優勢。
Google透過控制從晶片到網路再到排程器的整個堆疊,旨在提供比NVIDIA GPU更具成本效益和性能的解決方案,並減少對第三方GPU供應商的依賴。
⏳ 時間線
2013-XX
TPU專案啟動,以應對Google資料中心對深度學習計算需求的激增。
2015-XX
第一代TPU (v1) 內部部署於Google資料中心,主要用於推理。
2017-XX
第二代TPU (v2) 部署,首次支援訓練和推理,並在Google Compute Engine上提供。
2018-XX
Google Cloud TPU首次向第三方開發者開放。
2021-XX
第四代TPU (v4) 發布,引入光學電路交換 (OCS) 技術,顯著提升互連能力。
2023-XX
TPU v5p 發布,專注於性能,將Pod規模擴展至8,960個晶片。
2024-XX
第六代TPU (Trillium, v6e) 發布,MXU擴展至256x256,性能大幅提升。
2025-XX
第七代TPU (Ironwood, v7) 普遍可用,專為推理和大規模訓練設計,性能比Trillium提升4倍。
2026-04
Google Cloud Next 2026,宣布第八代TPU (8t用於訓練,8i用於推理),首次將TPU產品線分為兩種不同架構的晶片。
📎 來源 (32)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- thenextweb.com
- datacenterknowledge.com
- resultsense.com
- anthropic.com
- siliconrepublic.com
- traxtech.com
- nationalcioreview.com
- futurumgroup.com
- google.com
- medium.com
- wikipedia.org
- introl.com
- intuitionlabs.ai
- youtube.com
- lighthouse-canton.com
- everpuredata.com
- cloudexpat.com
- faceofit.com
- introl.com
- reddit.com
- easecloud.io
- medium.com
- gmicloud.ai
- medium.com
- groupify.ai
- gettraction.ai
- forbes.com
- atlantis-press.com
- medium.com
- orhanergun.net
- google.com
- kartaca.com
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: The Next Web (TNW) ↗

