🐯虎嗅•較早收集於 28m
AI晶片變局:從一家獨大到多極博弈,剛剛開始
💡谷歌/亞馬遜直接售AI晶片,威脅NVIDIA 90%市佔。(22字元)
⚡ 30-Second TL;DR
有什麼變化
谷歌CEO確認2025年向外部客戶售TPU,2028年營收高峰。
為什麼重要
多元化AI晶片市場,或降成本但增多供應商整合難度。標誌多極競爭加劇。
下一步行動
對照NVIDIA A100基準測試Google TPU推理效能於您的任務。
誰應關注:Enterprise & Security Teams
關鍵要點
- •谷歌CEO確認2025年向外部客戶售TPU,2028年營收高峰。
- •亞馬遜計劃Trainium出口AWS外,指出訓練依賴NVIDIA轉變。
- •挑戰含NVIDIA CUDA生態護城河及客製化相容問題。
- •動機:推理工作負載上升、成本節省、供應鏈多元化。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •谷歌的TPU銷售策略轉向,部分源於其自研晶片在處理大規模Transformer模型推理時,相較於通用GPU展現出更高的能源效率與每瓦效能(Performance-per-Watt)。
- •亞馬遜AWS透過將Trainium機櫃直接銷售給外部客戶,旨在建立一套完整的『硬體+軟體』垂直整合方案,以緩解其在AI基礎設施上對NVIDIA供應鏈的過度依賴。
- •雲端巨頭轉向自研晶片銷售,促使開源軟體堆疊(如OpenXLA與PyTorch 2.0)加速發展,旨在降低開發者從CUDA生態遷移至非NVIDIA硬體的技術門檻。
📊 競品分析▸ Show
| 特性 | NVIDIA H100/B200 | Google TPU v5p | AWS Trainium2 |
|---|---|---|---|
| 核心架構 | Hopper/Blackwell GPU | 自研ASIC (Matrix Unit) | 自研ASIC (NeuronCore) |
| 軟體生態 | CUDA (極強護城河) | OpenXLA / JAX / TensorFlow | Neuron SDK / PyTorch |
| 主要優勢 | 通用性強、生態最完善 | 大規模訓練與推理效率 | AWS雲端整合度最高 |
| 定價模式 | 晶片銷售/雲端租賃 | 雲端租賃/機櫃銷售 | 雲端租賃/機櫃銷售 |
🛠️ 技術深入
- Google TPU v5p: 採用液冷技術,單一Pod包含8,960個晶片,透過高頻寬互連(ICI)實現每秒2,760 TB的總體頻寬,專為大規模模型訓練優化。
- AWS Trainium2: 專為高效能訓練設計,相較於第一代Trainium,在處理大型語言模型(LLM)時的訓練效能提升至4倍,並支援更靈活的記憶體配置。
- 互連技術: 兩者皆強調自研的高速互連架構,以解決在分散式運算中,晶片間通訊造成的延遲瓶頸。
🔮 前景展望AI analysis grounded in cited sources
NVIDIA的市場佔有率將在2027年出現顯著下滑
隨著雲端巨頭將自研晶片從內部使用轉向外部銷售,企業客戶將獲得更多非NVIDIA的硬體選擇,進而稀釋NVIDIA在AI基礎設施市場的份額。
AI晶片市場將從『硬體競爭』轉向『軟體相容性競爭』
硬體效能差距縮小後,誰能提供更無縫的遷移工具與軟體生態,將成為決定客戶選擇晶片的關鍵因素。
⏳ 時間線
2016-05
Google首次在Google I/O大會上公開TPU(第一代)架構。
2020-12
AWS正式發布第一代自研AI訓練晶片Trainium。
2023-12
Google發布TPU v5p,標誌著其最強大AI加速器進入大規模部署階段。
2024-11
AWS在re:Invent大會上展示Trainium2的效能提升與擴展能力。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅 ↗



