🐯較早收集於 28m

AI晶片變局:從一家獨大到多極博弈,剛剛開始

PostLinkedIn
🐯閱讀原文: 虎嗅

💡谷歌/亞馬遜直接售AI晶片,威脅NVIDIA 90%市佔。(22字元)

⚡ 30-Second TL;DR

有什麼變化

谷歌CEO確認2025年向外部客戶售TPU,2028年營收高峰。

為什麼重要

多元化AI晶片市場,或降成本但增多供應商整合難度。標誌多極競爭加劇。

下一步行動

對照NVIDIA A100基準測試Google TPU推理效能於您的任務。

誰應關注:Enterprise & Security Teams

關鍵要點

  • 谷歌CEO確認2025年向外部客戶售TPU,2028年營收高峰。
  • 亞馬遜計劃Trainium出口AWS外,指出訓練依賴NVIDIA轉變。
  • 挑戰含NVIDIA CUDA生態護城河及客製化相容問題。
  • 動機:推理工作負載上升、成本節省、供應鏈多元化。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • 谷歌的TPU銷售策略轉向,部分源於其自研晶片在處理大規模Transformer模型推理時,相較於通用GPU展現出更高的能源效率與每瓦效能(Performance-per-Watt)。
  • 亞馬遜AWS透過將Trainium機櫃直接銷售給外部客戶,旨在建立一套完整的『硬體+軟體』垂直整合方案,以緩解其在AI基礎設施上對NVIDIA供應鏈的過度依賴。
  • 雲端巨頭轉向自研晶片銷售,促使開源軟體堆疊(如OpenXLA與PyTorch 2.0)加速發展,旨在降低開發者從CUDA生態遷移至非NVIDIA硬體的技術門檻。
📊 競品分析▸ Show
特性NVIDIA H100/B200Google TPU v5pAWS Trainium2
核心架構Hopper/Blackwell GPU自研ASIC (Matrix Unit)自研ASIC (NeuronCore)
軟體生態CUDA (極強護城河)OpenXLA / JAX / TensorFlowNeuron SDK / PyTorch
主要優勢通用性強、生態最完善大規模訓練與推理效率AWS雲端整合度最高
定價模式晶片銷售/雲端租賃雲端租賃/機櫃銷售雲端租賃/機櫃銷售

🛠️ 技術深入

  • Google TPU v5p: 採用液冷技術,單一Pod包含8,960個晶片,透過高頻寬互連(ICI)實現每秒2,760 TB的總體頻寬,專為大規模模型訓練優化。
  • AWS Trainium2: 專為高效能訓練設計,相較於第一代Trainium,在處理大型語言模型(LLM)時的訓練效能提升至4倍,並支援更靈活的記憶體配置。
  • 互連技術: 兩者皆強調自研的高速互連架構,以解決在分散式運算中,晶片間通訊造成的延遲瓶頸。

🔮 前景展望AI analysis grounded in cited sources

NVIDIA的市場佔有率將在2027年出現顯著下滑
隨著雲端巨頭將自研晶片從內部使用轉向外部銷售,企業客戶將獲得更多非NVIDIA的硬體選擇,進而稀釋NVIDIA在AI基礎設施市場的份額。
AI晶片市場將從『硬體競爭』轉向『軟體相容性競爭』
硬體效能差距縮小後,誰能提供更無縫的遷移工具與軟體生態,將成為決定客戶選擇晶片的關鍵因素。

時間線

2016-05
Google首次在Google I/O大會上公開TPU(第一代)架構。
2020-12
AWS正式發布第一代自研AI訓練晶片Trainium。
2023-12
Google發布TPU v5p,標誌著其最強大AI加速器進入大規模部署階段。
2024-11
AWS在re:Invent大會上展示Trainium2的效能提升與擴展能力。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅