來源較早收集於 28m

AI晶片變局:從一家獨大到多極博弈,剛剛開始

閱讀原文: 虎嗅
#ai-chips#nvidia-rivals#cloud-hardware

谷歌/亞馬遜直接售AI晶片,威脅NVIDIA 90%市佔。(22字元)

30 秒速覽

有什麼變化

谷歌CEO確認2025年向外部客戶售TPU,2028年營收高峰。

為什麼重要

多元化AI晶片市場,或降成本但增多供應商整合難度。標誌多極競爭加劇。

下一步行動

對照NVIDIA A100基準測試Google TPU推理效能於您的任務。

誰應關注:Enterprise & Security Teams

關鍵要點

  • 谷歌CEO確認2025年向外部客戶售TPU,2028年營收高峰。
  • 亞馬遜計劃Trainium出口AWS外,指出訓練依賴NVIDIA轉變。
  • 挑戰含NVIDIA CUDA生態護城河及客製化相容問題。
  • 動機:推理工作負載上升、成本節省、供應鏈多元化。

深度解析

本篇為 AI 生成分析,非原文內容。

增強重點摘要

  • 谷歌的TPU銷售策略轉向,部分源於其自研晶片在處理大規模Transformer模型推理時,相較於通用GPU展現出更高的能源效率與每瓦效能(Performance-per-Watt)。
  • 亞馬遜AWS透過將Trainium機櫃直接銷售給外部客戶,旨在建立一套完整的『硬體+軟體』垂直整合方案,以緩解其在AI基礎設施上對NVIDIA供應鏈的過度依賴。
  • 雲端巨頭轉向自研晶片銷售,促使開源軟體堆疊(如OpenXLA與PyTorch 2.0)加速發展,旨在降低開發者從CUDA生態遷移至非NVIDIA硬體的技術門檻。

競品分析

核心架構
NVIDIA H100/B200
Hopper/Blackwell GPU
Google TPU v5p
自研ASIC (Matrix Unit)
AWS Trainium2
自研ASIC (NeuronCore)
軟體生態
NVIDIA H100/B200
CUDA (極強護城河)
Google TPU v5p
OpenXLA / JAX / TensorFlow
AWS Trainium2
Neuron SDK / PyTorch
主要優勢
NVIDIA H100/B200
通用性強、生態最完善
Google TPU v5p
大規模訓練與推理效率
AWS Trainium2
AWS雲端整合度最高
定價模式
NVIDIA H100/B200
晶片銷售/雲端租賃
Google TPU v5p
雲端租賃/機櫃銷售
AWS Trainium2
雲端租賃/機櫃銷售

技術深入

  • Google TPU v5p: 採用液冷技術,單一Pod包含8,960個晶片,透過高頻寬互連(ICI)實現每秒2,760 TB的總體頻寬,專為大規模模型訓練優化。
  • AWS Trainium2: 專為高效能訓練設計,相較於第一代Trainium,在處理大型語言模型(LLM)時的訓練效能提升至4倍,並支援更靈活的記憶體配置。
  • 互連技術: 兩者皆強調自研的高速互連架構,以解決在分散式運算中,晶片間通訊造成的延遲瓶頸。

前景展望基於引用來源的 AI 分析

NVIDIA的市場佔有率將在2027年出現顯著下滑
隨著雲端巨頭將自研晶片從內部使用轉向外部銷售,企業客戶將獲得更多非NVIDIA的硬體選擇,進而稀釋NVIDIA在AI基礎設施市場的份額。
AI晶片市場將從『硬體競爭』轉向『軟體相容性競爭』
硬體效能差距縮小後,誰能提供更無縫的遷移工具與軟體生態,將成為決定客戶選擇晶片的關鍵因素。

時間線

2016-05
Google首次在Google I/O大會上公開TPU(第一代)架構。
2020-12
AWS正式發布第一代自研AI訓練晶片Trainium。
2023-12
Google發布TPU v5p,標誌著其最強大AI加速器進入大規模部署階段。
2024-11
AWS在re:Invent大會上展示Trainium2的效能提升與擴展能力。

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。