🇬🇧The Register - AI/ML•較早收集於 26m
推理為AI晶片新創帶來復興

💡推理轉變讓新創挑戰Nvidia—立即探索更廉價AI硬體選項(32字元)
⚡ 30-Second TL;DR
有什麼變化
AI焦點從模型訓練轉向服務/推理
為什麼重要
推理熱潮可能推動硬體創新,降低AI部署成本。從業人員獲得Nvidia替代方案,提升效率與可擴展性。
下一步行動
基準測試Groq或Etched等新創推理晶片,用於您的部署工作負載
誰應關注:Founders & Product Leaders
關鍵要點
- •AI焦點從模型訓練轉向服務/推理
- •晶片新創爭奪Nvidia主導市場份額
- •分散式AI生態讓Nvidia成為盟友與對手
- •轉折點要求新創立即行動
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •推理工作負載的異質性(如低延遲、高吞吐量或邊緣運算)促使晶片架構從通用 GPU 轉向特定領域架構(DSA),這為 Groq、Etched 和 Tenstorrent 等新創公司提供了差異化競爭空間。
- •記憶體頻寬(HBM)瓶頸已成為推理效能的關鍵限制,新創公司正透過採用 SRAM 晶片上記憶體或先進封裝技術來繞過傳統 GPU 的記憶體牆問題。
- •軟體堆疊的成熟度(如對 PyTorch 2.0、Triton 或專有編譯器的支援)已成為新創公司能否成功將硬體效能轉化為實際市場份額的決定性因素,而非僅僅依賴硬體算力。
📊 競品分析▸ Show
| 特性 | Nvidia (Blackwell/Hopper) | AI 晶片新創 (如 Groq/Etched) | 關鍵差異 |
|---|---|---|---|
| 架構 | 通用 GPU (CUDA 生態) | DSA (特定領域架構) | Nvidia 靈活性高,新創推理效率高 |
| 記憶體 | HBM3e (高容量) | SRAM/LPDDR5x (低延遲) | 新創針對推理優化記憶體存取 |
| 軟體生態 | CUDA (極度成熟) | 專有編譯器/開源框架支援 | Nvidia 具備護城河,新創需依賴編譯器優化 |
| 價格/效能 | 高昂但通用 | 推理成本效益極高 | 新創在特定模型推理上具成本優勢 |
🛠️ 技術深入
• 推理優化架構:新創公司多採用「資料流」架構(Dataflow Architecture),減少指令提取與解碼開銷,直接在處理單元間傳輸資料。 • 記憶體層級:為了降低推理延遲,許多新創放棄昂貴的 HBM,轉而使用大規模片上 SRAM,以實現極高的記憶體頻寬,適合處理 LLM 的 KV Cache。 • 編譯器技術:新創公司投入大量資源開發圖形編譯器(Graph Compilers),將 Transformer 模型直接映射到硬體執行單元,繞過傳統的 CUDA 驅動層。
🔮 前景展望AI analysis grounded in cited sources
推理專用晶片將在 2027 年前佔據邊緣 AI 市場 30% 以上的份額。
隨著模型量化技術的成熟,邊緣裝置對低功耗、高效率推理晶片的需求將超越通用 GPU。
Nvidia 將被迫推出專門針對推理的精簡版架構以防禦市場流失。
新創公司在推理成本上的顯著優勢將迫使 Nvidia 調整產品策略,以保護其在資料中心推理市場的定價權。
⏳ 時間線
2023-11
Groq 推出 LPU (Language Processing Unit) 架構,展示在 LLM 推理上的極致速度。
2024-03
Nvidia 發布 Blackwell 架構,強調其在推理效能上的顯著提升,試圖鞏固市場地位。
2025-06
多家 AI 晶片新創獲得大規模融資,專注於開發針對 Transformer 推理的專用 ASIC。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: The Register - AI/ML ↗
