💰較早收集於 33m

Groq AI 推理晶片以驚人估值震撼市場

Groq AI 推理晶片以驚人估值震撼市場
PostLinkedIn
💰閱讀原文: 钛媒体

💡探索在 AI 推理領域挑戰 Nvidia 主導地位的硬體新星。

⚡ 30-Second TL;DR

有什麼變化

Groq 的 LPU(語言處理單元)架構專為 AI 推理進行了優化。

為什麼重要

Groq 的崛起顯示 AI 硬體市場正轉向專用推理晶片,這可能降低開發者運行大型語言模型的成本,並促使企業重新評估 AI 應用的基礎設施支出。

下一步行動

在 Groq 的雲端 API 上測試您的 LLM 推理工作負載,並與目前的 GPU 架構進行延遲與成本效益比較。

誰應關注:Developers & AI Engineers

關鍵要點

  • Groq 的 LPU(語言處理單元)架構專為 AI 推理進行了優化。
  • 儘管歷史上存在虧損,該公司仍獲得了極高估值,顯示投資人對推理導向硬體的信心。
  • Groq 為 AI 推理市場提供了新的「定價錨點」,挑戰了現有的基於 GPU 的解決方案。

🧠 深度解析

Web-grounded analysis with 42 cited sources.

🔑 增強重點摘要

  • Groq於2025年9月完成新一輪7.5億美元融資,投後估值達到69億美元,相較於2024年8月D輪融資時的28億美元估值,在一年內增長超過一倍,顯示市場對其推理硬體的強勁信心。
  • Groq的創辦人Jonathan Ross曾是Google Tensor處理單元(TPU)晶片的核心研發成員,這為Groq的LPU架構帶來了深厚的專業背景。
  • Groq的LPU晶片在大型語言模型推理方面展現出驚人速度,例如運行Llama 2 70B模型時,其吞吐量比其他雲端供應商快18倍,Mixtral 8x7B SMoE模型可達每秒480個token,而Llama 2 7B模型在極限情況下甚至能達到每秒750個token。
  • Nvidia於2025年12月與Groq達成一項戰略協議,據報導價值約200億美元,內容包括授權Groq的AI推理技術,並將Groq創辦人Jonathan Ross及營運長Sunny Madra等核心成員轉調至Nvidia,此舉被視為Nvidia強化其在AI推理市場地位的重要策略。
  • Groq不僅提供LPU晶片硬體,還透過GroqCloud提供雲端服務,讓開發者能以API形式按需存取其LPU,並支援多種開源AI模型如Llama、Mixtral、Gemma和Whisper,且與OpenAI API完全兼容。
📊 競品分析▸ Show
特性/公司Groq LPUNvidia GPU (H100/A100)SambaNova (RDU)Cerebras (WSE)
架構類型語言處理單元 (LPU),張量流處理器 (TSP)圖形處理單元 (GPU)可重構數據流架構 (RDA)晶圓級引擎 (Wafer-Scale Engine)
主要用途專為AI推理優化,特別是大型語言模型 (LLM)訓練與推理通用並行處理高性能訓練與推理工作負載高性能訓練與推理工作負載
記憶體片上SRAM (230MB),80 TB/s內部頻寬,SRAM存取速度比HBM快約20倍高頻寬記憶體 (HBM),複雜的快取系統片上記憶體和數據流大規模片上記憶體
執行模式編譯器定義、單核優化、確定性執行、連續token處理多核、批次處理、可變且難以預測的延遲數據流架構-
性能基準 (LLM推理)Llama 2 70B: 241 tokens/秒 (比其他雲端供應商快18倍);Mixtral 8x7B: 480 tokens/秒;Llama 2 7B: 高達750 tokens/秒;比GPT-4快18-25倍- (Groq聲稱LPU比Nvidia GPU快10倍)Llama 3.1 70B: 500 tokens/秒;405B模型在5秒內完成Llama 8B: 1800 tokens/秒;Llama 70B: 450 tokens/秒
能效高達10倍的能源效率 (相較於GPU);氣冷設計標準數據流架構優化功耗-
單卡成本約2萬美元Nvidia HGX (8 * H100) 約30萬美元--
API定價Mixtral 8x7B SMoE: 100萬token 0.27美元---

🛠️ 技術深入

  • LPU架構 (Language Processing Unit):Groq的LPU是一種張量流處理器(TSP),採用編譯器和軟體定義的單核架構,旨在消除傳統軟體複雜性。它透過可編程的裝配線架構實現確定性執行,確保每個計算階段的數據到達時間精確可預測,從而消除延遲的可變性。
  • 記憶體設計:LPU將數百MB的片上SRAM作為主要權重儲存(而非快取),提供80 TB/s的內部頻寬。SRAM的存取速度比HBM快約20倍,這使得計算單元能以全速獲取權重,有效解決了傳統GPU面臨的「記憶體牆」瓶頸。
  • 製程節點:第一代LPU (LPU v1) 採用14奈米製程,晶片尺寸為25x29毫米,公稱時脈頻率為900 MHz。第二代LPU (LPU v2) 預計採用三星4奈米製程節點,並於2025年全面增產,以提升性能和效率。
  • 性能指標 (LPU v1):在INT8精度下可達750 TOPS,在FP16精度下可達188 TeraFLOPS。
  • 晶片間擴展:Groq開發了一種準同步協議(Presynchronous Protocol),能夠消除自然時脈漂移,使數百個LPU作為單一邏輯核心運作。透過張量並行化(Tensor Parallelization)技術,可在LPU之間分散權重,支援超越單晶片SRAM容量的大型模型。此外,Groq也採用了「蜻蜓拓撲」(Dragonfly Topology)來加速數據傳輸。
  • 數值精度 (TruePoint Numerics):Groq採用TruePoint數值方法,在不犧牲準確性的前提下降低精度。例如,對注意力對數(attention logits)使用FP32,對專家混合(MoE)權重使用Block Floating Point,對容錯層中的激活值使用FP8儲存,以實現2-4倍的速度提升而無明顯精度損失。
  • 散熱:LPU和GroqRack設計為氣冷,無需複雜的冷卻和電源基礎設施,有助於降低營運成本和環境影響。

🔮 前景展望AI analysis grounded in cited sources

Nvidia將加速其在AI推理市場的技術整合與產品推出。
Nvidia收購Groq的關鍵技術和人才,表明其正積極將LPU的低延遲、高效率特性融入自身產品線,特別是針對中國市場的Groq AI晶片預計於2026年5月上市,將直接強化其推理解決方案。
AI推理專用硬體市場的競爭將更加激烈,並可能促使更多創新架構的出現。
Groq LPU的成功及其對Nvidia市場主導地位的挑戰,將激勵更多新創公司和現有巨頭投入資源開發專為推理優化的ASIC,而非僅依賴通用GPU,從而推動整個AI晶片生態系統的多元化發展。
即時、低延遲的AI應用將變得更加普及和經濟。
Groq LPU所提供的超高速、低成本推理能力,將使即時對話式AI、即時推薦系統等對延遲敏感的應用能夠以更低的營運成本大規模部署,從而加速AI技術在各行各業的落地與普及。

時間線

2016
Groq由Jonathan Ross創立。
2024-02
Groq推出基於LPU的大模型推理晶片。
2024-03
Groq收購Definitive Intelligence並建立GroqCloud雲端服務平台。
2024-08
完成D輪融資6.4億美元,公司估值達28億美元。
2025-09
完成新一輪7.5億美元融資,投後估值達69億美元。
2025-12
Nvidia宣布與Groq達成協議,授權其AI推理技術並轉移部分核心高管,據報導價值約200億美元。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 钛媒体