最新收集於 3h

Jalapeño 重新定義推理晶片競賽

Jalapeño 重新定義推理晶片競賽
PostLinkedIn
閱讀原文: 雷峰网
#token-throughput#inference-efficiency#kv-cache#data-centeropenai-jalapeñoopenai jalapeñonvidia rubingroq 3 lpugoogle tpu 8deepseek r1

💡Jalapeño 以 Token 為核心的跑分,揭示推理硬體為何開始走出傳統 GPU 路線。

⚡ 30-Second TL;DR

有什麼變化

在 GPT-OSS 120B、DeepSeek R1 670B 與 Kimi K2.5 1T 負載中,Jalapeño 每瓦 AI 工作量提升約 1.5–1.9 倍,端到端延遲降低約 1.7–3.6 倍。

為什麼重要

若這些效率提升能在生產規模上維持,推理經濟性可能會比峰值 FLOPS 更成為關鍵差異。AI 團隊將更需要評估完整的服務平台,包括記憶體區域性、排程、批次處理與軟體最佳化。

下一步行動

在選擇新推理硬體前,分別對服務堆疊進行 Prefill 與低批次 Decode 基準測試,追蹤每秒 Token 數、延遲與每瓦 Token 數。

誰應關注:Researchers & Academics

關鍵要點

  • 在 GPT-OSS 120B、DeepSeek R1 670B 與 Kimi K2.5 1T 負載中,Jalapeño 每瓦 AI 工作量提升約 1.5–1.9 倍,端到端延遲降低約 1.7–3.6 倍。
  • 該晶片額定功耗為 700W,報告測試中的持續功耗則低於 550W。
  • OpenAI 設計 Jalapeño 同時處理 Prefill 與 Decode,並協調運算、記憶體、網路、模型狀態及 KV Cache 的配置。
  • NVIDIA 正將 Groq 3 LPU 導入推理系統,Google 則把 TPU 8 分為偏訓練與偏推理的路線。
  • 由於軟體、負載形態、部署規模與 Agent 情境尚未對齊,Jalapeño 與 Rubin 暫時無法直接排名。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 8 個來源。

🔑 增強重點摘要

  • OpenAI 採用了極速開發策略,從團隊組建到晶片流片(Tape-out)僅耗時約 16 個月,並利用自家 AI 模型輔助晶片設計與優化流程。
  • Jalapeño 的開發獲得了產業鏈深度支援,其中 Broadcom 負責矽晶片實現與網路連接技術,Celestica 則主導機架與系統整合。
  • 該晶片採用 NUMA 風格的空間架構(Spatial Architecture),被定位為通用型推理平台,而非僅針對特定模型優化的狹義加速器。
  • 在系統擴展性方面,由 2,048 個處理器組成的叢集可達到 27 exaFLOPS 的算力,並具備 32 PB/s 的總記憶體頻寬。
  • OpenAI 推出此晶片旨在挑戰 NVIDIA 在資料中心領域高達 75% 至 78% 的毛利率,正式加入與 Google TPU 及 Amazon Inferentia 等超大規模雲端供應商的自研晶片競爭。
📊 競品分析▸ Show
特性/指標OpenAI JalapeñoNVIDIA Rubin (預估)Google TPU v6
架構類型NUMA 空間架構GPU 通用架構ASIC 專用架構
每瓦效能基準測試提升 1.5-1.9 倍產業標竿高效能專用
核心優勢推理延遲與成本優化生態系與通用性軟硬體垂直整合

🛠️ 技術深入

  • 採用 NUMA 風格的空間架構設計,優化記憶體存取效率。
  • 支援大規模叢集擴展,單一系統可達 2,048 顆處理器規模。
  • 具備 32 PB/s 的聚合記憶體頻寬,以應對大規模模型(如 1T 參數)的 KV Cache 需求。
  • 整合 Broadcom 的高速網路與連接技術,確保多晶片間的低延遲通訊。

🔮 前景展望AI analysis grounded in cited sources

OpenAI 將在 2027 年實現 Jalapeño 的大規模量產。
根據 2026 年的小批量部署進度,公司已將其納入多世代運算平台策略,預計明年進入產能爬坡階段。
Jalapeño 將顯著降低 OpenAI 外部推理服務的營運成本。
透過自研晶片取代第三方供應商,OpenAI 可直接規避 NVIDIA 高額的硬體毛利,進而提升推理業務的獲利空間。

時間線

2025-04
OpenAI 啟動 Jalapeño 晶片開發專案並組建專屬團隊。
2026-08
於 Hot Chips 2026 大會正式發表 Jalapeño 並公布初步推理基準測試。

📎 來源 (8)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. semianalysis.com
  2. shattered.io
  3. axios.com
  4. tomshardware.com
  5. facebook.com
  6. openai.com
  7. openai.com
  8. servethehome.com
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 雷峰网

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。