🏕️极客公园•最新收集於 29m
OpenAI Jalapeño 晶片挑戰 Blackwell

#custom-silicon#inference#energy-efficiency#acceleratorsopenai-jalapeñoopenaijalapeñobroadcomnvidia-blackwelldeepseek-r1
💡模型公司自研晶片宣稱推理延遲最高比 GB300 低 4.9 倍,本文解析其架構。
⚡ 30-Second TL;DR
有什麼變化
在 GPT-OSS 120B、DeepSeek R1 670B 與 Kimi K2.5 1T 上,Jalapeño 的峰值每瓦吞吐量據稱是 Blackwell 的 1.5 至 1.9 倍。
為什麼重要
若測試結果能獲得獨立驗證,Jalapeño 將強化模型公司自行設計推理晶片、而非完全依賴通用 GPU 的論點。其針對模型工作負載的設計可能降低服務成本與延遲,也會提高對工作負載感知硬體、編譯器與部署能力的需求。
下一步行動
在進行容量規劃前,使用 GPT-OSS 120B 或 DeepSeek R1,於自己的服務堆疊重現 InferenceX 測試,以驗證 Jalapeño 宣稱的效率優勢。
誰應關注:Researchers & Academics
關鍵要點
- •在 GPT-OSS 120B、DeepSeek R1 670B 與 Kimi K2.5 1T 上,Jalapeño 的峰值每瓦吞吐量據稱是 Blackwell 的 1.5 至 1.9 倍。
- •在低延遲 DeepSeek R1 測試中,Jalapeño 每位使用者約可達每秒 700 個 token,而 Nvidia GB300 約為 169 個。
- •該架構透過運算核心與記憶體切片,以及 15.4TB/s 的 HBM4 頻寬讓資料留在本地,減少模型權重與 KV cache 的搬移成本。
- •OpenAI 從初始設計到流片只花九個月,目前已投入第二代與第三代晶片開發。
- •目前數據主要由 OpenAI 提供,且來自工程樣品測試,尚不能代表大規模生產環境的普遍表現。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 12 個來源。
🔑 增強重點摘要
- •OpenAI 此次開發合作夥伴除 Broadcom 外,還包括負責製造與系統整合的 Celestica。
- •Jalapeño 的開發過程大量運用 OpenAI 自家 AI 模型進行架構優化與程式碼編寫,大幅縮短設計週期。
- •該晶片在 InferenceX 基準測試中,端到端延遲表現優於 Nvidia GB300 約 1.7 至 3.6 倍,在高度互動工作負載下差距更達 4.1 倍。
- •Jalapeño 採用 NUMA 風格的空間架構,旨在解決傳統硬體在處理高吞吐量與低延遲時的取捨問題。
- •OpenAI 透過 Codex 模型自動生成針對 Jalapeño 優化的核心程式碼,意圖建立一套能與 Nvidia CUDA 生態抗衡的軟體堆疊。
📊 競品分析▸ Show
| 特性 | OpenAI Jalapeño | Nvidia GB300 |
|---|---|---|
| 核心定位 | 推理專用 ASIC | 通用 GPU 叢集 |
| 峰值每瓦吞吐量 | 1.5 - 1.9 倍 (基準) | 基準值 |
| 延遲表現 | 較低 (1.7-3.6 倍優勢) | 較高 |
| 軟體生態 | Codex 優化核心 | CUDA (成熟生態) |
🛠️ 技術深入
- 採用 NUMA 風格的空間架構設計,優化運算核心與記憶體切片之間的資料存取路徑。
- 整合 15.4TB/s 的 HBM4 記憶體頻寬,將模型權重與 KV cache 保持在本地以減少搬移損耗。
- 透過 OpenAI 自研的 Codex 模型自動化生成針對硬體架構優化的底層核心程式碼。
- 專為推理工作負載設計的 ASIC 架構,而非通用圖形處理器。
🔮 前景展望AI analysis grounded in cited sources
OpenAI 將顯著降低其推理服務的營運成本。
Jalapeño 在每瓦吞吐量與延遲上的優勢,能直接減少大規模部署時的電力消耗與硬體需求。
Nvidia 的 CUDA 軟體護城河將面臨 AI 自動化編譯的挑戰。
OpenAI 利用 Codex 自動生成晶片核心程式碼,證明了透過 AI 輔助開發可降低對傳統硬體廠商軟體生態的依賴。
⏳ 時間線
2025-11
OpenAI 完成 Jalapeño 晶片設計並啟動流片流程。
2026-08
OpenAI 正式公開 Jalapeño 測試數據並宣布小規模部署計畫。
📎 來源 (12)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 极客公园 ↗
每週 AI 簡報
每週一封,可隨時退訂。
