OpenAI 與 Broadcom 發表 Jalapeño AI 推論晶片
OpenAI 與 Broadcom 共同發表了 Jalapeño,這是一款專為大型語言模型 (LLM) 推論所設計的客製化 AI 晶片。此次合作旨在提升 OpenAI 底層 AI 基礎設施的效能、能源效率與擴展性。
Tag: #inference127 results
OpenAI 與 Broadcom 共同發表了 Jalapeño,這是一款專為大型語言模型 (LLM) 推論所設計的客製化 AI 晶片。此次合作旨在提升 OpenAI 底層 AI 基礎設施的效能、能源效率與擴展性。
Microsoft AI 主管對 Anthropic 模型的高昂成本表示擔憂。該公司目前正優先開發更具成本效益的自研模型替代方案。

DeepSeek 對其旗艦 AI 模型實施了 75% 的大幅降價。此舉顯示全球 AI 競爭格局發生重大轉變,可能歸功於 Huawei AI 晶片生態系統帶來的效率提升。

Groq 因其專注於 AI 推理的晶片而備受市場關注,其高效能表現對 Nvidia 的市場主導地位構成了挑戰。該公司近期的估值飆升,凸顯了 AI 生態系統對專用推理硬體的強勁需求。

本文探討了 AI 領域推理成本的關鍵挑戰,強調了記憶體管理與高效調度對於商業可持續性的重要性。

GTC大會上黃仁勳推出Vera Rubin超級電腦平台,含7顆晶片包括Rubin GPU、Vera CPU及Groq LPU推理。新NemoClaw代理工具包、Nemotron開源模型聯盟、GR00T N2機器人及DRIVE自動駕駛擴張,預測2027年AI晶片營收1兆美元。涵蓋訓練至實體AI全棧。
.jpg)
Together AI 推出 Mamba-3,這是一款專為推理優化的狀態空間模型 (SSM)。它解碼速度快於 Transformer,並優於 Mamba-2。從發布之日起即完全開源。

在 GTC 大會上,NVIDIA 推出整合 Groq LPU 的 Vera Rubin 系統,這是針對推理優化的 7 顆晶片 AI 基礎設施,將 prefill 分拆至 GPU,decode 至 LPU。解決 GPU 在高速 token 生成的限制,使 1GW 資料中心 token 產出提升 350 倍。NVIDIA 預測 2027 年 GPU 市場達萬億美元,受 agentic AI 推理需求驅動。

微調 Qwen3 模型(0.6B-8B)在 9 項任務中 6 項勝過 GPT-5、Gemini、Claude 等前沿 LLM,使用開放權重教師模型。單一 H100 上低成本高準確率。開源程式碼、模型及基準測試。
中國大模型創業公司階躍星辰開源 Agent 基座模型 Step 3.5 Flash 的預訓練權重(Base)、中訓練權重(Midtrain)及 Steptron 訓練框架。採用稀疏 MoE 架構,總參數 1960 億,推理僅激活約 110 億參數。單請求代碼任務推理速度最高達 350 TPS。