🔥36氪•較早收集於 6m
階躍星辰全面開源 Step 3.5 Flash
#moe#agent#inferencestep-3.5-flashstep-3.5-flashsteptronjieyue-xingchen
💡1960 億 MoE Agent 模型開源:350 TPS 推理速度(28字元)
⚡ 30-Second TL;DR
有什麼變化
開源 Base/中訓練權重及 Steptron 框架
為什麼重要
讓開發者能以高效 MoE 推理建構 AI Agent,降低自訂訓練與部署門檻。
下一步行動
複製 Steptron GitHub 儲存庫,並測試在 Agent 基準上微調 Step 3.5 Flash。
誰應關注:Developers & AI Engineers
關鍵要點
- •開源 Base/中訓練權重及 Steptron 框架
- •稀疏 MoE:總 1960 億參數,推理激活約 110 億
- •單請求代碼任務最高 350 TPS
- •中國創業公司 Agent 基座模型
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 8 個來源。
🔑 增強重點摘要
- •階躍星辰的 Step 3.5 Flash 採用稀疏 MoE 架構,實現了參數與計算成本的解耦,總參數 1960 億但推理僅激活約 110 億參數,相比稠密模型在相同計算預算下能達到更優性能[2][4]
- •MoE 架構的稀疏激活特性使得模型在訓練和推理時能以少量計算資源完成完整模型計算,在固定預訓練計算資源下往往能實現更優效果,特別適合多機器高吞吐量場景[4]
- •Step 3.5 Flash 的 350 TPS 單請求代碼任務推理速度體現了 MoE 模型在實際部署中的效率優勢,但 MoE 模型推理面臨內存瓶頸——所有專家都必須駐留在 GPU 顯存中,導致總內存需求遠大於活跃參數占用[5]
- •開源 Steptron 訓練框架配合預訓練和中訓練權重的發佈,使開發者能夠基於該 Agent 基座模型進行進一步微調和應用開發,降低企業級 Agent 系統的開發門檻[1]
🛠️ 技術深入
- •稀疏 MoE 架構核心機制:通過門控網絡(Router)動態決定將輸入分配給哪些專家,每次前向傳播僅激活部分專家(通常 1-2 個),使參數量能指數級增長而不顯著增加計算成本[3]
- •負載均衡策略:MoE 模型通過路由器輔助損失函數促進在所有專家之間均勻分配計算負載,避免模型依賴少數專家,利用分布在多個專家上的知識[1]
- •推理內存挑戰:儘管單個 token 的前向計算僅激活模型總參數的一小部分,但整個專家組都必須加載到 GPU 顯存中,在半精度(bfloat16)下內存占用量為參數數量 × 2 字節[5]
- •稀疏訪問延遲:MoE 層中特定專家的權重僅為路由到它的一小部分 token 進行處理,相比密集前饋網絡的批量矩陣乘法優化,內存訪問成本無法有效分摊[5]
- •粒度縮放法則:最新研究表明更高的粒度(活動專家的數量)會帶來更好的性能,當訓練樣本數量達到計算最優時,MoE 在 FLOP 效率方面始終優於稠密模型[2]
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2024-12
Qwen1.5-MoE-A2.7B 發佈,展示 MoE 架構在參數效率上的優勢,訓練成本相比 Qwen1.5-7B 降低 75%,推理速度提升 1.74 倍
2025-06
MoE 粒度縮放法則研究成果發表,證實更高粒度帶來更好性能,推動業界對細粒度 MoE 架構的探索
2026-03
階躍星辰開源 Step 3.5 Flash,採用稀疏 MoE 架構(1960 億參數,推理激活 110 億),同時發佈 Steptron 訓練框架
📎 來源 (8)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 36氪 ↗
每週 AI 簡報
每週一封,可隨時退訂。