🐼較早收集於 55m

StepFun 完全開源 Step 3.5 Flash

StepFun 完全開源 Step 3.5 Flash
PostLinkedIn
🐼閱讀原文: Pandaily

💡196B MoE 代理完全開源含框架 – 下載已超 30 萬並持續增長!

⚡ 30-Second TL;DR

有什麼變化

完全開源 Step 3.5 Flash

為什麼重要

以巨型 MoE 模型加速開源代理 AI 開發,促進社群創新並減少對封閉模型依賴。

下一步行動

下載 Step 3.5 Flash 權重與 Steptron 框架,建置自訂 AI 代理。

誰應關注:Developers & AI Engineers

關鍵要點

  • 完全開源 Step 3.5 Flash
  • 包含 Base 與 Midtrain 權重
  • 釋出 Steptron 框架
  • 196B MoE 代理模型下載超 30 萬

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 8 個來源。

🔑 增強重點摘要

  • Step 3.5 Flash 採用 45 層 Transformer 骨幹,隱藏維度 4,096,詞彙量 128,896 tokens。
  • 模型支援 262K 上下文窗口與 66K 最大輸出長度,推理速度達 100-300 tok/s,峰值 350 tok/s。
  • 在基準測試中表現優異,包括 AIME 2025 97.3 分、SWE-bench Verified 74.4%、LiveCodeBench-V6 86.4%。
  • SiliconFlow 提供 API 服務,輸入 $0.1/M tokens、輸出 $0.3/M tokens,並支援工具呼叫。
📊 競品分析▸ Show
模型架構總參數激活參數上下文長度輸入價格 ($/M)輸出價格 ($/M)SWE-benchAIME
Step-3.5-FlashSparse MoE196B11B262K0.10.374.4%97.3
step3未指定未明未明66K0.571.42未明未明

🛠️ 技術深入

  • 稀疏混合專家 (Sparse MoE) Transformer 架構,總參數 196.81B,每 token 僅激活 11B。
  • 45 層 Transformer 骨幹,隱藏維度 4,096,上下文窗口 256K-262K,詞彙量 128,896 tokens。
  • 採用 3-way Multi-Token Prediction (MTP-3) 實現 100-300 tok/s 速度,峰值 350 tok/s;3:1 Sliding Window Attention (SWA) 優化長上下文。
  • FP8 精度權重可用,支援 vLLM 部署 (需 tensor-parallel-size 8、enable-expert-parallel),llama.cpp GGUF int4 需 120GB VRAM。
  • 推理指令範例:vllm serve 包含 --reasoning-parser step3p5、--enable-auto-tool-choice 等參數。

🔮 前景展望AI analysis grounded in cited sources

開源 MoE 模型將加速代理任務應用開發
高下載量與多平台支援如 Puter.js 和 SiliconFlow 表示開發者快速採用,提升代理編碼與推理效率。
FP8 與量化版本將擴大部署到消費級硬體
llama.cpp GGUF int4 支援 Mac Studio M4 Max 等,降低 120GB VRAM 門檻促進邊緣計算。

時間線

2025-08
StepFun 發布 step3 模型
2026-02
Step 3.5 Flash 正式發布並上架 Hugging Face
2026-03
Step 3.5 Flash 下載量超過 30 萬,完全開源 Base 與 Midtrain 權重及 Steptron 框架
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。