🐼Pandaily•較早收集於 80m
Stepfun 開源專為 AI Agent 設計的 Step 3.7 Flash 模型

💡專為 AI Agent 工作流程設計,具備原生工具調用能力的高速 196B MoE 模型。
⚡ 30-Second TL;DR
有什麼變化
針對 AI Agent 工作流程優化的 196B 參數稀疏 MoE 架構
為什麼重要
此發布為開發者提供了一個高效能的開源選擇,用於構建反應靈敏的 Agent 系統。其速度與工具調用的專注度可顯著降低即時 AI 應用的延遲。
下一步行動
下載 Step 3.7 Flash 權重,並將其工具調用延遲與您目前的生產模型進行基準測試,以評估潛在的效能提升。
誰應關注:Developers & AI Engineers
關鍵要點
- •針對 AI Agent 工作流程優化的 196B 參數稀疏 MoE 架構
- •達到每秒 400 token 的高速推理效能
- •原生支援複雜的工具調用與 Agent 任務
🧠 深度解析
Web-grounded analysis with 13 cited sources.
🔑 增強重點摘要
- •Step 3.7 Flash 是一款多模態模型,結合了 196B 語言骨幹和 1.8B 視覺編碼器,可實現原生圖像和影片理解,並支援 256K 的上下文視窗。
- •該模型提供可選的推理級別(低/中/高),開發人員可以根據任務複雜度動態調整速度、成本和推理深度,而無需切換模型。
- •Step 3.7 Flash 在多個代理任務基準測試中表現出色,包括 SWE-bench Verified 達到 74.4%、Terminal-Bench 2.0 達到 51.0%,以及 ClawEval-1.1 領先達到 67.1%。
- •該模型以每百萬輸入 token 0.20 美元、每百萬輸出 token 1.15 美元的價格提供,在成本效益上與西方中階模型(如 Gemini 2.5 Flash 和 Claude Sonnet 4.6)具有競爭力。
- •除了透過 API 存取外,Step 3.7 Flash 還提供 GGUF 量化版本,支援在具備 128GB RAM 的硬體上進行本地部署和推理,降低了開發者的進入門檻。
📊 競品分析▸ Show
| 特性/模型 | Step 3.7 Flash | Anthropic Claude Opus 4.8 | DeepSeek V4 Flash | Mistral Devstral 2 | Qwen3.6-27B |
|---|---|---|---|---|---|
| 總參數 | 196B (11B 活躍) | N/A | N/A | 123B | 27B |
| 上下文視窗 | 256K tokens | 1M tokens | 長上下文 | 256K tokens | N/A |
| 輸入價格 (每百萬 token) | $0.20 | $5.00 | 較低 | N/A | N/A |
| 輸出價格 (每百萬 token) | $1.15 | $25.00 | 較低 | N/A | N/A |
| 推理速度 | 400 token/秒 | N/A | 更快 | N/A | N/A |
| SWE-bench Verified | 74.4% (SWE-bench Pro: 56.26%) | N/A | 55.6% (Flash) | 72.2% (自報) | N/A |
| Terminal-Bench 2.0 | 51.0% | N/A | N/A | N/A | 59.3% (與 Claude 4.5 Opus 相當) |
| ClawEval-1.1 | 67.1% (領先) | N/A | N/A | N/A | N/A |
| 多模態 | 原生圖像/影片理解 | 支援文字、圖像、檔案輸入 | N/A | N/A | N/A |
| 工具調用 | 原生支援 | 支援 | N/A | 支援 | N/A |
🛠️ 技術深入
- 模型架構: 稀疏 MoE (Mixture-of-Experts) 架構,總參數為 196B,每個 token 激活約 11B 參數。
- 多模態能力: 結合 196B 語言骨幹和 1.8B 視覺編碼器,實現原生圖像和影片理解,視覺模組使用 728x728 像素的圖像大小。
- 上下文視窗: 支援 256K token 的長上下文視窗,採用 3:1 滑動視窗注意力機制以實現成本效益處理。
- 推理效能: 透過 MTP-3 (Multi-Token Prediction) 加速技術,實現每秒 100-300 token 的吞吐量,編碼任務峰值可達 350 token/秒,整體最高可達 400 token/秒。
- 推理級別: 提供三種可選的推理級別(低、中、高),可透過 API 參數 (
reasoning_effort或output_config.effort) 進行控制,以平衡速度、成本和推理深度。 - 軟體整合與硬體支援: 支援 vLLM 和 SGLang 等運行時引擎,並可在 NVIDIA Blackwell (B200, B100, GB200) 和 NVIDIA Hopper (H100, H200) GPU 加速系統上運行。
- 本地部署: 提供 BF16、Q8_0、Q4_K_S、IQ4_XS、Q3_K_L、Q3_K_M 等 GGUF 量化格式,可在具備 128GB RAM 的硬體上進行本地推理。
- 授權: 採用 Apache 2.0 開源授權。
- 優化用途: 專為編碼、代理工作流程、結構化輸出和長上下文生產力任務設計。
🔮 前景展望AI analysis grounded in cited sources
Stepfun 的競爭性定價和功能將加劇中階 AI 代理模型市場的競爭。
其每百萬輸入/輸出 token 0.20 美元/1.15 美元的定價以及與 Gemini 2.5 Flash 和 Claude Sonnet 4.6 等模型相當的功能,提供了一個可信且成本較低的替代方案,可能迫使西方供應商調整定價。
該模型的多模態能力和代理優化將加速複雜 AI 代理在實際應用中的開發和部署。
原生圖像/影片理解、強大的工具調用功能以及在代理基準測試中的出色表現,使其非常適合編碼、金融和智慧終端等領域的複雜任務,從而促進更廣泛的採用。
Stepfun 的開源策略和本地部署選項將使先進的 AI 代理技術民主化。
透過 Hugging Face 和 NVIDIA NIM 的可用性,以及用於在消費級硬體上進行本地託管的 GGUF 量化版本,降低了開發人員和企業的進入門檻。
⏳ 時間線
2023-04
StepFun (上海階躍星辰智能科技有限公司) 成立
2024-12
Stepfun 完成數億美元融資,投資者包括騰訊和上海國有資本投資公司
2025-07
StepFun 在世界人工智能大會上宣布成立「模型-晶片生態創新聯盟」
2026-01
Stepfun 完成約 7.19 億美元的 B+ 輪融資,並任命尹琪為董事長
2026-02
Step-3.5-Flash 模型發布,採用 Apache 2.0 授權
2026-05-28
Stepfun 發布 Step 3.7 Flash 模型
📎 來源 (13)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily ↗
