🐼較早收集於 80m

Stepfun 開源專為 AI Agent 設計的 Step 3.7 Flash 模型

Stepfun 開源專為 AI Agent 設計的 Step 3.7 Flash 模型
PostLinkedIn
🐼閱讀原文: Pandaily

💡專為 AI Agent 工作流程設計,具備原生工具調用能力的高速 196B MoE 模型。

⚡ 30-Second TL;DR

有什麼變化

針對 AI Agent 工作流程優化的 196B 參數稀疏 MoE 架構

為什麼重要

此發布為開發者提供了一個高效能的開源選擇,用於構建反應靈敏的 Agent 系統。其速度與工具調用的專注度可顯著降低即時 AI 應用的延遲。

下一步行動

下載 Step 3.7 Flash 權重,並將其工具調用延遲與您目前的生產模型進行基準測試,以評估潛在的效能提升。

誰應關注:Developers & AI Engineers

關鍵要點

  • 針對 AI Agent 工作流程優化的 196B 參數稀疏 MoE 架構
  • 達到每秒 400 token 的高速推理效能
  • 原生支援複雜的工具調用與 Agent 任務

🧠 深度解析

Web-grounded analysis with 13 cited sources.

🔑 增強重點摘要

  • Step 3.7 Flash 是一款多模態模型,結合了 196B 語言骨幹和 1.8B 視覺編碼器,可實現原生圖像和影片理解,並支援 256K 的上下文視窗。
  • 該模型提供可選的推理級別(低/中/高),開發人員可以根據任務複雜度動態調整速度、成本和推理深度,而無需切換模型。
  • Step 3.7 Flash 在多個代理任務基準測試中表現出色,包括 SWE-bench Verified 達到 74.4%、Terminal-Bench 2.0 達到 51.0%,以及 ClawEval-1.1 領先達到 67.1%。
  • 該模型以每百萬輸入 token 0.20 美元、每百萬輸出 token 1.15 美元的價格提供,在成本效益上與西方中階模型(如 Gemini 2.5 Flash 和 Claude Sonnet 4.6)具有競爭力。
  • 除了透過 API 存取外,Step 3.7 Flash 還提供 GGUF 量化版本,支援在具備 128GB RAM 的硬體上進行本地部署和推理,降低了開發者的進入門檻。
📊 競品分析▸ Show
特性/模型Step 3.7 FlashAnthropic Claude Opus 4.8DeepSeek V4 FlashMistral Devstral 2Qwen3.6-27B
總參數196B (11B 活躍)N/AN/A123B27B
上下文視窗256K tokens1M tokens長上下文256K tokensN/A
輸入價格 (每百萬 token)$0.20$5.00較低N/AN/A
輸出價格 (每百萬 token)$1.15$25.00較低N/AN/A
推理速度400 token/秒N/A更快N/AN/A
SWE-bench Verified74.4% (SWE-bench Pro: 56.26%)N/A55.6% (Flash)72.2% (自報)N/A
Terminal-Bench 2.051.0%N/AN/AN/A59.3% (與 Claude 4.5 Opus 相當)
ClawEval-1.167.1% (領先)N/AN/AN/AN/A
多模態原生圖像/影片理解支援文字、圖像、檔案輸入N/AN/AN/A
工具調用原生支援支援N/A支援N/A

🛠️ 技術深入

  • 模型架構: 稀疏 MoE (Mixture-of-Experts) 架構,總參數為 196B,每個 token 激活約 11B 參數。
  • 多模態能力: 結合 196B 語言骨幹和 1.8B 視覺編碼器,實現原生圖像和影片理解,視覺模組使用 728x728 像素的圖像大小。
  • 上下文視窗: 支援 256K token 的長上下文視窗,採用 3:1 滑動視窗注意力機制以實現成本效益處理。
  • 推理效能: 透過 MTP-3 (Multi-Token Prediction) 加速技術,實現每秒 100-300 token 的吞吐量,編碼任務峰值可達 350 token/秒,整體最高可達 400 token/秒。
  • 推理級別: 提供三種可選的推理級別(低、中、高),可透過 API 參數 (reasoning_effortoutput_config.effort) 進行控制,以平衡速度、成本和推理深度。
  • 軟體整合與硬體支援: 支援 vLLM 和 SGLang 等運行時引擎,並可在 NVIDIA Blackwell (B200, B100, GB200) 和 NVIDIA Hopper (H100, H200) GPU 加速系統上運行。
  • 本地部署: 提供 BF16、Q8_0、Q4_K_S、IQ4_XS、Q3_K_L、Q3_K_M 等 GGUF 量化格式,可在具備 128GB RAM 的硬體上進行本地推理。
  • 授權: 採用 Apache 2.0 開源授權。
  • 優化用途: 專為編碼、代理工作流程、結構化輸出和長上下文生產力任務設計。

🔮 前景展望AI analysis grounded in cited sources

Stepfun 的競爭性定價和功能將加劇中階 AI 代理模型市場的競爭。
其每百萬輸入/輸出 token 0.20 美元/1.15 美元的定價以及與 Gemini 2.5 Flash 和 Claude Sonnet 4.6 等模型相當的功能,提供了一個可信且成本較低的替代方案,可能迫使西方供應商調整定價。
該模型的多模態能力和代理優化將加速複雜 AI 代理在實際應用中的開發和部署。
原生圖像/影片理解、強大的工具調用功能以及在代理基準測試中的出色表現,使其非常適合編碼、金融和智慧終端等領域的複雜任務,從而促進更廣泛的採用。
Stepfun 的開源策略和本地部署選項將使先進的 AI 代理技術民主化。
透過 Hugging Face 和 NVIDIA NIM 的可用性,以及用於在消費級硬體上進行本地託管的 GGUF 量化版本,降低了開發人員和企業的進入門檻。

時間線

2023-04
StepFun (上海階躍星辰智能科技有限公司) 成立
2024-12
Stepfun 完成數億美元融資,投資者包括騰訊和上海國有資本投資公司
2025-07
StepFun 在世界人工智能大會上宣布成立「模型-晶片生態創新聯盟」
2026-01
Stepfun 完成約 7.19 億美元的 B+ 輪融資,並任命尹琪為董事長
2026-02
Step-3.5-Flash 模型發布,採用 Apache 2.0 授權
2026-05-28
Stepfun 發布 Step 3.7 Flash 模型

📎 來源 (13)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. openrouter.ai
  2. nvidia.com
  3. kilo.ai
  4. zenmux.ai
  5. aiweekly.co
  6. huggingface.co
  7. reddit.com
  8. huggingface.co
  9. stepfun.ai
  10. pandaily.com
  11. testingcatalog.com
  12. wikipedia.org
  13. digg.com
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily