來源SCMP Technology•最新收集於 13h
DeepSeek V4.1 Flash 主打更快、更便宜的 AI

#mixture-of-experts#inference-cost#coding-benchmarksdeepseek-v4.1-flashdeepseekdeepseek v4.1 flashkimi k3
全新 5,520 億參數 MoE 模型宣稱以更低推理成本提供更強的程式設計與資安效能。
30 秒速覽
有什麼變化
DeepSeek 宣稱 V4.1 Flash 在資安與程式設計基準測試中擊敗 Kimi K3
為什麼重要
若經獨立驗證,這項發布可能加劇中國基礎模型供應商之間的競爭,並進一步壓低推理價格。開發者可能獲得更適合程式設計與資安工作負載的高速選項。
下一步行動
在切換正式流量前,使用你的程式碼資料集比較 V4.1 Flash 與現有模型的延遲、成本及專案層級任務準確率。
誰應關注:Developers & AI Engineers
關鍵要點
- •DeepSeek 宣稱 V4.1 Flash 在資安與程式設計基準測試中擊敗 Kimi K3
- •模型採用全新的 Causal-Encoder-Decoder 架構
- •5,520 億參數的 MoE 設計旨在提升效率與速度
關鍵數字80 億160 億100 萬8%
深度解析
背景與延伸:來自公開資料,非原文內容。引用 12 個來源。
增強重點摘要
- •DeepSeek 將自 2026 年 9 月 14 日起將深層 API deepseek-v4-pro 的請求自動重定向至 V4.1-Flash,並以較低的 Flash 價格計費,直至 V4.1-Pro 推出。
- •該模型採用非對稱運算機制,輸入預填充(prefill)每 token 僅激活 80 億參數,輸出解碼(decode)每 token 僅激活 160 億參數。
- •原生支援視覺理解與高達 100 萬 token 的超長上下文窗口,並將鍵值快取(KV cache)空間壓縮至每 token 僅 890 位元組。
- •推動極具破壞力的離峰 API 計費機制,快取命中輸入降至每百萬 token 0.003 美元,未快取輸入為 0.15 美元,輸出為 0.60 美元。
- •此發表導致香港上市的中國 AI 競爭對手 MiniMax 與 Z.ai 股價暴跌逾 8%,且該發布適逢 DeepSeek 籌備於上海證券交易所科創板(STAR Market)IPO 之際。
競品分析
DeepSeek V4.1 Flash
- 參數量 / 架構核心
- 5,520 億 MoE 主幹 + 1,960 億 Engram 參數(Prefill 激活 8B / Decode 激活 16B)
- 上下文窗口與吞吐速度
- 100 萬 Token;速度達 200–400+ tokens/s
- API 定價 (每百萬 Token)
- 快取輸入 $0.003 / 輸入 $0.15 / 輸出 $0.60
- 基準測試優勢
- 資安與程式碼評測超越 Kimi K3 及前代旗艦 V4-Pro
Moonshot Kimi K3
- 參數量 / 架構核心
- 未公開(主力商業 MoE 旗艦架構)
- 上下文窗口與吞吐速度
- 長上下文支援(常規長文本模型)
- API 定價 (每百萬 Token)
- 業界標準旗艦價格區間
- 基準測試優勢
- 曾為中國長文本與程式碼處理標竿,但在資安與特定程式評測中落後 V4.1 Flash
DeepSeek V4-Pro (前代)
- 參數量 / 架構核心
- 前代高密度密集/MoE 旗艦架構
- 上下文窗口與吞吐速度
- 標準上下文,吞吐速度較低
- API 定價 (每百萬 Token)
- 原較高旗艦定價(即將由 Flash 依優惠價自動代管)
- 基準測試優勢
- 先前為主力旗艦,但推理運算成本與單價顯著高於 V4.1 Flash
| 模型名稱 | 參數量 / 架構核心 | 上下文窗口與吞吐速度 | API 定價 (每百萬 Token) | 基準測試優勢 |
|---|---|---|---|---|
| DeepSeek V4.1 Flash | 5,520 億 MoE 主幹 + 1,960 億 Engram 參數(Prefill 激活 8B / Decode 激活 16B) | 100 萬 Token;速度達 200–400+ tokens/s | 快取輸入 $0.003 / 輸入 $0.15 / 輸出 $0.60 | 資安與程式碼評測超越 Kimi K3 及前代旗艦 V4-Pro |
| Moonshot Kimi K3 | 未公開(主力商業 MoE 旗艦架構) | 長上下文支援(常規長文本模型) | 業界標準旗艦價格區間 | 曾為中國長文本與程式碼處理標竿,但在資安與特定程式評測中落後 V4.1 Flash |
| DeepSeek V4-Pro (前代) | 前代高密度密集/MoE 旗艦架構 | 標準上下文,吞吐速度較低 | 原較高旗艦定價(即將由 Flash 依優惠價自動代管) | 先前為主力旗艦,但推理運算成本與單價顯著高於 V4.1 Flash |
技術深入
- Causal-Encoder-Decoder (CED) 架構:採用新型因果編碼-解碼設計,包含 5,520 億主幹參數,並整合額外 1,960 億參數的 Engram 記憶模組。
- 非對稱運算資源分配:專為高吞吐量輸入與 Agent 工具調用最佳化,輸入預填充(prefill)階段每 token 僅激活 80 億參數,輸出解碼(decode)階段每 token 僅激活 160 億參數。
- 超低 KV Cache 記憶體佔用:支援原生視覺與多模態理解,上下文長度擴展至 100 萬 token,且成功將 KV Cache 佔用量壓低至每 token 僅 890 bytes。
- 超高速服務吞吐量:專門針對即時 AI Agent 與多輪對話工作流程進行調校,系統服務速率可穩定突破每秒 200 至 400 token 以上。
前景展望基於引用來源的 AI 分析
企業級 AI Agent 與自動化工具工作流將全面轉向超低延遲 MoE 模型
每秒 200–400 token 的生成速度搭配每百萬 token 僅 0.003 美元的快取讀取定價,徹底打破了過往自主 Agent 高頻呼叫的延遲與成本瓶頸。
中國本土生成式 AI 市場將面臨新一輪激烈的利潤壓縮與估值修正
DeepSeek 極端激進的定價策略已引發二級市場同業股價重挫,迫使 MiniMax 及商湯等競品必須跟進降價或重構架構以維持市佔率。
時間線
2026-04
DeepSeek 首次對外預覽全新 V4 系列模型架構
2026-07
DeepSeek 正式推出 2,840 億參數的 V4-Flash 模型
2026-08
因推理需求暴增導致運算資源吃緊,DeepSeek 發出 API 調價警訊
2026-09
DeepSeek 正式發表 V4.1 Flash,同步啟動上海科創板上市籌備
- 2026-04DeepSeek 首次對外預覽全新 V4 系列模型架構
- 2026-07DeepSeek 正式推出 2,840 億參數的 V4-Flash 模型
- 2026-08因推理需求暴增導致運算資源吃緊,DeepSeek 發出 API 調價警訊
- 2026-09DeepSeek 正式發表 V4.1 Flash,同步啟動上海科創板上市籌備
來源 (12)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
1Deepseek Unveils V4 1 Flash Model with Architectural Upgrades Price Cuts Ahead of Shanghai IPOtechstrong.ai2ycombinator.comnews.ycombinator.com3economictimes.comm.economictimes.com4Deepseekscmp.com5Deepseek Signals Significant Price Hike Amid Surge Demand Low Cost AI Modelsscmp.com6Deepseek V4.1 Flashhuggingface.co7Watchyoutube.com8Deepseek V4.1 Flashopenrouter.ai9Deepseek V4 Flash Cheapest AI Model Benchmark 080326qz.com10Deepseek V4p1 Flashfireworks.ai11IPO Bound Deepseek Launches V4 1 Flash As Smallest Model in New AI Architecture 12029513ndtvprofit.com12Deepseek S V4 1 Flash Cranks Up the AI Price War Charging Unbriefs.co
AI 週報
閱讀本週精選 AI 大事摘要 →
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: SCMP Technology ↗
每週電子報
每週一封,可隨時退訂。

