來源最新收集於 13h

DeepSeek V4.1 Flash 主打更快、更便宜的 AI

閱讀原文: SCMP Technology
#mixture-of-experts#inference-cost#coding-benchmarks

全新 5,520 億參數 MoE 模型宣稱以更低推理成本提供更強的程式設計與資安效能。

30 秒速覽

有什麼變化

DeepSeek 宣稱 V4.1 Flash 在資安與程式設計基準測試中擊敗 Kimi K3

為什麼重要

若經獨立驗證,這項發布可能加劇中國基礎模型供應商之間的競爭,並進一步壓低推理價格。開發者可能獲得更適合程式設計與資安工作負載的高速選項。

下一步行動

在切換正式流量前,使用你的程式碼資料集比較 V4.1 Flash 與現有模型的延遲、成本及專案層級任務準確率。

誰應關注:Developers & AI Engineers

關鍵要點

  • DeepSeek 宣稱 V4.1 Flash 在資安與程式設計基準測試中擊敗 Kimi K3
  • 模型採用全新的 Causal-Encoder-Decoder 架構
  • 5,520 億參數的 MoE 設計旨在提升效率與速度
關鍵數字80 億160 億100 萬8%

深度解析

背景與延伸:來自公開資料,非原文內容。引用 12 個來源。

增強重點摘要

  • DeepSeek 將自 2026 年 9 月 14 日起將深層 API deepseek-v4-pro 的請求自動重定向至 V4.1-Flash,並以較低的 Flash 價格計費,直至 V4.1-Pro 推出。
  • 該模型採用非對稱運算機制,輸入預填充(prefill)每 token 僅激活 80 億參數,輸出解碼(decode)每 token 僅激活 160 億參數。
  • 原生支援視覺理解與高達 100 萬 token 的超長上下文窗口,並將鍵值快取(KV cache)空間壓縮至每 token 僅 890 位元組。
  • 推動極具破壞力的離峰 API 計費機制,快取命中輸入降至每百萬 token 0.003 美元,未快取輸入為 0.15 美元,輸出為 0.60 美元。
  • 此發表導致香港上市的中國 AI 競爭對手 MiniMax 與 Z.ai 股價暴跌逾 8%,且該發布適逢 DeepSeek 籌備於上海證券交易所科創板(STAR Market)IPO 之際。

競品分析

DeepSeek V4.1 Flash
參數量 / 架構核心
5,520 億 MoE 主幹 + 1,960 億 Engram 參數(Prefill 激活 8B / Decode 激活 16B)
上下文窗口與吞吐速度
100 萬 Token;速度達 200–400+ tokens/s
API 定價 (每百萬 Token)
快取輸入 $0.003 / 輸入 $0.15 / 輸出 $0.60
基準測試優勢
資安與程式碼評測超越 Kimi K3 及前代旗艦 V4-Pro
Moonshot Kimi K3
參數量 / 架構核心
未公開(主力商業 MoE 旗艦架構)
上下文窗口與吞吐速度
長上下文支援(常規長文本模型)
API 定價 (每百萬 Token)
業界標準旗艦價格區間
基準測試優勢
曾為中國長文本與程式碼處理標竿,但在資安與特定程式評測中落後 V4.1 Flash
DeepSeek V4-Pro (前代)
參數量 / 架構核心
前代高密度密集/MoE 旗艦架構
上下文窗口與吞吐速度
標準上下文,吞吐速度較低
API 定價 (每百萬 Token)
原較高旗艦定價(即將由 Flash 依優惠價自動代管)
基準測試優勢
先前為主力旗艦,但推理運算成本與單價顯著高於 V4.1 Flash

技術深入

  • Causal-Encoder-Decoder (CED) 架構:採用新型因果編碼-解碼設計,包含 5,520 億主幹參數,並整合額外 1,960 億參數的 Engram 記憶模組。
  • 非對稱運算資源分配:專為高吞吐量輸入與 Agent 工具調用最佳化,輸入預填充(prefill)階段每 token 僅激活 80 億參數,輸出解碼(decode)階段每 token 僅激活 160 億參數。
  • 超低 KV Cache 記憶體佔用:支援原生視覺與多模態理解,上下文長度擴展至 100 萬 token,且成功將 KV Cache 佔用量壓低至每 token 僅 890 bytes。
  • 超高速服務吞吐量:專門針對即時 AI Agent 與多輪對話工作流程進行調校,系統服務速率可穩定突破每秒 200 至 400 token 以上。

前景展望基於引用來源的 AI 分析

企業級 AI Agent 與自動化工具工作流將全面轉向超低延遲 MoE 模型
每秒 200–400 token 的生成速度搭配每百萬 token 僅 0.003 美元的快取讀取定價,徹底打破了過往自主 Agent 高頻呼叫的延遲與成本瓶頸。
中國本土生成式 AI 市場將面臨新一輪激烈的利潤壓縮與估值修正
DeepSeek 極端激進的定價策略已引發二級市場同業股價重挫,迫使 MiniMax 及商湯等競品必須跟進降價或重構架構以維持市佔率。

時間線

2026-04
DeepSeek 首次對外預覽全新 V4 系列模型架構
2026-07
DeepSeek 正式推出 2,840 億參數的 V4-Flash 模型
2026-08
因推理需求暴增導致運算資源吃緊,DeepSeek 發出 API 調價警訊
2026-09
DeepSeek 正式發表 V4.1 Flash,同步啟動上海科創板上市籌備

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: SCMP Technology

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。