最新收集於 10h

DeepSeek V4 開放多模態視覺鏈路

DeepSeek V4 開放多模態視覺鏈路
PostLinkedIn
閱讀原文: 雷峰网
#vision-encoder#moe-routing#gui-agents#long-contextdeepseek-v4deepseekdeepseek-v4

💡了解 DeepSeek 如何將圖片 Token 直接嵌入 Attention、MoE 路由與 Agent 推理。

⚡ 30-Second TL;DR

有什麼變化

V4 採用 32 層 ViT,具備 1024 維嵌入、16 個 Attention Head、14×14 Patch,並以二維 RoPE 建模空間關係。

為什麼重要

這次發布讓研究者與開發者少見地能直接檢視大型多模態模型從視覺到語言的完整整合流程。其設計對 GUI Agent 與長上下文應用尤其重要,因為這些場景高度依賴空間關係、Token 預算與重複螢幕觀察。

下一步行動

下載 DeepSeek V4 權重與參考推理程式碼,並在 GUI Agent 原型中分析 384 Token 圖片預算與圖片專用 Attention 行為。

誰應關注:Researchers & Academics

關鍵要點

  • V4 採用 32 層 ViT,具備 1024 維嵌入、16 個 Attention Head、14×14 Patch,並以二維 RoPE 建模空間關係。
  • Aligner 將相鄰 3×3 個視覺特徵合併,再把 9216 維輸入映射至 V4 語言空間的 4096 維,讓視覺網格縮減至約九分之一。
  • 每張圖片最多轉換為 384 個語言側視覺 Token,這直接控制 Agent 工作流程中重複觀察所增加的上下文與計算成本。
  • 視覺 Token 保留特殊識別標記,並使用圖片專用的 Attention 可見範圍規則,讓截圖中相距較遠的區域能突破一般 128 Token 局部視窗互動。
  • 視覺序列會加入圖片邊界、Padding、行交織與四 Token 對齊,以更適配 V4 著重壓縮的主幹架構。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 12 個來源。

🔑 增強重點摘要

  • DeepSeek 於 2026 年 8 月 21 日正式發布了 DeepSeek-V4-Flash-Vision-Exp 實驗性多模態模型,並採用 MIT 許可證開源模型權重。
  • 該視覺架構在記憶體效率上極具優勢,每張圖片僅需約 90 個 KV 快取條目,效率較同類視覺模型提升約 10 倍。
  • V4-Flash-Vision-Exp 繼承了 V4-Flash 的 284B 參數 MoE 架構,在保持純文字推理與程式編寫能力不變的前提下,顯著提升了視覺代理任務的表現。
  • DeepSeek V4 系列於 2026 年 4 月推出,包含 1.6T 參數的 V4-Pro 與 284B 參數的 V4-Flash,全系列支援 100 萬 Token 的超長上下文窗口。
  • V4-Pro 版本已於 2026 年 8 月 13 日正式進入一般可用性(GA)階段,並強化了工具使用能力與原生 Responses API 支援。
📊 競品分析▸ Show
特性DeepSeek V4-Flash-VisionGPT-5.5Claude Opus 4.8
視覺效率高 (90 KV/圖)
參數規模284B (MoE)未公開未公開
授權模式MIT 開源閉源閉源
定價策略高性價比高價位高價位

🛠️ 技術深入

  • 採用 305B 參數的混合專家模型 (MoE) 架構,整合專用視覺編碼器與對齊器。
  • 支援 100 萬 Token 上下文窗口,結合壓縮稀疏注意力與重度壓縮注意力機制。
  • 視覺處理模組針對 Agent 工作流程優化,實現視覺 Token 與語言空間的高效映射。
  • 具備針對截圖與複雜圖表理解的特殊 Attention 可見範圍規則,突破局部視窗限制。

🔮 前景展望AI analysis grounded in cited sources

DeepSeek 將進一步降低多模態 Agent 的部署門檻。
其極高的 KV 快取效率與開源策略,將使邊緣端與中小型企業能以更低成本運行複雜的視覺代理任務。
V4 系列將成為企業級自動化工作流的主流選擇。
隨著 V4-Pro 的 GA 發布及對 Responses API 的原生支援,該模型在穩定性與工具整合度上已具備大規模商業部署條件。

時間線

2026-04
DeepSeek V4 系列正式發布,包含 V4-Pro 與 V4-Flash。
2026-08-13
DeepSeek V4-Pro 進入一般可用性(GA)階段。
2026-08-21
發布 DeepSeek-V4-Flash-Vision-Exp 多模態實驗模型。

📎 來源 (12)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. deepseek.com
  2. emergent.sh
  3. reddit.com
  4. lightning.ai
  5. mindstudio.ai
  6. flowtivity.ai
  7. huggingface.co
  8. huggingface.co
  9. datacamp.com
  10. cometapi.com
  11. mashable.com
  12. teamai.com
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 雷峰网

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。