🐼Pandaily•近期收集於 39h
DeepSeek 推出開源 V4 視覺模型

#vision-model#image-input#mit-license#model-releasedeepseek-v4-flash-vision-expdeepseekv4-flash-vision-exphugging-face
💡DeepSeek 首個原生視覺模型以 MIT 授權加入 V4 系列影像輸入能力。
⚡ 30-Second TL;DR
有什麼變化
V4-Flash-Vision-Exp 是 DeepSeek 首個原生視覺模型。
為什麼重要
這項發布為開發者提供了可用於建構影像 AI 應用的開放授權 DeepSeek 選項。MIT 授權可能簡化實驗、整合與商業部署,但實際採用仍取決於模型能力與授權條款。
下一步行動
從 Hugging Face 下載 V4-Flash-Vision-Exp,並先與目前使用的視覺模型進行小規模影像理解評測,再決定是否整合。
誰應關注:Developers & AI Engineers
關鍵要點
- •V4-Flash-Vision-Exp 是 DeepSeek 首個原生視覺模型。
- •該模型首次為 DeepSeek V4 系列加入影像輸入功能。
- •模型以寬鬆的 MIT 授權條款發布於 Hugging Face。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 15 個來源。
🔑 增強重點摘要
- •DeepSeek-V4-Flash-Vision-Exp 採用 305B 參數的混合專家模型 (MoE) 架構,並基於現有的 V4-Flash 文字骨幹進行視覺模組擴充。
- •該模型於 2026 年 8 月 21 日首次以 API 實驗性服務形式推出,隨後於 8 月 31 日正式釋出開源權重。
- •在效能表現上,該模型的多模態代理能力被評估與 Claude Opus-4.8 相當,同時保持了與標準 V4-Flash 一致的文字處理水準。
- •技術規格限制影像輸入處理上限為 384 個 Token,開發者在設計複雜視覺工作流時需考量此記憶體與輸入限制。
- •DeepSeek 正積極推動自研 AI 晶片計畫,旨在降低對 NVIDIA 硬體的依賴,以確保長期基礎設施的自主性與成本優勢。
📊 競品分析▸ Show
| 特性 | DeepSeek-V4-Flash-Vision-Exp | Claude Opus-4.8 | GPT-4o |
|---|---|---|---|
| 授權模式 | MIT (開源權重) | 閉源 (API) | 閉源 (API) |
| 參數規模 | 305B (MoE) | 未公開 | 未公開 |
| 視覺處理上限 | 384 Tokens | 未公開 | 未公開 |
| 定價策略 | 低成本/開源 | 高階訂閱/API | 高階訂閱/API |
🛠️ 技術深入
- 架構類型:基於 Mixture-of-Experts (MoE) 的多模態模型。
- 視覺整合:透過專用視覺模組與對齊器 (Aligner) 擴充既有 V4-Flash 文字骨幹。
- 影像處理:影像輸入被限制在 384 個 Token 以內,以優化記憶體佔用。
- 部署彈性:支援本地部署與微調,適用於截圖分析、圖表解讀及多圖比較任務。
🔮 前景展望AI analysis grounded in cited sources
AI 推論成本將持續下探
DeepSeek 透過開源高性能模型與自研晶片策略,正加速推動全球 AI 推論市場的價格競爭。
企業將轉向本地化多模態部署
MIT 授權的 305B 開源模型釋出,降低了企業在隱私敏感場景下部署大型視覺模型的門檻。
⏳ 時間線
2026-08-21
DeepSeek 以實驗性 API 形式發布 V4-Flash-Vision-Exp 模型。
2026-08-31
正式將 V4-Flash-Vision-Exp 模型權重以 MIT 授權條款開源至 Hugging Face。
📎 來源 (15)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily ↗
每週 AI 簡報
每週一封,可隨時退訂。
