🐯虎嗅•最新收集於 28m
DeepSeek 終於擁有視覺能力,但限制仍在

#multimodal#visual-agents#screenshot-to-code#model-evaluationdeepseek-v4-flash-vision-expdeepseekdeepseek-v4-flash-vision-expgeminidoubaoopenai
💡DeepSeek 以極低成本加入視覺能力,但實測揭示了準確度、延遲與可靠性的取捨。
⚡ 30-Second TL;DR
有什麼變化
Vision-Exp 是目前所述 DeepSeek V4 Flash 首個支援原生圖片輸入的變體。
為什麼重要
此次發布補足了 DeepSeek 的重要能力缺口,也讓低成本視覺原型開發更容易取得。不過,開發者不應假設跑分能直接轉化為生產環境可靠性,尤其是在涉及人物辨識或複雜程式開發的工作流程中。
下一步行動
使用 DeepSeek Harness 的原生圖片請求,先以自有截圖、OCR 案例與程式開發任務測試 Vision-Exp,再決定是否切換生產流量。
誰應關注:Developers & AI Engineers
關鍵要點
- •Vision-Exp 是目前所述 DeepSeek V4 Flash 首個支援原生圖片輸入的變體。
- •模型能辨識地點,並描述一般照片中的光線、空間關係與視覺細節。
- •依照截圖重建網頁時,它能還原整體版面,但會簡化圖示、色塊邊緣與小字內容。
- •獨立測試發現模型反覆自我修正、出現斷聯;完成 Three.js 任務時,Token 消耗約高 15 倍、耗時多 3.5 倍。
- •圖片輸入最多按每張 384 個輸入 Token 計算,在高峰價格下約 1 美分可處理 8 張圖片。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 9 個來源。
🔑 增強重點摘要
- •DeepSeek-V4-Flash-Vision-Exp 於 2026 年 8 月 21 日正式發布,作為 DeepSeek-V4-Flash 的多模態分支版本。
- •該模型維持了與 V4-Flash 系列一致的 100 萬 Token 上下文窗口,確保了長文本與視覺資訊的整合能力。
- •DeepSeek 同步更新了開發者工具「DeepSeek Harness」至 0.1.1 版本,以提供對該視覺模型的原生支援。
- •模型支援多種輸入方式,包括 Base64 編碼、外部 URL 連結以及 Files API,並完全相容 Chat Completions 格式。
- •DeepSeek 內部評測宣稱該模型的多模態 Agent 效能可對標 Anthropic 的 Opus 4.8,但目前尚未獲得第三方獨立驗證。
📊 競品分析▸ Show
| 特性/模型 | DeepSeek-V4-Flash-Vision-Exp | Anthropic Opus 4.8 | GPT-4o |
|---|---|---|---|
| 視覺處理 | 原生多模態 (實驗性) | 原生多模態 | 原生多模態 |
| 上下文窗口 | 1M Tokens | 200K+ Tokens | 128K Tokens |
| 定價策略 | 按 Token 計費 (高性價比) | 高階訂閱制 | 按 Token 計費 |
| 核心優勢 | 成本控制與 Agent 整合 | 推理深度與安全性 | 生態系統與多模態穩定性 |
🛠️ 技術深入
- 架構基礎:基於 DeepSeek-V4-Flash 文本模型進行多模態擴充,保留了原有的推理與世界知識能力。
- 視覺編碼:採用固定 Token 限制,每張圖片統一計算為 384 個輸入 Token,以優化計算成本與處理速度。
- API 整合:支援標準化的 Chat Completions 與 Messages/Responses 格式,便於開發者無縫遷移。
- 效能指標:在處理複雜視覺任務時,Token 消耗量與處理時間較純文本模型顯著增加,反映了視覺編碼器的運算開銷。
🔮 前景展望AI analysis grounded in cited sources
DeepSeek 將在 2026 年底前將視覺能力整合至正式版 V4 模型。
基於目前 Vision-Exp 的實驗性質與 API 整合進度,DeepSeek 傾向於透過快速迭代將視覺功能標準化。
視覺 Token 的固定計費模式將引發業界對多模態成本結構的重新評估。
將圖片強制轉換為固定 Token 數量的做法,簡化了開發者的成本預測,可能迫使競爭對手調整計費透明度。
⏳ 時間線
2026-08
發布 DeepSeek-V4-Flash-Vision-Exp 實驗版模型
2026-08
更新 DeepSeek Harness 工具至 0.1.1 版本以支援視覺輸入
📎 來源 (9)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅 ↗
每週 AI 簡報
每週一封,可隨時退訂。
