🐯最新收集於 28m

DeepSeek 終於擁有視覺能力,但限制仍在

DeepSeek 終於擁有視覺能力,但限制仍在
PostLinkedIn
🐯閱讀原文: 虎嗅
#multimodal#visual-agents#screenshot-to-code#model-evaluationdeepseek-v4-flash-vision-expdeepseekdeepseek-v4-flash-vision-expgeminidoubaoopenai

💡DeepSeek 以極低成本加入視覺能力,但實測揭示了準確度、延遲與可靠性的取捨。

⚡ 30-Second TL;DR

有什麼變化

Vision-Exp 是目前所述 DeepSeek V4 Flash 首個支援原生圖片輸入的變體。

為什麼重要

此次發布補足了 DeepSeek 的重要能力缺口,也讓低成本視覺原型開發更容易取得。不過,開發者不應假設跑分能直接轉化為生產環境可靠性,尤其是在涉及人物辨識或複雜程式開發的工作流程中。

下一步行動

使用 DeepSeek Harness 的原生圖片請求,先以自有截圖、OCR 案例與程式開發任務測試 Vision-Exp,再決定是否切換生產流量。

誰應關注:Developers & AI Engineers

關鍵要點

  • Vision-Exp 是目前所述 DeepSeek V4 Flash 首個支援原生圖片輸入的變體。
  • 模型能辨識地點,並描述一般照片中的光線、空間關係與視覺細節。
  • 依照截圖重建網頁時,它能還原整體版面,但會簡化圖示、色塊邊緣與小字內容。
  • 獨立測試發現模型反覆自我修正、出現斷聯;完成 Three.js 任務時,Token 消耗約高 15 倍、耗時多 3.5 倍。
  • 圖片輸入最多按每張 384 個輸入 Token 計算,在高峰價格下約 1 美分可處理 8 張圖片。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

🔑 增強重點摘要

  • DeepSeek-V4-Flash-Vision-Exp 於 2026 年 8 月 21 日正式發布,作為 DeepSeek-V4-Flash 的多模態分支版本。
  • 該模型維持了與 V4-Flash 系列一致的 100 萬 Token 上下文窗口,確保了長文本與視覺資訊的整合能力。
  • DeepSeek 同步更新了開發者工具「DeepSeek Harness」至 0.1.1 版本,以提供對該視覺模型的原生支援。
  • 模型支援多種輸入方式,包括 Base64 編碼、外部 URL 連結以及 Files API,並完全相容 Chat Completions 格式。
  • DeepSeek 內部評測宣稱該模型的多模態 Agent 效能可對標 Anthropic 的 Opus 4.8,但目前尚未獲得第三方獨立驗證。
📊 競品分析▸ Show
特性/模型DeepSeek-V4-Flash-Vision-ExpAnthropic Opus 4.8GPT-4o
視覺處理原生多模態 (實驗性)原生多模態原生多模態
上下文窗口1M Tokens200K+ Tokens128K Tokens
定價策略按 Token 計費 (高性價比)高階訂閱制按 Token 計費
核心優勢成本控制與 Agent 整合推理深度與安全性生態系統與多模態穩定性

🛠️ 技術深入

  • 架構基礎:基於 DeepSeek-V4-Flash 文本模型進行多模態擴充,保留了原有的推理與世界知識能力。
  • 視覺編碼:採用固定 Token 限制,每張圖片統一計算為 384 個輸入 Token,以優化計算成本與處理速度。
  • API 整合:支援標準化的 Chat Completions 與 Messages/Responses 格式,便於開發者無縫遷移。
  • 效能指標:在處理複雜視覺任務時,Token 消耗量與處理時間較純文本模型顯著增加,反映了視覺編碼器的運算開銷。

🔮 前景展望AI analysis grounded in cited sources

DeepSeek 將在 2026 年底前將視覺能力整合至正式版 V4 模型。
基於目前 Vision-Exp 的實驗性質與 API 整合進度,DeepSeek 傾向於透過快速迭代將視覺功能標準化。
視覺 Token 的固定計費模式將引發業界對多模態成本結構的重新評估。
將圖片強制轉換為固定 Token 數量的做法,簡化了開發者的成本預測,可能迫使競爭對手調整計費透明度。

時間線

2026-08
發布 DeepSeek-V4-Flash-Vision-Exp 實驗版模型
2026-08
更新 DeepSeek Harness 工具至 0.1.1 版本以支援視覺輸入

📎 來源 (9)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. deepseek.com
  2. writingmate.ai
  3. edgex.exchange
  4. medium.com
  5. deepseek.com
  6. openrouter.ai
  7. digitalapplied.com
  8. caixinglobal.com
  9. github.io
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。