🏕️极客公园•最新收集於 8m
DeepSeek 新增多模態視覺 API

#multimodal-api#agent-workflows#screenshot-to-codedeepseek-v4-flash-vision-expdeepseekdeepseek-v4-flash-vision-expfiles-apiclaudeopus-4.8
💡DeepSeek 的低 token 視覺 API 能把截圖變成遊戲與 HTML,但必須避開 thinking 模式陷阱。
⚡ 30-Second TL;DR
有什麼變化
V4-Flash-Vision-Exp 已透過 API 提供服務,支援 base64、外部 URL 與 Files API 圖片輸入。
為什麼重要
這次發布降低了開發者打造可理解畫面、圖片與設計稿之 Agent 的門檻,同時維持相對低的圖片 token 成本。不過,thinking 模式反覆吞噬輸出預算,對生產環境工作流程仍構成重要風險。
下一步行動
使用 model='deepseek-v4-flash-vision-exp' 建立截圖轉 HTML 原型,透過 Files API 重複引用圖片,並將 reasoning_effort 設為 "none" 以避免空白回應。
誰應關注:Developers & AI Engineers
關鍵要點
- •V4-Flash-Vision-Exp 已透過 API 提供服務,支援 base64、外部 URL 與 Files API 圖片輸入。
- •每張圖片最多使用 384 個 token,沿用 V4-Flash 定價,圖片處理成本可能低於 GPT 與 Claude 的同類功能。
- •DeepSeek 表示其文字、Agent、推理與世界知識能力維持 V4-Flash 水準,多模態 Agent 表現接近 Opus-4.8。
- •Files API 允許開發者上傳圖片一次,之後透過 file_id 重複引用,無需在每次請求中重新傳輸。
- •實測中,模型在 36 秒內根據圖片生成可玩的 HTML 遊戲,並在 26 秒內將設計截圖轉為響應式 Landing Page。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 10 個來源。
🔑 增強重點摘要
- •DeepSeek-V4-Flash-Vision-Exp 於 2026 年 8 月 21 日正式發布,作為實驗性模型擴展了現有的 API 平台。
- •該模型支援多種圖片格式,包括 JPEG、PNG、GIF 與 WebP,並針對圖表分析、截圖解讀與文件解析進行了優化。
- •模型架構與 DeepSeek Harness (v0.1.1) 框架完全相容,開發者可直接透過標準 API 協議進行整合。
- •DeepSeek 官方明確指出該模型目前處於實驗階段(-exp),建議開發者在部署至關鍵生產環境前進行穩定性驗證。
- •圖片處理採用固定 token 上限機制,無論原始解析度為何,每張圖片均被限制在 384 個計費 token 以內,確保成本可預測性。
📊 競品分析▸ Show
| 特性 | DeepSeek-V4-Flash-Vision-Exp | Anthropic Opus-4.8 | OpenAI GPT-4o |
|---|---|---|---|
| 多模態能力 | 實驗性 Agent 導向 | 成熟生產級 | 成熟生產級 |
| 定價策略 | 與文字版 V4-Flash 相同 | 高階定價 | 中高階定價 |
| 圖片處理 | 固定 384 token 上限 | 動態計費 | 動態計費 |
| 核心優勢 | 高性價比、Files API 整合 | 推理深度與複雜任務 | 生態系完整度與多樣性 |
🛠️ 技術深入
- 模型架構:基於 V4-Flash 基礎架構整合視覺編碼器,實現文字與視覺輸入的聯合處理。
- 輸入處理:支援 base64 編碼、外部 URL 以及透過 Files API 進行 file_id 引用,有效降低頻寬消耗。
- 視覺編碼:採用固定 token 預算機制(384 tokens/image),透過統一的視覺特徵映射層將圖片資訊嵌入模型潛在空間。
- 整合框架:原生支援 DeepSeek Harness v0.1.1,確保與現有 Chat Completions 與 Messages API 協議的無縫對接。
🔮 前景展望AI analysis grounded in cited sources
DeepSeek 將在 2026 年底前將 Vision-Exp 轉為正式生產版本。
基於其目前已整合至 Files API 並維持與 V4-Flash 一致的定價策略,顯示其已具備商業化部署的基礎。
多模態 Agent 的 API 呼叫成本將成為 2026 年下半年的市場競爭關鍵。
DeepSeek 透過固定 token 計費與 Files API 降低了視覺任務的門檻,將迫使競爭對手調整其多模態 API 的定價結構。
⏳ 時間線
2026-08
發布 DeepSeek-V4-Flash-Vision-Exp,正式引入多模態視覺理解能力。
📎 來源 (10)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 极客公园 ↗
每週 AI 簡報
每週一封,可隨時退訂。


