🦙最新收集於 4h

DeepSeek Harness 新增多模態影像工作流程

DeepSeek Harness 新增多模態影像工作流程
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#multimodal-agents#vision-model#developer-tools#image-workflowsdeepseek-harnessdeepseek harnessdeepseek-v4-flash-vision-expmcpacp

💡打造能在目標、規劃、工作階段、MCP/ACP 與巢狀工具呼叫間保留並傳遞影像的代理。

⚡ 30-Second TL;DR

有什麼變化

新增 DeepSeek-V4-Flash-Vision-Exp 多模態 adapter

為什麼重要

此次發布讓 DeepSeek Harness 更適合需要結合視覺脈絡、規劃、目標、檔案與持續工作階段的代理。開發者可建立更豐富的多模態工作流程,而不必在應用程式層自行處理每個影像附件。

下一步行動

安裝 DeepSeek Harness v0.1.1-rc.1,並使用 DeepSeek-V4-Flash-Vision-Exp adapter 建立一個支援影像理解的 /plan 工作流程原型。

誰應關注:Developers & AI Engineers

關鍵要點

  • 新增 DeepSeek-V4-Flash-Vision-Exp 多模態 adapter
  • 支援原生影像請求,以及在 /goal 和 /plan 中輸入影像
  • @ 選單可引用檔案與工作階段
  • MCP/ACP 支援持續附加影像
  • PTC Mode 可轉送巢狀影像

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 16 個來源。

🔑 增強重點摘要

  • DeepSeek Harness v0.1.0-rc.8 引入了全新的 Files API,允許開發者透過 file_id 引用已上傳影像,藉此優化多輪對話中的頻寬使用效率。
  • DeepSeek-V4-Flash-Vision-Exp 模型在多模態代理基準測試中的表現已接近 Anthropic 的 Opus-4.8 模型水準。
  • DeepSeek Harness 採用「一切皆插件」的架構設計,並將 Claude Code 與 Codex 等工具轉移至可選的 Profile Bundles,以提升系統模組化程度。
  • 最新更新解決了先前因影像尺寸過大或多輪對話中影像負載累積導致的系統不穩定問題。
  • DeepSeek 透過其 Harness 框架與 V4-Flash 系列模型,在成本效益上展現出顯著優勢,據稱運行成本比旗艦級競爭對手低 30 至 100 倍。
📊 競品分析▸ Show
特性DeepSeek HarnessAnthropic (Claude Code)OpenAI (Codex)
架構插件式模組化整合式代理整合式代理
成本效益極高 (低 30-100x)中等中等
多模態支援原生影像請求與巢狀轉送支援支援
開源狀態開源框架閉源閉源

🛠️ 技術深入

  • 採用插件式架構 (Plugin-based architecture),允許模型、工具與介面動態替換。
  • 實作 Files API 進行影像資源管理,透過 file_id 進行快取與引用。
  • 支援 PTC (Pass-Through Control) Mode,可處理複雜的巢狀影像結構。
  • 針對長序列多模態對話進行記憶體優化,解決歷史影像負載累積問題。

🔮 前景展望AI analysis grounded in cited sources

DeepSeek 將成為開源代理框架市場的主導者
其極高的成本效益與模組化插件架構,能有效降低開發者部署複雜代理工作流的門檻。
多模態代理將成為企業自動化標準
隨著原生影像請求與持續附加影像功能的成熟,代理將能更精準地處理螢幕截圖與視覺化工作流程。

時間線

2026-08-13
DeepSeek Harness 公開測試版正式發布
2026-08-19
發布 DeepSeek Harness v0.1.0-rc.8,引入多模態支援與 Files API
2026-08-21
DeepSeek Harness v0.1.1 釋出,正式整合 DeepSeek-V4-Flash-Vision-Exp 轉接器
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。

DeepSeek Harness Adds Multimodal Image Workflows | Reddit r/LocalLLaMA | SetupAI | SetupAI