
DeepSeek Harness 新增多模態影像工作流程
DeepSeek Harness v0.1.1 新增 DeepSeek-V4-Flash-Vision-Exp 多模態視覺理解模型的 adapter。此次發布也支援原生影像請求、在 /goal 與 /plan 等指令中輸入影像、透過 MCP/ACP 持續附加影像,以及在 PTC Mode 中轉送巢狀影像。
Tag: #vision-model8 results

DeepSeek Harness v0.1.1 新增 DeepSeek-V4-Flash-Vision-Exp 多模態視覺理解模型的 adapter。此次發布也支援原生影像請求、在 /goal 與 /plan 等指令中輸入影像、透過 MCP/ACP 持續附加影像,以及在 PTC Mode 中轉送巢狀影像。

DeepSeek識圖模式進入灰度釋出,一手實測顯示疑似全新模型。非思考模式速度極快。用戶透過Beta內測獲得存取。

DeepSeek V4 發布僅5天,網頁端已進入灰度測試識圖模式,能理解圖像資訊。使用者可直接上傳截圖,讓DeepSeek分析,比自行描述問題更簡單。它甚至能讀懂CT圖。

Anthropic 推出 Claude Design 研究預覽,由 Opus 4.7 視覺模型驅動,用於生成設計、原型和投影片。使用者可透過提示、對話、內聯編輯和自訂滑桿(如光暈和密度)精煉輸出。它從程式碼庫學習組織視覺風格,並支援匯出至 Canva。

Luma 推出 UNI-1,這是視覺理解與影像生成的統一模型。它合併文字與影像處理來處理推理任務。

針對 MiniMax M3 模型進行實測,測試其在面對複雜的 Nvidia 簡報時的視覺推理能力。實測結果展示了該模型處理與理解高密度視覺資訊的能力。
使用者可透過 Q8_0 mmproj 取代 F16 處理 Gemma 4 26B 的視覺功能,獲得額外 30K 上下文,無品質損失且測試中略有提升。這能以 FP16 快取實現 60K+ 總上下文並保留視覺功能。最近回歸問題的修復即將推出。
即使在官方 API 上,Mistral Small 4 的圖像理解能力也很差,將音樂節誤述為體育場活動。完全錯過音樂家和舞台等關鍵元素。儘管參數較少,Qwen3.5 35B 表現優於它。