
Claude Opus 4.7登場:難關編碼全權委託,影像解析度超3倍
Anthropic 推出 Claude Opus 4.7,相較 Opus 4.6,大幅強化軟體開發能力,難關編碼達「全權委託」水準。影像辨識解析度超前代3倍以上。指示忠實度及長時間任務穩定性亦獲提升。
Tag: #vision18 results

Anthropic 推出 Claude Opus 4.7,相較 Opus 4.6,大幅強化軟體開發能力,難關編碼達「全權委託」水準。影像辨識解析度超前代3倍以上。指示忠實度及長時間任務穩定性亦獲提升。

微軟推出開源權重 Phi-4 15B 多模態模型,其獨特之處在於能自行決定何時深入思考或直接回答。擁有 150 億參數,專為影像描述、介面元素辨識與複雜數學推理等高難度任務設計。

中國 AI 新創 DeepSeek 為其旗艦聊天機器人新增多模態功能,能處理圖像與影片,結合文字。該首次功能限特定用戶測試,繼 V4 模型推出與大幅降價後。使 DeepSeek 與具視覺功能的競爭對手看齊。

Together AI 已擴展其微調服務,新增工具呼叫、推理及視覺語言模型的原生支援。現在支援 100B+ 參數模型訓練,提供最高 6 倍吞吐量,並附工作成本與 ETA 估計。
開發者發布具視覺的去安全化 Qwen3.5-9B,使用二階段正交投影 + LoRA 方法達 0% 拒絕率。優於 heretic 版的 46% 拒絕。Ollama 與 Hugging Face 模型卡可用。
Reddit 貼文詳細說明如何在 opencode 中使用 llama.cpp 啟用 Qwen 3.5 的多模態圖像理解。使用者需在 opencode.json 檔案中新增「modalities」設定,指定文字與圖像輸入。這可讓 35B 模型在本地運行視覺功能。

美團推進原生多模態,將圖像與語音視為 Token 進行預測。此方法宣稱離散視覺無性能天花板。大膽策略實現統一 Token 建模。

AWS 整合 Amazon S3 通用儲存桶與 SageMaker Unified Studio,便利 ML 工作流程中使用非結構化資料。本文示範使用 SageMaker Catalog 微調 Llama 3.2 11B Vision Instruct 進行視覺問答。簡化 S3 儲存資料的 LLM 訓練。

北大王選所彭宇新團隊的 TARA 將多模態表徵與分類學知識對齊,用於層級視覺識別。iNat21 HCA 提升 3-6%,TerraIncognita 未知物種強效。改善 VQA 與線性探針;CVPR 2026。
實驗測試4款前沿多模態模型,使用僅圖像或圖像+元數據來評估15幅總值14.6億美元的畫作。發現「辨識 vs 承諾差距」:模型能從視覺辨識藝術,但無文字時猶豫估值。Gemini 3.1 Pro 在兩情境皆最強;GPT-5.4 加元數據後大幅改善。