
Apple 推出 VICIS 以提升視覺概念推理能力
Apple 研究人員推出了 Visual Concept Inference from Sets (VICIS),這是一項旨在評估視覺語言模型從少量圖像集中推斷共享概念能力的新任務。研究顯示,目前的頂尖模型在將這些視覺概念應用於新的、未見過的輸入時表現不佳。
Tag: #vlm20 results

Apple 研究人員推出了 Visual Concept Inference from Sets (VICIS),這是一項旨在評估視覺語言模型從少量圖像集中推斷共享概念能力的新任務。研究顯示,目前的頂尖模型在將這些視覺概念應用於新的、未見過的輸入時表現不佳。

FeynRL 提供了一個簡化的流程,透過貪食蛇遊戲示範如何構建與訓練視覺語言模型,旨在讓大型模型的端到端訓練過程更易於理解。

Netflix 推出影片語言模型,能在移除場景元素時調整物件互動,從而編輯影片。此工具有望改變電影製作,例如無縫修改如車禍等高風險動作場面。這標誌 Netflix 進軍 AI 內容創作領域。

由 Visincept、清華大學及 IDEA 開發的 SpatialPoint 框架,將深度資料作為視覺語言模型 (VLM) 的核心輸入。此進展讓機器人能產生精準 3D 座標。適用於需空間精度的複雜機器人任務。
這是一場關於目前最佳開源視覺語言模型 (VLM) 的社群討論。開發者們正分享其硬體配置與應用場景,以應對 VLM 評估中缺乏標準與工具不成熟的挑戰。

長城魏牌V9X為歸元S平台首款車,預售37.18-41.18萬元,5月18日上市。搭載AI智能體座艙,基於OMS+VLM雙感知與Loffee EEA 4.0,提供識人、記事、懂情緒能力。配超級Hi4混動,0-100km/h加速4.4秒、空氣懸架。
為在 VLM/臉部嵌入前攔截反向自拍,提議在文字裁剪上用 EasyOCR:正常 vs 翻轉得分較高。Qwen/Florence 等 VLM 因翻轉增強訓練而掙扎。詢問更好小型模型替代。
文章分析 VLMs 在 Video-MME 和 LongVideoBench 等長影片資料集表現,多選題任務強但開放式多步推理失敗。提供 4 選項時達 100% 正確率,無選項則無法回答。探討長影片理解的真實行為。
使用者正在探索透過 Ollama 使用 qwen3-vl:8b 進行手寫信件的 OCR 辨識,並尋求社群推薦更佳的替代方案。
視覺語言模型機制解釋性論文(注意力頭、logit lens、因果干預)瞄準 ACL 2026。混淆特殊「NLP 模型可解釋性」主題賽道與標準「模型解釋與分析」賽道。尋求差異與競爭力建議。