🤖較早收集於 48m

VLMs 缺少的影片基準測試

PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning

💡發掘 VLM 影片基準缺失—下一代模型評估關鍵(28字元)

⚡ 30-Second TL;DR

有什麼變化

現有基準:VideoMME、MLVU、MVBench、LVBench

為什麼重要

強調需更好真實世界 VLM 基準,以推進影片 AI 研究。

下一步行動

探索 VideoMME 基準並構想物理世界 VLM 測試資料集。

誰應關注:Researchers & Academics

關鍵要點

  • 現有基準:VideoMME、MLVU、MVBench、LVBench
  • 質疑 VLM 影片評估的缺失
  • 物理開放世界資料集構想

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

🔑 增強重點摘要

  • V2P-Bench 引入視覺提示評估 VLMs 的影片理解,涵蓋 12 類別、20 種影片類型及 3 秒至 2 小時長度,強調空間時序細粒度理解。[2]
  • VideoReasonBench 測試視覺中心複雜影片推理,Gemini-2.5-Flash 在標準基準達 65% 準確率,但在此僅 27.4%,需大量思考 token 且高度依賴視覺內容。[3]
  • MotionBench 專注細粒度運動理解,包含六類運動導向問題,現有 VLMs 表現不佳,並提出 Through-Encoder 融合方法優化影片特徵壓縮。[5]

🛠️ 技術深入

  • V2P-Bench 評估時,對 LLaVA-OneVision 等模型平均 128 幀,對 o1 和 GPT-4o 平均 64 幀,Gemini-2.5-Pro 直接上傳原始影片無音軌,視覺提示置於影片後。[2]
  • VideoReasonBench 顯示推理難度分級 1-3 級,Gemini-2.5-Flash 平均消耗逾 7,000 token,表現與思考預算高度相關,且視覺輸入變化影響顯著。[3]
  • MotionBench 使用多樣真實世界影片來源,評估運動層級感知,並透過 TE Fusion 方法在有限 LLM 序列長度內提升細粒度運動理解。[5]

🔮 前景展望AI analysis grounded in cited sources

VLMs 影片基準將轉向視覺提示與細粒度運動評估
V2P-Bench 和 MotionBench 填補文字提示與運動理解缺口,揭示現有模型弱點,推动更全面基準開發。[2][5]
複雜視覺推理需強化思考機制
VideoReasonBench 證明標準基準易達高分但複雜任務僅 27.4%,強調思考預算與視覺依賴對性能關鍵。[3]

時間線

2025-03
V2P-Bench 提出,引入視覺提示評估影片理解
2025-12
MotionBench 發佈,聚焦細粒度運動理解
2026-01
VideoReasonBench 在 ICLR 2026 發表,測試複雜視覺推理
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。