📄較早收集於 5h

StoryTR:心智理論敘事影片時間檢索

StoryTR:心智理論敘事影片時間檢索
PostLinkedIn
📄閱讀原文: ArXiv AI

💡新 ToM 基準揭影片 AI 敘事缺口;7B 模型勝 Gemini 15%(62字)

⚡ 30-Second TL;DR

有什麼變化

StoryTR 基準:8.1k 敘事短影片/捲軸,需 ToM 解讀細微線索

為什麼重要

揭露影片 AI 敘事推理缺口,證明針對性 ToM 資料讓小模型勝過 Gemini 等巨頭。推動多模態影片理解邁向類人推理。

下一步行動

從 arXiv:2604.23198v1 下載 StoryTR 資料集,並基準測試您的影片模型。

誰應關注:Researchers & Academics

關鍵要點

  • StoryTR 基準:8.1k 敘事短影片/捲軸,需 ToM 解讀細微線索
  • Gemini-3.0-Pro 在敘事任務僅 0.53 Avg IoU
  • Agentic Data Pipeline 生成 ToM 鏈:意圖解碼、敘事推理、邊界定位
  • 7B Shorts-Moment 模型較基準 +15.1% IoU,推理勝於規模

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • StoryTR 基準測試特別強調了影片中「非顯性」社交互動的解碼能力,這與傳統基於物體識別或動作分類的影片檢索基準有本質區別。
  • Agentic Data Pipeline 採用了多智能體協作機制,分別負責意圖解碼、因果鏈條構建與邊界精確定位,這種分層推理架構顯著降低了對超大規模參數模型的依賴。
  • 研究指出,現有大型多模態模型(LMMs)在處理長時序敘事時,常因缺乏對角色心理狀態的持續追蹤(Mental State Tracking),導致在長影片片段檢索中出現顯著的邊界漂移現象。

🛠️ 技術深入

  • 模型架構:採用基於 Transformer 的輕量化編碼器,結合專門設計的 ToM 推理頭(ToM-Reasoning Head),用於處理從 Agentic Pipeline 提取的意圖嵌入向量。
  • 數據處理:Agentic Data Pipeline 利用預訓練的 LLM 作為推理引擎,對影片幀序列進行多輪對話式標註,生成包含「信念-慾望-意圖」(BDI)模型的敘事鏈。
  • 損失函數:引入了針對時間邊界定位的 IoU 損失函數,並結合了基於敘事一致性的對比損失(Contrastive Loss),以確保模型在檢索時能捕捉到敘事邏輯而非僅僅是視覺特徵相似度。

🔮 前景展望AI analysis grounded in cited sources

ToM 推理能力將成為下一代影片理解模型的標準評測指標。
隨著影片內容從單純的動作識別轉向複雜的社交敘事,僅具備視覺識別能力的模型將無法滿足高階內容分析需求。
輕量化模型在特定推理任務上將超越通用型超大規模模型。
StoryTR 的實驗證明,針對特定認知任務進行優化的 7B 模型,其推理效率與準確度優於缺乏針對性訓練的通用型模型。

時間線

2026-02
StoryTR 項目啟動,開始構建基於心智理論的影片數據集。
2026-04
StoryTR 基準測試與 Shorts-Moment 模型正式於 ArXiv 發布。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI