📄ArXiv AI•較早收集於 5h
StoryTR:心智理論敘事影片時間檢索

💡新 ToM 基準揭影片 AI 敘事缺口;7B 模型勝 Gemini 15%(62字)
⚡ 30-Second TL;DR
有什麼變化
StoryTR 基準:8.1k 敘事短影片/捲軸,需 ToM 解讀細微線索
為什麼重要
揭露影片 AI 敘事推理缺口,證明針對性 ToM 資料讓小模型勝過 Gemini 等巨頭。推動多模態影片理解邁向類人推理。
下一步行動
從 arXiv:2604.23198v1 下載 StoryTR 資料集,並基準測試您的影片模型。
誰應關注:Researchers & Academics
關鍵要點
- •StoryTR 基準:8.1k 敘事短影片/捲軸,需 ToM 解讀細微線索
- •Gemini-3.0-Pro 在敘事任務僅 0.53 Avg IoU
- •Agentic Data Pipeline 生成 ToM 鏈:意圖解碼、敘事推理、邊界定位
- •7B Shorts-Moment 模型較基準 +15.1% IoU,推理勝於規模
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •StoryTR 基準測試特別強調了影片中「非顯性」社交互動的解碼能力,這與傳統基於物體識別或動作分類的影片檢索基準有本質區別。
- •Agentic Data Pipeline 採用了多智能體協作機制,分別負責意圖解碼、因果鏈條構建與邊界精確定位,這種分層推理架構顯著降低了對超大規模參數模型的依賴。
- •研究指出,現有大型多模態模型(LMMs)在處理長時序敘事時,常因缺乏對角色心理狀態的持續追蹤(Mental State Tracking),導致在長影片片段檢索中出現顯著的邊界漂移現象。
🛠️ 技術深入
- •模型架構:採用基於 Transformer 的輕量化編碼器,結合專門設計的 ToM 推理頭(ToM-Reasoning Head),用於處理從 Agentic Pipeline 提取的意圖嵌入向量。
- •數據處理:Agentic Data Pipeline 利用預訓練的 LLM 作為推理引擎,對影片幀序列進行多輪對話式標註,生成包含「信念-慾望-意圖」(BDI)模型的敘事鏈。
- •損失函數:引入了針對時間邊界定位的 IoU 損失函數,並結合了基於敘事一致性的對比損失(Contrastive Loss),以確保模型在檢索時能捕捉到敘事邏輯而非僅僅是視覺特徵相似度。
🔮 前景展望AI analysis grounded in cited sources
ToM 推理能力將成為下一代影片理解模型的標準評測指標。
隨著影片內容從單純的動作識別轉向複雜的社交敘事,僅具備視覺識別能力的模型將無法滿足高階內容分析需求。
輕量化模型在特定推理任務上將超越通用型超大規模模型。
StoryTR 的實驗證明,針對特定認知任務進行優化的 7B 模型,其推理效率與準確度優於缺乏針對性訓練的通用型模型。
⏳ 時間線
2026-02
StoryTR 項目啟動,開始構建基於心智理論的影片數據集。
2026-04
StoryTR 基準測試與 Shorts-Moment 模型正式於 ArXiv 發布。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗