Search

Tag: #multimodal-reasoning8 results

🔬

CRYSTAL基準揭露VLM推理缺失

CRYSTAL 是擁有 6,372 個視覺問題的新基準,包含驗證的逐步推理,用以評估多模態模型超越最終答案的表現。對 20 個模型測試顯示準確率高但推理步驟恢復差,例如 GPT-5 準確率 58% 但僅恢復 48% 步驟。CPR Curriculum 訓練在特定 VLM 上將推理提升高達 93%。

Reddit r/MachineLearningCommunityMar 18#multimodal-reasoning#vlm-evaluation#benchmark
MMKG-RDS:多模態知識圖譜推理資料合成

MMKG-RDS:多模態知識圖譜推理資料合成

MMKG-RDS 是一個靈活框架,利用多模態知識圖譜進行高品質推理資料合成,克服現有方法在覆蓋率、驗證與可解釋性方面的限制。它具備細粒度提取、可自訂路徑採樣與多維度品質評分,使用 MMKG-RDS-Bench(5 領域、17 任務、14,950 樣本)驗證。微調 Qwen3 模型可提升推理準確率 9.2%;程式碼開源於 GitHub。