
The Unwritten Benchmark 挑戰抽象感知推理
The Unwritten Benchmark 評估多模態模型能否在看不見墨水的情況下,僅根據筆尖刮擦聲與手部動作影片推斷文字。人類的字母順序準確率超過 80%,但 GPT-4o 與 Gemini 2.5-Pro 均低於 10%,且多模態融合有時反而會降低表現。
Tag: #multimodal-reasoning8 results

The Unwritten Benchmark 評估多模態模型能否在看不見墨水的情況下,僅根據筆尖刮擦聲與手部動作影片推斷文字。人類的字母順序準確率超過 80%,但 GPT-4o 與 Gemini 2.5-Pro 均低於 10%,且多模態融合有時反而會降低表現。

MobileMem 是一套評估個人 AI 助理裝置端長期記憶的基準測試與框架,使用長達一年的行動體驗資料。它透過文字與多模態設定,測試代理在時間推理、知識更新、多跳回憶及隱含偏好推論方面的能力。
CRYSTAL 是擁有 6,372 個視覺問題的新基準,包含驗證的逐步推理,用以評估多模態模型超越最終答案的表現。對 20 個模型測試顯示準確率高但推理步驟恢復差,例如 GPT-5 準確率 58% 但僅恢復 48% 步驟。CPR Curriculum 訓練在特定 VLM 上將推理提升高達 93%。

DeepSeek撤回一篇名為《Thinking with Visual Primitives》的論文,使用點和框作為認知錨點,解決視覺推理中的引用鴻溝。基於284B MoE模型,圖像壓縮7056倍,透過CoT嵌入座標實現精確計數。使用4000萬高品質檢測樣本訓練。

TABQAWORLD 是一個無需訓練的框架,優化多模態推理用於多輪表格問答。它動態切換視覺/文字表示,並利用表格元數據規劃高效軌跡,減少對話輪次與延遲。實現 SOTA 性能,較基準提升 4.87% 準確率,並降低 33.35% 推論延遲。

沙利文白皮書指出,醫學影像 AI 應依照臨床場景、角色與任務來定義。白皮書將影禾医脉定位為面向生態系統的方法,要求模型具備影像理解、跨模態醫學推理與標準化工程輸出的能力。

MMKG-RDS 是一個靈活框架,利用多模態知識圖譜進行高品質推理資料合成,克服現有方法在覆蓋率、驗證與可解釋性方面的限制。它具備細粒度提取、可自訂路徑採樣與多維度品質評分,使用 MMKG-RDS-Bench(5 領域、17 任務、14,950 樣本)驗證。微調 Qwen3 模型可提升推理準確率 9.2%;程式碼開源於 GitHub。

AICon 深圳場次聚焦於多模態推理的高效長上下文建模。現有文章摘要未提供具體模型架構、基準測試或實作細節。