🤖較早收集於 3h

IDP 排行榜基準測試 16 款 VLM

PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning

💡新基準排行文件 AI VLM—透過預測檢視器選最佳 KIE/表格/VQA 模型(30字)

⚡ 30-Second TL;DR

有什麼變化

測試 16 款 VLM 於 9,000+ 文件,涵蓋 KIE、表格、VQA、OCR、分類

為什麼重要

讓從業人員比較真實預測,選最適 VLM 處理文件。揭示廉價模型足提取取,推理任務差距縮小。

下一步行動

造訪 idp-leaderboard.org,使用結果瀏覽器比較 VLM 在您文件類型的預測。

誰應關注:Developers & AI Engineers

關鍵要點

  • 測試 16 款 VLM 於 9,000+ 文件,涵蓋 KIE、表格、VQA、OCR、分類
  • Gemini 3.1 Pro 以 83.2 領先;前五僅差 2.4 分
  • GPT-5.4 從 GPT-4.1 大幅躍升(70 至 81);稀疏表格最難(<55%)
  • 結果瀏覽器顯示原始預測 vs. 真值
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。