📄ArXiv AI•較早收集於 13h
PlotChain:多模態LLM工程圖表閱讀基準
#multimodal-llm#engineering-plotsplotchain
💡New reproducible benchmark exposes MLLM limits on engineering plots—Gemini tops 80% scores (72 chars)
⚡ 30-Second TL;DR
有什麼變化
全新基準包含 450 個渲染工程圖表及精確地面真相
為什麼重要
此基準突顯 MLLM 在圖表閱讀的優勢,同時暴露技術領域缺口,有助針對性改進。它實現可重現評估,推動工程 AI 應用進展。
下一步行動
Download PlotChain dataset and scoring code from arXiv to benchmark your MLLM on plot reading.
誰應關注:Researchers & Academics
關鍵要點
- •全新基準包含 450 個渲染工程圖表及精確地面真相
- •基於檢查點的診斷,用於子技能失敗定位
- •Gemini 2.5 Pro 達 80.42%、GPT-4.1 達 79.84%、Claude Sonnet 4.5 達 78.21%
- •釋出生成器、資料集、輸出及評分程式碼以確保可重現
- •頻域圖表如帶通和 FFT 仍具挑戰
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
每週 AI 簡報
每週一封,可隨時退訂。
