Search

直接匹配不多,已補上最新動態。

Tag: #vlm-evaluation3 results

🔬

CRYSTAL基準揭露VLM推理缺失

CRYSTAL 是擁有 6,372 個視覺問題的新基準,包含驗證的逐步推理,用以評估多模態模型超越最終答案的表現。對 20 個模型測試顯示準確率高但推理步驟恢復差,例如 GPT-5 準確率 58% 但僅恢復 48% 步驟。CPR Curriculum 訓練在特定 VLM 上將推理提升高達 93%。

Reddit r/MachineLearningCommunityMar 18#multimodal-reasoning#vlm-evaluation#benchmark
Ox Alpha:神秘模型公開亮相

Ox Alpha:神秘模型公開亮相

Ox Alpha 是一款透過 OpenRouter 與 OpenCode 提供的匿名模型,具備 100 萬 token 上下文、圖片與影片輸入、工具呼叫及免費使用等能力。早期測試顯示其推理與程式設計表現強勁,但開發者、參數量、訓練資料與正式基準排名仍未獲確認。