VeRA:大規模驗證推理資料增強
VeRA 將基準問題轉換為可執行規格,包括模板、產生器和驗證器,以近零成本生成無限驗證變體。VeRA-E 產生等價問題以偵測記憶化,VeRA-H 則強化任務創造新挑戰。在 16 個前沿模型上評估,並完全開源。
Tag: #reasoning-evaluation5 results
VeRA 將基準問題轉換為可執行規格,包括模板、產生器和驗證器,以近零成本生成無限驗證變體。VeRA-E 產生等價問題以偵測記憶化,VeRA-H 則強化任務創造新挑戰。在 16 個前沿模型上評估,並完全開源。

Reasoning Jury 以由多個模型組成、受主持者管理的評審團,取代單一 LLM 評審,透過討論與修正來評估推理軌跡。論文指出,開放權重評審團在偵測推理缺陷方面可超越前沿模型,成本僅為其 8–15%。

這篇立場論文主張,AI 推理應被操作性地定義為一種以有效且健全推論為基礎、可學習的規則式流程。論文提出基於文獻整合的框架與檢核清單,讓推理評估更加嚴謹且可驗證。

SARE 是一套在單一 Chain-of-Thought 步驟層級測量計算努力的框架,不再只評估整段推理軌跡。針對六個基準測試與三個開放權重 LLM 的評估顯示,推理能量會因步驟類型而異,錯誤解答在關鍵節點的能量較低,且其表現可超越基於輸出的信心訊號。

依 ORCA 測試,現今 LLM 數學表現進步但仍是預測引擎,易給出看似合理卻錯誤答案。頂尖模型 Gemini 3 Flash 僅獲 C 等級。這凸顯推理任務的持續限制。