來源ArXiv AI•較早收集於 7h
MathAtlas:針對研究所等級自動形式化的全新基準測試

首個針對研究所等級數學自動形式化的基準測試;揭露了當前頂尖推理模型在處理複雜邏輯時的關鍵缺陷。
30 秒速覽
有什麼變化
包含來自 103 本研究所教科書的 52,000 筆定理、定義與證明。
為什麼重要
此基準測試揭露了當前大型語言模型在處理深度結構化數學推理時的侷限性。這將推動研究人員開發更強大、具備依賴感知能力的數學形式化架構。
下一步行動
從 arXiv 儲存庫下載 MathAtlas 數據集,以壓力測試您的模型在複雜、多步驟數學證明上的推理能力。
誰應關注:Researchers & Academics
關鍵要點
- •包含來自 103 本研究所教科書的 52,000 筆定理、定義與證明。
- •具備包含 178,000 個關係的依賴圖,用於評估模型對數學邏輯的依賴性理解。
- •顯示當前頂尖模型在處理深度依賴關係時,效能會顯著下降。
- •為自動形式化提供了極具挑戰性的測試環境,現有模型基準分數偏低。
關鍵數字9.8%16.7%2.6%
深度解析
背景與延伸:來自公開資料,非原文內容。引用 18 個來源。
增強重點摘要
- •MathAtlas 專注於「真實世界」的研究所等級數學內容,與以往主要針對奧林匹亞或大學程度數學的基準測試有所區別,填補了高階數學自動形式化領域的空白。
- •它是第一個納入數學依賴圖的自動形式化基準測試,這對於評估和開發能理解複雜數學邏輯依賴性的系統至關重要。
- •初步實驗結果顯示,即使是頂尖模型在處理定理陳述時的正確率最高僅為 9.8%,定義的正確率為 16.7%,而在深度依賴關係的子集(MA-Hard)上,最佳模型的正確率更降至 2.6%,凸顯了其極高的挑戰性。
- •MathAtlas 的發布旨在推動自動形式化領域的發展,特別是針對需要處理大量先決理論和定義的進階數學,這在現有基準測試中是缺乏的。
競品分析
MathAtlas
- 專注層級/領域
- 研究所等級數學
- 形式化語言
- 未明確指定,但通常與Lean/Isabelle等相關
- 內容類型
- 定理、定義、證明
- 關鍵特點
- 包含數學依賴圖,評估深度依賴關係
- 規模 (問題/定理數)
- 52,000
- 基準分數 (範例)
- 頂尖模型在定理陳述上最高 9.8%,定義 16.7%,MA-Hard 2.6%
MiniF2F
- 專注層級/領域
- 奧林匹亞/大學數學
- 形式化語言
- Lean
- 內容類型
- 數學競賽問題
- 關鍵特點
- 規模 (問題/定理數)
- 488 (測試對)
- 基準分數 (範例)
- 某些模型達到接近完美 / 54.5% Pass@64 (LEAN-GitHub微調模型)
ProofNet
- 專注層級/領域
- 大學數學
- 形式化語言
- Lean
- 內容類型
- 數學練習
- 關鍵特點
- 專為自動形式化設計
- 規模 (問題/定理數)
- 371 (測試對)
- 基準分數 (範例)
LeanDojo
- 專注層級/領域
- 數學庫 (mathlib)
- 形式化語言
- Lean 3/4
- 內容類型
- 定理、證明、策略、前提
- 關鍵特點
- 細粒度前提註釋,強化學習環境
- 規模 (問題/定理數)
- 98,734 (LeanDojo) / 122,517 (LeanDojo 4)
- 基準分數 (範例)
- ReProver 優於 GPT-4 零樣本
FormalMATH
- 專注層級/領域
- 高中奧林匹亞至大學數學
- 形式化語言
- Lean 4
- 內容類型
- 5,560 個形式化問題
- 關鍵特點
- 人機協作自動形式化流程,多LLM語義驗證
- 規模 (問題/定理數)
- 5,560
- 基準分數 (範例)
- 頂尖模型在實際採樣預算下成功率僅 16.46%
INDIMATHBENCH
- 專注層級/領域
- 印度數學奧林匹亞問題
- 形式化語言
- Lean 4
- 內容類型
- 312 個形式化定理
- 關鍵特點
- 人工驗證,AI輔助管道
- 規模 (問題/定理數)
- 312
- 基準分數 (範例)
ArgBench
- 專注層級/領域
- 通用推理任務 (形式化論證)
- 形式化語言
- Lean
- 內容類型
- 論證理論問題
- 關鍵特點
- 類型理論自動生成,減少數據洩露風險
- 規模 (問題/定理數)
- 大規模
- 基準分數 (範例)
- Goedel-Prover 5.7%,DeepSeek-Prover-V2 8.16%
AMBER
- 專注層級/領域
- 應用數學 (凸分析、優化等)
- 形式化語言
- Lean 4
- 內容類型
- 構造性任務 (評估、算法設計)
- 關鍵特點
- 強制構造-驗證工作流程
- 規模 (問題/定理數)
- 綜合性基準
- 基準分數 (範例)
- 通用推理模型優於專門定理證明器
ATLAS
- 專注層級/領域
- 大學程度定理
- 形式化語言
- 未明確指定,但用於微調Llama3
- 內容類型
- 117k 定理陳述
- 關鍵特點
- 數據生成框架,概念儲存庫,專家迭代
- 規模 (問題/定理數)
- 117,000
- 基準分數 (範例)
- Llama3.1-8B-Instruct 微調後表現最佳
| 基準測試名稱 | 專注層級/領域 | 形式化語言 | 內容類型 | 關鍵特點 | 規模 (問題/定理數) | 基準分數 (範例) |
|---|---|---|---|---|---|---|
| MathAtlas | 研究所等級數學 | 未明確指定,但通常與Lean/Isabelle等相關 | 定理、定義、證明 | 包含數學依賴圖,評估深度依賴關係 | 52,000 | 頂尖模型在定理陳述上最高 9.8%,定義 16.7%,MA-Hard 2.6% |
| MiniF2F | 奧林匹亞/大學數學 | Lean | 數學競賽問題 | 488 (測試對) | 某些模型達到接近完美 / 54.5% Pass@64 (LEAN-GitHub微調模型) | |
| ProofNet | 大學數學 | Lean | 數學練習 | 專為自動形式化設計 | 371 (測試對) | |
| LeanDojo | 數學庫 (mathlib) | Lean 3/4 | 定理、證明、策略、前提 | 細粒度前提註釋,強化學習環境 | 98,734 (LeanDojo) / 122,517 (LeanDojo 4) | ReProver 優於 GPT-4 零樣本 |
| FormalMATH | 高中奧林匹亞至大學數學 | Lean 4 | 5,560 個形式化問題 | 人機協作自動形式化流程,多LLM語義驗證 | 5,560 | 頂尖模型在實際採樣預算下成功率僅 16.46% |
| INDIMATHBENCH | 印度數學奧林匹亞問題 | Lean 4 | 312 個形式化定理 | 人工驗證,AI輔助管道 | 312 | |
| ArgBench | 通用推理任務 (形式化論證) | Lean | 論證理論問題 | 類型理論自動生成,減少數據洩露風險 | 大規模 | Goedel-Prover 5.7%,DeepSeek-Prover-V2 8.16% |
| AMBER | 應用數學 (凸分析、優化等) | Lean 4 | 構造性任務 (評估、算法設計) | 強制構造-驗證工作流程 | 綜合性基準 | 通用推理模型優於專門定理證明器 |
| ATLAS | 大學程度定理 | 未明確指定,但用於微調Llama3 | 117k 定理陳述 | 數據生成框架,概念儲存庫,專家迭代 | 117,000 | Llama3.1-8B-Instruct 微調後表現最佳 |
技術深入
- 數據來源:MathAtlas 的內容是從 103 本研究所等級數學教科書中提取的。
- 數據規模:該基準測試包含約 52,000 筆數學實體,包括定理、定義、練習、範例和證明。
- 核心創新:MathAtlas 引入了數學依賴圖,其中包含約 178,000 個關係,這些關係用於捕捉不同數學實體之間的邏輯依賴性。
- 評估機制:為深入測試模型處理複雜依賴關係的能力,MathAtlas 包含一個名為 MA-Hard 的子集,該子集由 700 個具有最深依賴樹的實體組成。
- 目標:該基準測試旨在促進和評估「依賴感知型自動形式化系統」(dependency-aware autoformalization systems)的開發。
- 數據提取過程:雖然具體細節未完全公開,但類似的數學知識庫構建工作(如 Matlas)涉及處理 PDF 文件、提取數學陳述及其依賴關係,並以拓撲順序遞歸展開陳述以產生更自洽的表示,MathAtlas 也明確提到「註釋了實體間的依賴關係」。
前景展望基於引用來源的 AI 分析
MathAtlas 將加速更強大、更可靠的自動形式化 AI 模型發展。
其對研究所等級數學和深度依賴關係的獨特關注,將迫使研究人員開發能夠處理複雜、多步驟數學推理的新技術。
該基準測試將揭示現有大型語言模型在處理高階數學邏輯方面的根本性限制。
當前模型在 MathAtlas 上的低分,特別是在深度依賴關係任務上的顯著性能下降,表明需要超越現有架構的創新。
MathAtlas 可能會成為推動 AI 在科學發現和形式驗證領域應用的一個關鍵里程碑。
透過提升 AI 理解和形式化複雜數學的能力,它為構建更值得信賴的 AI 系統以解決現實世界中的科學和工程問題奠定了基礎。
時間線
2013
Lean 證明輔助工具推出,成為許多自動形式化基準測試的目標語言。
2021
MiniF2F 基準測試發布,專注於大學預科數學競賽問題。
2023
ProofNet 基準測試發布,提供大學程度的數學練習用於自動形式化。
2025-05
FormalMATH 基準測試發布,一個大規模的 Lean 4 基準測試,涵蓋高中至大學程度的數學。
2026-04
Matlas 語義搜尋引擎論文發布,強調數學知識檢索和依賴圖的構建。
2026-05
MathAtlas 基準測試論文在 arXiv 上發布,專注於研究所等級自動形式化,並引入數學依賴圖。
- 2013Lean 證明輔助工具推出,成為許多自動形式化基準測試的目標語言。
- 2021MiniF2F 基準測試發布,專注於大學預科數學競賽問題。
- 2023ProofNet 基準測試發布,提供大學程度的數學練習用於自動形式化。
- 2025-05FormalMATH 基準測試發布,一個大規模的 Lean 4 基準測試,涵蓋高中至大學程度的數學。
- 2026-04Matlas 語義搜尋引擎論文發布,強調數學知識檢索和依賴圖的構建。
- 2026-05MathAtlas 基準測試論文在 arXiv 上發布,專注於研究所等級自動形式化,並引入數學依賴圖。
來源 (18)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
1Google Search Sourcevertexaisearch.cloud.google.com2Google Search Sourcevertexaisearch.cloud.google.com3Google Search Sourcevertexaisearch.cloud.google.com4Google Search Sourcevertexaisearch.cloud.google.com5Google Search Sourcevertexaisearch.cloud.google.com6Google Search Sourcevertexaisearch.cloud.google.com7Google Search Sourcevertexaisearch.cloud.google.com8Google Search Sourcevertexaisearch.cloud.google.com9Google Search Sourcevertexaisearch.cloud.google.com10Google Search Sourcevertexaisearch.cloud.google.com11Google Search Sourcevertexaisearch.cloud.google.com12Google Search Sourcevertexaisearch.cloud.google.com13Google Search Sourcevertexaisearch.cloud.google.com14Google Search Sourcevertexaisearch.cloud.google.com15Google Search Sourcevertexaisearch.cloud.google.com16Google Search Sourcevertexaisearch.cloud.google.com17Google Search Sourcevertexaisearch.cloud.google.com18Google Search Sourcevertexaisearch.cloud.google.com
AI 週報
閱讀本週精選 AI 大事摘要 →
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
每週電子報
每週一封,可隨時退訂。