
Pythagoras-Prover:高效形式化定理證明的新突破
Pythagoras-Prover 是一個全新的高效能 Lean 定理證明模型系列,在 MiniF2F 基準測試中達到了領先水準。透過使用增強型形式化(ALF)與課程微調技術,該模型能以遠少於現有巨型模型的參數規模,提供卓越的推理能力。
Tag: #theorem-proving14 results

Pythagoras-Prover 是一個全新的高效能 Lean 定理證明模型系列,在 MiniF2F 基準測試中達到了領先水準。透過使用增強型形式化(ALF)與課程微調技術,該模型能以遠少於現有巨型模型的參數規模,提供卓越的推理能力。

Google DeepMind 推出強大的 AI 系統,設計用作進階數學任務的數學協作者。本文亦強調 Codex 可自動化任何手動任務。
一個 AI Agent 在僅一週內獨立使用 Lean 形式化了本世紀首次菲爾茲獎成果。它產生了 20 萬行程式碼,現已公開。這是歷史上最大規模的單一目的 Lean 形式化項目。

谷歌 DeepMind 的 Aletheia,由 Gemini 3 Deep Think 驅動,在首屆 FirstProof 挑戰中自主解決 10 道高難研究問題中的 6 道,創最佳紀錄。團隊負責人 Thang Luong 稱其超越 AI IMO 金牌。問題來自真實未公開證明,由專家如論文審稿般審核。

DAP 是一個代理框架,使用 LLM 搭配自我反思來發現定理答案,然後在 Lean 4 的硬模式下進行形式證明。它發布了專家重新標註的 MiniF2F-Hard 和 FIMO-Hard 基準測試。DAP 達到 SOTA,在 CombiBench 解決 10 題,並首次形式證明 36 個 PutnamBench 定理。

FormalProofBench 是一個新私人基準,用於評估 AI 模型在 Lean 4 中產生正式驗證的研究生級數學證明能力。問題來自資格考試和分析、代數、機率、邏輯等教科書。頂尖模型準確率最高達 33.5%,並分析工具使用、失敗模式、成本與延遲。

研究人員微調大型語言模型(LLMs),使用 Lean 4 生成可驗證的反例來駁斥定理。符號變異策略透過修改定理產生多樣訓練資料。多重獎勵專家迭代框架在新基準測試中提升反例生成與定理證明效能。

FormalEvolve 是一種神經符號進化框架,用於產生多樣、語義一致的形式化陳述,以提升自動形式化中的證明器效能。它在嚴格的 100 次呼叫預算下,使用 LLM 驅動的變異、交叉與修補,以及 AST 重寫。於 CombiBench 達 58.0% 語義命中率,ProofNet 達 84.9%,程式碼即將公開發布。

OpenAI 發布其 AI 模型針對 First Proof 數學挑戰的證明嘗試。此舉測試研究級推理能力於專家級數學問題上。提交內容已公開分享以供評估。

據報導,OpenAI 系統處理了一項數學猜想,但數學家認為其結果已偏離原始問題。隔天發表的人類論文則質疑 AI 生成的反例並認為其無效。