
LeanMarathon:用於可靠 AI 自動形式化的多代理框架
LeanMarathon 是一個旨在解決 Lean 中長程數學自動形式化挑戰的多代理系統。透過使用演進藍圖與平行 CI 門控證明回合,它成功在無錯誤的情況下形式化了複雜的研究級定理。
Tag: #formal-verification43 results

LeanMarathon 是一個旨在解決 Lean 中長程數學自動形式化挑戰的多代理系統。透過使用演進藍圖與平行 CI 門控證明回合,它成功在無錯誤的情況下形式化了複雜的研究級定理。

NeuroNL2LTL 是一個神經符號框架,能將自然語言轉換為線性時序邏輯 (LTL) 並提供形式正確性保證。透過整合「驗證迴圈」訓練流程,該系統利用形式驗證結果作為強化學習的獎勵訊號,確保規格產出的高可靠性。

ImProver 2 是一個針對 Lean 4 的全新神經符號框架,透過專家迭代與結構化指標來優化形式化證明。它使 7B 參數模型在重構研究級數學證明時,表現超越了規模大得多的系統。

OpenAI 最新的推理模型成功推翻了一個自 1946 年以來未解的幾何學猜想。此項成就已獲得曾質疑該公司先前聲明的數學家們的證實。

介紹工具中介LLM架構,用於SOC在對抗壓力下配置EDR政策,使用確定性工具和有限動作目錄。Lean 4機器檢查複合Lyapunov函數,證明可控性、可觀測性和ISS穩健性。在真實攻擊圖上,使用Claude Sonnet 4實現攻擊者收益減少59%。

研究人員使用Rocq中的Interaction Trees,提出AI工作流程架構效應透明治理的機器驗證形式化。他們證明治理保留了圖靈完備性、預言機表達性及語義透明度,而不降低計算能力。七項關鍵性質證明治理與表達性正交。

DAP 是一個代理框架,使用 LLM 搭配自我反思來發現定理答案,然後在 Lean 4 的硬模式下進行形式證明。它發布了專家重新標註的 MiniF2F-Hard 和 FIMO-Hard 基準測試。DAP 達到 SOTA,在 CombiBench 解決 10 題,並首次形式證明 36 個 PutnamBench 定理。

ProofSketcher 提出混合管道,讓 LLM 在緊湊 DSL 中產生類型化證明草圖,用於數學/邏輯推理。輕量信任核心將草圖擴展為明確證明義務,以進行嚴格驗證。此方法結合 LLM 的說服力與 Lean 和 Coq 等定理證明器的可靠性,避免完整形式化。

FormalProofBench 是一個新私人基準,用於評估 AI 模型在 Lean 4 中產生正式驗證的研究生級數學證明能力。問題來自資格考試和分析、代數、機率、邏輯等教科書。頂尖模型準確率最高達 33.5%,並分析工具使用、失敗模式、成本與延遲。

Stepwise 提出神經符號式框架,利用 LLM 和 ITP 工具自動化形式驗證中的證明搜尋。它採用最佳優先樹狀搜尋、針對證明狀態的 LLM 微調,以及符號式修復,以超越先前方法。在 seL4 基準測試中,它證明了 77.6% 的定理,優於 Sledgehammer 並展現強大泛化能力。