
用於發現重大數學猜想的 AI 框架
研究人員開發了一套三階段流程,利用 LLM 系統性地生成、驗證並正式檢驗新的數學猜想。該框架透過整合 Lean 4 和 Mathlib 進行嚴格的形式化證明檢查,確保了猜想的新穎性與重要性。
Tag: #formal-verification43 results

研究人員開發了一套三階段流程,利用 LLM 系統性地生成、驗證並正式檢驗新的數學猜想。該框架透過整合 Lean 4 和 Mathlib 進行嚴格的形式化證明檢查,確保了猜想的新穎性與重要性。

GRID 是一種新型語法約束解碼引擎,可確保 LLM 生成的 SQL 語法正確且符合企業政策。透過使用 LALR(1) 解析器狀態作為前綴預言機,它為企業級 SQL 生成提供了可證明的保證。

YUKTI 引入了型別命題圖(typed-proposition graph),旨在超越語言模型中單純的點值優化。透過整合不確定性、來源追溯以及假設穩健的帕累托前沿(Pareto frontiers),該框架能顯著降低複雜現實場景中的決策遺憾。

Mnemosyne 引入了代理事務處理 (ATP),將 AI 生成的動作視為未經信任的提案,並透過確定性約束確保其有效性。它提供了一個強大的運行時環境,用於驗證、修復和提交 AI 工作流,同時維護系統狀態的完整性。

ODYSSEY 引入了一種範疇論框架,透過結構化的「鑄造廠」(foundries) 來構建能維護局部真實性的基礎模型。它利用通用鑄造廠學習 (UFL) 和 FSQL 來確保模型產出物具備可驗證性、模組化,並植根於因果邏輯。

DeFAb 是一個旨在測試基礎模型在「可廢止溯因推理」能力的全新基準,利用形式邏輯來評估模型的創造力與理論推理。研究顯示,現有頂尖模型在邏輯嚴謹性上表現不佳,相較於符號求解器,難以內化可廢止推理。

Pramaana Labs 獲得 Khosla Ventures 2,700 萬美元種子輪融資,旨在為 AI 系統開發形式驗證方法。該公司致力於提升法律、藥物研發及稅務準備等高風險領域的 AI 可靠性。

MA-ProofBench 是一個全新的形式化定理證明基準測試,包含涵蓋六個數學分析核心主題的 200 個問題。測試結果顯示目前 LLM 能力存在顯著差距,頂尖模型在大學程度問題上的準確率甚至不到 16%。

Lean4Agent 是一個利用 Lean4 形式化語言來建模並驗證 LLM 代理工作流語義一致性的新框架。它引入了用於調試執行軌跡的 FormalAgentLib 以及用於自動優化工作流的 LeanEvolve,在 SWE-Bench 上展現了顯著的性能提升。

CARVE-Q 引入了一種量子 AI 混合架構,用於實現經過認證且符合規則的自動駕駛操作。透過利用量子最小化搜尋,它能有效解決複雜的互動修復網格,同時保持經典的安全驗證。