
FAR 自動搜尋尚未解決的數學問題
研究人員提出 FAR,一套從研究文獻尋找未解決問題、嘗試解題,並推薦具潛力結果供專家審查的人機協作流程。在組合數學試驗中,系統將 5,245 篇論文縮小至 77 個供作者團隊評估的項目,並發現多項潛在數學成果。
Tag: #automated-reasoning10 results

研究人員提出 FAR,一套從研究文獻尋找未解決問題、嘗試解題,並推薦具潛力結果供專家審查的人機協作流程。在組合數學試驗中,系統將 5,245 篇論文縮小至 77 個供作者團隊評估的項目,並發現多項潛在數學成果。

OpenAI 研究人員成功解決了一項困擾數學界八十年之久的難題。這項突破凸顯了 AI 模型在高等科學推理與形式化證明驗證方面日益增強的能力。

研究人員開發了一套三階段流程,利用 LLM 系統性地生成、驗證並正式檢驗新的數學猜想。該框架透過整合 Lean 4 和 Mathlib 進行嚴格的形式化證明檢查,確保了猜想的新穎性與重要性。

Xcientist 是一個全新的研究框架,旨在將 AI 科學工作流程外部化為可檢查且受合約規範的過程。它追蹤從文獻綜述到實驗驗證的整個研究生命週期,以防止主張漂移並確保科學的可問責性。

RMA 是一個代理框架,旨在透過迭代證明優化和文獻基礎來解決複雜的研究級數學問題。它透過專門的分析、搜索和驗證模組,在 First Proof 基準測試中超越了 GPT-5.2R 等現有模型。

SMCEvolve 是一個將 LLM 驅動的程式演化視為從獎勵加權分佈中進行採樣的新框架。它透過使用順序蒙地卡羅 (SMC) 採樣器來確保收斂並減少 LLM 呼叫預算,從而提高科學發現的效率。
NL2LOGIC 是一種新框架,使用抽象語法樹(AST)透過大型語言模型將自然語言轉譯為一階邏輯。它結合遞迴 LLM 語義解析器與 AST 引導生成器,實現高語法準確度和語義忠實度。基準測試顯示 99% 語法準確率、最多 30% 語義提升,並在整合 Logic-LM 時將推理準確度提高 31%。

這篇立場論文主張,AI 推理應被操作性地定義為一種以有效且健全推論為基礎、可學習的規則式流程。論文提出基於文獻整合的框架與檢核清單,讓推理評估更加嚴謹且可驗證。
著名數學家 Terence Tao 已成為 AI 的熱情倡導者,他指出現代模型終於實現了他對自動化推理的長期預言。

機率式 AI 驗證無法滿足管制產業需求;Amazon Bedrock 中的自動化推理檢查使用形式驗證提供數學證明結果。六大產業客戶實現可審核 AI 輸出。了解實施步驟。