Claude 推進黎曼猜想研究
Anthropic 表示,尚未公開發布的 Claude 研究版模型在黎曼猜想研究上取得實質進展。在多日自主測試期間,該模型將黎曼 Zeta 函數位於臨界線上的零點比例已知下限,從 41.6% 提高至 67.2%。
Tag: #mathematics40 results
Anthropic 表示,尚未公開發布的 Claude 研究版模型在黎曼猜想研究上取得實質進展。在多日自主測試期間,該模型將黎曼 Zeta 函數位於臨界線上的零點比例已知下限,從 41.6% 提高至 67.2%。

研究人員開發了一套三階段流程,利用 LLM 系統性地生成、驗證並正式檢驗新的數學猜想。該框架透過整合 Lean 4 和 Mathlib 進行嚴格的形式化證明檢查,確保了猜想的新穎性與重要性。

研究人員提出了一種結合 LLM 推理與 SageMath 可驗證計算的 ReAct 風格代理框架。研究顯示,該架構在多種模型上均顯著提升了效能,有效縮小了開源權重模型與閉源模型之間的差距。

MA-ProofBench 是一個全新的形式化定理證明基準測試,包含涵蓋六個數學分析核心主題的 200 個問題。測試結果顯示目前 LLM 能力存在顯著差距,頂尖模型在大學程度問題上的準確率甚至不到 16%。

LeanMarathon 是一個旨在解決 Lean 中長程數學自動形式化挑戰的多代理系統。透過使用演進藍圖與平行 CI 門控證明回合,它成功在無錯誤的情況下形式化了複雜的研究級定理。

VAMPS 是一個包含 1,168 個問題的多模態基準測試,旨在評估大型語言模型是否能有效利用視覺化工具解決複雜的代數與微積分問題。研究顯示,目前的模型在整合工具生成的圖表時表現不佳,直接進行分析推理的效果往往更好。

OpenAI 的模型成功解決了一個困擾人類數學家長達八十年的複雜數學難題。這項成就凸顯了 AI 在形式推理與先進科學發現方面日益增強的能力。

RMA 是一個代理框架,旨在透過迭代證明優化和文獻基礎來解決複雜的研究級數學問題。它透過專門的分析、搜索和驗證模組,在 First Proof 基準測試中超越了 GPT-5.2R 等現有模型。

ImProver 2 是一個針對 Lean 4 的全新神經符號框架,透過專家迭代與結構化指標來優化形式化證明。它使 7B 參數模型在重構研究級數學證明時,表現超越了規模大得多的系統。

OpenAI 最新的推理模型成功推翻了一個自 1946 年以來未解的幾何學猜想。此項成就已獲得曾質疑該公司先前聲明的數學家們的證實。