💰TechCrunch AI•較早收集於 2m
OpenAI 解決了 80 年前的幾何學猜想

💡AI 模型現在能解決數十年的數學難題,證明了其在正式科學研究中的實用價值。
⚡ 30-Second TL;DR
有什麼變化
OpenAI 的推理模型推翻了自 1946 年以來懸而未決的幾何學猜想。
為什麼重要
這表明 AI 模型正從模式匹配轉向可驗證的邏輯推理。這標誌著 AI 將成為正式數學研究中可靠工具的趨勢。
下一步行動
檢視 OpenAI 使用的形式證明方法,以了解如何將推理模型應用於您自己的領域特定邏輯問題中。
誰應關注:Researchers & Academics
關鍵要點
- •OpenAI 的推理模型推翻了自 1946 年以來懸而未決的幾何學猜想。
- •該結果已獲得曾批評 OpenAI 先前研究的獨立數學家驗證。
- •這標誌著 AI 在執行複雜形式數學推理能力上的重大里程碑。
🧠 深度解析
Web-grounded analysis with 22 cited sources.
🔑 增強重點摘要
- •OpenAI 的推理模型推翻的具體猜想是平面單位距離問題 (planar unit distance problem),又稱 Erdős 單位距離猜想 (Erdős unit distance conjecture),由數學家保羅·埃爾德什 (Paul Erdős) 於 1946 年提出。
- •該模型透過發現超越長期以來假設的方格排列的全新結構 (new constructions),成功推翻了此猜想,這與數學家們近80年來的普遍看法不同。
- •此項成就被譽為人工智慧首次自主解決數學領域中一個著名的開放問題,而非僅僅輔助人類研究或檢索現有文獻。
- •此次突破很可能是在 OpenAI 的 o1 系列推理模型上實現的,該系列模型(如 o1-preview 和 o1-mini)於 2024 年 9 月發布,專為複雜的科學、編碼和數學推理任務而設計。
- •此成功與 OpenAI 在 2025 年 10 月因 GPT-5 錯誤聲稱解決了多個 Erdős 問題而引發的爭議形成鮮明對比,當時模型僅是檢索了現有文獻而非生成新證明,導致了業界的批評。
📊 競品分析▸ Show
| 功能/指標 | OpenAI (o1 系列/GPT-5.2) | Google DeepMind (Gemini 3.0 Deepthink) | Meta AI (HyperTree Proof Search) | Logical Intelligence (Aleph Prover) | Princeton University (Goedel-Prover-V2) |
|---|---|---|---|---|---|
| 數學推理能力 | 解決 Erdős 單位距離猜想;IMO 金牌水平 (2025);擅長複雜推理任務。 | IMO 金牌水平 (2025);在 First Proof 挑戰中提交證明。 | 解決 10 個 IMO 問題;在 miniF2F 和 Metamath 上表現優異。 | 在 PutnamBench、VeriSoftBench、LeanEval 和 Verina 等基準測試中達到頂尖水平。 | 在 PutnamBench、miniF2F 和 MathOlympiad Bench 上表現優異;可自我修正證明。 |
| 模型類型 | 通用推理模型 (LLM),如 o1-preview, o1-mini, GPT-5.2 Pro, GPT-5.2 Thinking。 | LLM,如 Gemini 3.0 Deepthink。 | 神經定理證明器 (Neural Theorem Prover)。 | 智能體系統 (Agentic System)。 | 開源定理證明器。 |
| 證明驗證 | 需人類驗證,但目標是自主推理。 | 需人類驗證。 | 透過 Lean Visual Studio Code (VSCode) 插件提供模型,允許研究人員探索。 | 內建驗證機制,可數學證明正確性。 | 能夠驗證其自身答案的正確性。 |
| 成本/效率 | o1-mini 比 o1-preview 更快、更具成本效益;o1-preview API 價格是 GPT-4o 的數倍;o1-pro API 價格高昂。 | 未明確提及。 | 未明確提及。 | 以學術環境中較小的計算量實現卓越性能 (320 億參數模型)。 | 未明確提及。 |
| 訓練方法 | 透過強化學習使用 token-wise 獎勵模型,模仿推理和反思過程。 | 未明確提及。 | HyperTree Proof Search (HTPS),在成功數學證明數據集上訓練。 | 未明確提及。 | 未明確提及。 |
🛠️ 技術深入
- OpenAI 的模型被描述為一個內部通用推理模型 (internal general-purpose reasoning model),旨在進行深度思考,並在科學、編碼和數學等複雜推理任務中表現出色。
- 該模型很可能屬於 OpenAI o1 系列,該系列模型(包括 o1-preview 和 o1-mini)是生成式預訓練變換器 (GPT),也是 OpenAI 「o」系列推理模型中的首批。
- o1 模型採用了一種新穎的訓練方法,涉及透過強化學習使用基於 token 的獎勵模型 (token-wise reward model)。這種方法旨在模仿推理和反思過程,從而在 token 生成中培養一種內在的思維鏈 (chain-of-thought) 風格。
- 在解決平面單位距離問題時,該模型透過發現全新結構 (new constructions) 來推翻了猜想,這些結構超越了長期以來假設的方格排列。
- 早期在形式化數學方面的工作(2022 年 2 月)使用了類似於 GPT-3 的僅解碼器變換器 (decoder-only Transformers),擁有 7.74 億個可訓練參數,並在 CommonCrawl 和 WebMath 上進行了預訓練,採用了在 Lean 形式化環境中證明搜索與學習交錯 (proof search interleaved with learning) 的「專家迭代」方法。 雖然當前模型的具體架構可能更為先進,但這些基礎技術可能仍是其推理能力的組成部分。
🔮 前景展望AI analysis grounded in cited sources
AI 將加速純數學研究的進展,使人類數學家能專注於更抽象和創造性的工作。
AI 能夠自主解決長期未解的猜想並生成新的數學策略,這將使數學家能夠將繁瑣的證明步驟和探索性工作外包給機器。
AI 在數學推理方面的進步將推動通用人工智慧 (AGI) 的發展。
能夠可靠地進行抽象推理、在長鏈思維中保持一致性並跨領域泛化的系統,展現了 AGI 的基礎特徵。
數學領域將需要更嚴格的驗證流程和透明度標準,以應對 AI 生成的證明和發現。
過去 OpenAI 曾因誇大 AI 數學能力而引發爭議,凸顯了對 AI 生成結果進行獨立驗證和清晰歸因的必要性。
⏳ 時間線
1946
數學家保羅·埃爾德什 (Paul Erdős) 提出平面單位距離問題 (planar unit distance problem)。
2022-02
OpenAI 發表研究,展示其神經證明器在 Lean 形式化環境中解決了國際數學奧林匹亞 (IMO) 的部分問題。
2024-09
OpenAI 推出 o1 系列推理模型 (o1-preview 和 o1-mini),旨在處理複雜的科學、編碼和數學推理任務。
2025-10
OpenAI 因 GPT-5 錯誤聲稱解決了多個 Erdős 問題而引發爭議,隨後撤回聲明,承認模型僅檢索了現有文獻。
2025-12
OpenAI 推出 GPT-5.2 Pro 和 GPT-5.2 Thinking 模型,強調其在科學和數學工作中的強大性能。
2026-05-20
OpenAI 的內部通用推理模型推翻了自 1946 年以來未解的 Erdős 平面單位距離猜想。
📎 來源 (22)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: TechCrunch AI ↗
