🧠The Neuron•較早收集於 31m
Google 在最新數學基準測試中超越 OpenAI

💡Google 在數學基準測試中取得 9 比 1 的領先,預示著大型語言模型競爭格局的重大轉變。
⚡ 30-Second TL;DR
有什麼變化
Google 的 AI 模型在複雜數學問題解決上展現出優異效能。
為什麼重要
此轉變顯示 Google 在大型語言模型競賽中重拾動能,這可能迫使 OpenAI 加速其下一代模型的發布以維持競爭力。
下一步行動
查閱 Google DeepMind 關於數學推理的最新研究論文,以了解推動這些基準測試改進的架構轉變。
誰應關注:Researchers & Academics
關鍵要點
- •Google 的 AI 模型在複雜數學問題解決上展現出優異效能。
- •據報導 Google 與 OpenAI 之間的效能差距達到 9 比 1 的比例。
- •數學推理仍然是大型語言模型開發與基準測試的關鍵前沿領域。
🧠 深度解析
Web-grounded analysis with 23 cited sources.
🔑 增強重點摘要
- •Google DeepMind 的 AlphaProof Nexus 系統結合大型語言模型與 Lean 形式證明助手,自主解決了 9 個開放的 Erdős 問題,其中包含數十年未解的難題。
- •OpenAI 的通用推理模型於 2026 年 5 月 21 日獨立解決了平面單位距離問題,這是一個自 1946 年以來懸而未決的數學難題,並發現了一系列新的構造方法。
- •Google DeepMind 的 AlphaGeometry(於 2024 年 1 月發布,並於 2025 年 2 月推出 AlphaGeometry 2)是一個神經符號系統,在國際數學奧林匹亞幾何問題上達到奧林匹亞級別的表現,解決了 30 個問題中的 25 個。
- •Google 於 2025 年 10 月啟動了「AI 數學倡議」,與全球五個頂尖研究機構合作,旨在利用 AI 加速數學研究的發現,並將 Gemini Deep Think 和 AlphaEvolve 等 AI 系統納入其中。
📊 競品分析▸ Show
| 特性/模型 | Google (DeepMind) | OpenAI |
|---|---|---|
| 主要數學模型 | AlphaProof Nexus, AlphaGeometry, Minerva, Gemini Deep Think | 內部通用推理模型, GPT-5.2 Pro/Thinking, OpenAI o1, GPT-5 |
| 近期突破 | 解決 9 個開放的 Erdős 問題 (AlphaProof Nexus, 2026年5月) | 解決平面單位距離問題 (內部模型, 2026年5月) |
| 奧林匹亞級別幾何 | AlphaGeometry 在 IMO 幾何問題上解決 25/30 | 2025年7月報導達到 IMO 金牌表現 |
| 其他數學基準 | Gemini 3 Pro 在 SOOHAK 挑戰集上得分 30% | OpenAI o1 在 AIME 上得分 83.3% |
| 推理能力 | Gemini 3 Pro Deep Think 專為複雜推理任務設計,在 ARC-AGI-2 上領先 | GPT-5.2 Pro/Thinking 在 FrontierMath 等基準上表現強勁,強調通用推理和抽象能力 |
🛠️ 技術深入
- AlphaProof Nexus (Google DeepMind):該系統將大型語言模型與 Lean 形式證明助手結合,由 AI 提出證明,然後由獨立的驗證系統檢查每個邏輯步驟。它採用「代理循環」(agentic loops)進行迭代精煉,以解決數十年未解的數學問題。
- AlphaGeometry (Google DeepMind):這是一個神經符號系統,由一個神經語言模型和一個符號演繹引擎組成。它透過生成 1 億個合成幾何定理證明範例進行訓練,語言模型負責預測有用的構造,而符號引擎則執行嚴格的邏輯推導。AlphaGeometry 2 則使用經過微調的 Gemini 模型。
- Minerva (Google):基於 PaLM Transformer 架構,並進一步在包含 LaTeX、MathJax 等數學表達式的 118GB 科學論文(來自 arXiv)和網頁數據集上進行訓練。它結合了少樣本提示、思維鏈/草稿提示和多數投票等技術,以生成帶有 LaTeX 符號的逐步解決方案。
- OpenAI 內部通用推理模型:該模型被強調為一個通用推理模型,而非專門的數學系統,這暗示了其底層技術的廣泛適用性。OpenAI o1 模型則透過強化學習中的逐詞獎勵模型,培養內在的思維鏈式生成風格。
🔮 前景展望AI analysis grounded in cited sources
AI 將加速科學研究的發現,特別是在數學、物理、生物學和工程學等領域。
OpenAI 和 Google 的最新突破表明,AI 模型能夠解決長期未解的數學問題,並作為科學研究的強大工具,加速探索、測試和發現的過程。
結合神經語言模型和符號推理引擎的神經符號 AI 系統將成為解決複雜數學問題的關鍵。
Google 的 AlphaGeometry 和 AlphaProof Nexus 的成功證明了這種混合方法在處理幾何和開放數學問題方面的有效性,結合了 AI 的創造性與形式驗證的嚴謹性。
隨著 AI 在數學推理能力上的進步,對 AI 模型進行更嚴格、更全面的基準測試將變得至關重要。
現有基準測試可能無法完全評估 AI 的深層數學理解和推理質量,特別是在面對無解問題或需要嚴謹證明構造時,需要開發新的評估方法來優先考慮推理質量而非僅僅答案的正確性。
⏳ 時間線
2024-01
Google DeepMind 發布 AlphaGeometry,一個達到奧林匹亞級別的幾何 AI 系統。
2025-02
AlphaGeometry 2 發布,改進了 AlphaGeometry 並使用 Gemini 進行微調。
2025-07
Google DeepMind 的 Gemini Deep Think 達到 IMO 金牌標準。
2025-10
Google DeepMind 啟動「AI 數學倡議」,與五個研究機構合作。
2026-05
OpenAI 的通用推理模型解決了平面單位距離問題,一個自 1946 年以來懸而未決的數學難題。
2026-05
Google DeepMind 的 AlphaProof Nexus 解決了 9 個開放的 Erdős 問題,其中包含數十年未解的難題。
📎 來源 (23)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: The Neuron ↗

