OpenAI 模型解決了 80 年未解的數學難題
OpenAI 宣布其內部 AI 模型成功反證了一個長達 80 年的離散幾何猜想。此成果已獲得外部數學家的驗證,標誌著 AI 在執行複雜數學推理能力上的重要里程碑。
Tag: #reasoning112 results
OpenAI 宣布其內部 AI 模型成功反證了一個長達 80 年的離散幾何猜想。此成果已獲得外部數學家的驗證,標誌著 AI 在執行複雜數學推理能力上的重要里程碑。

Alibaba DAMO Academy 的 I2B-LPO 框架已被 ACL 2026 接收,旨在解決 RLVR 同質化問題。透過優化推理路徑,該框架將數學推理準確率提升了 5.3%,語義多樣性提升了 7.4%。

DeepMind 推出 Gemma 4,這是其迄今最智能的開源模型。這些模型專為進階推理和代理工作流程而建,並宣稱是位元組對位元組最強大的開源模型。

Corti 推出 Symphony AI,在醫學編碼基準測試中勝過 OpenAI 和 Anthropic。基於最大規模的同行評審醫學編碼研究,將編碼視為推理任務。現在透過 API 提供,用於臨床筆記標準化。

ARC-AGI-3 是 AGI 基準測試的最新版本,已重置前沿 AI 模型的排行榜。此更新以新穎任務挑戰系統的抽象與推理能力。另有附註提及用於公司 Slack 建立品牌反應 GIF 的工具。

英偉達執行長老黃入局,發布最強開源Agent推理模型。公司宣布260億美元投入開源模型。

OpenAI 的 GPT-5.4 Pro 使用遺忘的 2011 年預印本解決首個 Tier 4 數學題。它獲得代理功能如發出滑鼠點擊指令,並在試算表方面卓越。改進包括預先規劃、更少 token 和更好的 Epoch AI 數學基準。

ChatGPT 推出 GPT-5.4 Thinking,提升更深層推理和工作流程能力,適用於更大、更複雜的任務。GPT-5.3 Instant 仍為日常快速使用的預設選項。此更新強化 ChatGPT 處理進階 AI 互動的能力。

微軟推出開源權重 Phi-4 15B 多模態模型,其獨特之處在於能自行決定何時深入思考或直接回答。擁有 150 億參數,專為影像描述、介面元素辨識與複雜數學推理等高難度任務設計。

Gemini 3.1 Pro 推出,強化思考力並大幅提升代理執行能力,以處理複雜任務。它從「思考 AI」轉變為「工作 AI」,具基準測試進展與功能升級。開發者觀點解析此進化方向。