
Riemann-Bench:AI 研究級數學基準
Riemann-Bench 推出 25 道專家策劃的私人問題,用於評估 AI 在超越 IMO 奧林匹克任務的研究級數學能力。前沿模型即使使用工具和開放推理,也得分低於 10%。基準採用雙盲驗證和程式化檢查以確保真實性。
Tag: #ai-reasoning7 results

Riemann-Bench 推出 25 道專家策劃的私人問題,用於評估 AI 在超越 IMO 奧林匹克任務的研究級數學能力。前沿模型即使使用工具和開放推理,也得分低於 10%。基準採用雙盲驗證和程式化檢查以確保真實性。
Anthropic 表示,其 AI 在最初遭遇困難後,針對未解的黎曼猜想取得了新發現。該公司指出,「不要放棄」等鼓勵可能幫助 AI 持續探索,而 AI 系統或許也會低估自身的進步速度。

據報導,OpenAI 系統處理了一項數學猜想,但數學家認為其結果已偏離原始問題。隔天發表的人類論文則質疑 AI 生成的反例並認為其無效。

這項研究引入了一種層論(Sheaf-theoretic)框架,幫助 AI 代理判斷其表徵框架何時失效。透過測量殘差擬合與約束違規等阻礙因素,AI 可以決定是應變形現有模型,還是擴展其語言體系。
蘋果強調推理與規劃是智能 AI 系統的基石,能讓其規劃、互動與適應。該公司長期投入此領域研究,發表多篇論文探討新技術及現有方法的限制。蘋果去年舉辦類似工作坊,並將於 2025 年再度舉辦。
ThinkRouter introduces confidence-aware routing between latent and discrete spaces for efficient AI reasoning. It switches to discrete tokens during low-confidence steps to reduce noise from latent embeddings. Experiments show major accuracy gains on STEM and coding tasks while shortening outputs.

Google announced a major upgrade to Gemini 3 Deep Think, a reasoning model for science, research, and engineering. Google AI Ultra subscribers can access it via the Gemini App. Early API access is open to select researchers, engineers, and enterprises.