OpenAI 公布 Astra 模型,成功解決 10 個未解數學難題
OpenAI 發表了下一代旗艦模型 Astra,該模型已成功解決 10 個數學與理論計算機科學領域的未解難題。此模型展現了在高等數學研究與形式化驗證方面的巨大潛力。
Tag: #scientific-reasoning5 results
OpenAI 發表了下一代旗艦模型 Astra,該模型已成功解決 10 個數學與理論計算機科學領域的未解難題。此模型展現了在高等數學研究與形式化驗證方面的巨大潛力。

Sci-PRM 是一種新型過程獎勵模型,旨在透過整合工具執行與邏輯驗證來提升科學推理能力。它利用 SCIPRM70K 資料集,針對工具選擇與結果解釋提供細粒度的監督,有效減少複雜科學領域中的幻覺問題。
25k 實驗顯示 AI 科學家無科學推理產出結果:68% 忽略蒐集證據,71% 從未更新信念,僅 26% 在矛盾時修訂假設。它們僵硬循環,不如人類適應問題類型。更好提示/鷹架等熱門修復無效。

基於LLM的科學代理能執行工作流程與探究,但68%的軌跡忽略證據,且鮮少透過駁斥修正信念。基礎模型主導效能(41.4%變異),鷹架僅1.5%。需直接訓練推理,僅依結果無法驗證科學知識。

四項關鍵基準測試—HLE、FrontierScience、SDE 和 LABBench2—揭露 AI 在科研中的缺口,從記憶瑣碎知識到處理完整工作流程。頂尖模型如 Gemini3DeepThink 在知識上得分高,但在開放式創新和專案執行上失利。這些測試引導 AI 朝真正科學推理發展。