
R2-OPD 以推理進展篩選蒸餾訊號
R2-OPD 透過抑制與模型實際推理進展衝突的教師回饋,改進 on-policy distillation。該方法比較教師獎勵排名與獨立估算的推理進展排名,以提供更可靠的監督訊號。
Tag: #reasoning112 results

R2-OPD 透過抑制與模型實際推理進展衝突的教師回饋,改進 on-policy distillation。該方法比較教師獎勵排名與獨立估算的推理進展排名,以提供更可靠的監督訊號。

Ornith-1.5 推出 397B、35B 與 9B 三種參數規模的開放模型。這些模型具備自我改進的任務與腳手架生成能力,並在程式設計與推理基準測試中展現強勁表現。

Anthropic研究人員在Claude模型中發現了一個名為「J-space」的內部區域,該區域在訓練過程中自發形成,負責控制思考與推理,這被視為通往AGI的潛在證據。

一篇論文據稱指出,強化學習只會改變推理 token 的 1–3%。論文還宣稱,不使用 RL 也能以約千分之一的計算量重現類似成效。

OpenAI 宣佈推出一款新模型,能夠解決 10 項菲爾茲獎(Fields Medal)研究等級的複雜數學難題。這標誌著 AI 在執行高階邏輯推理與科學發現能力上的重大里程碑。
全新的「Schema」評測工具透過優化模型與遊戲環境之間的互動流程,提升了在 ARC-AGI-3 基準測試上的表現。它利用 Claude Opus 4.8 和 Fable 5,在不修改模型權重的情況下達到了 99% 的準確率。

GPT-5.6 在數學研究領域取得突破,於一小時內破解了困擾學界 50 年的數學猜想。該系統透過 700 字的提示詞(Prompt)成功調度 64 個子智能體協同工作。

智源悟界·Orca 模型旨在超越單純的任務執行,教導模型理解世界的變化,該研究近期登上 Hugging Face 論文月榜第一。

First Proof計畫針對四個AI系統進行了原創且未公開的研究級數學題測試,結果顯示儘管AI表現亮眼,但在整體研究能力上仍落後於頂尖人類數學家。

AI 實驗室 General Intuition 正尋求 3 億美元融資,旨在利用電子遊戲數據訓練 AI 代理。該公司專注於教導模型進行空間與時間的推理。