
Goldilocks RL:調整任務難度提升LLM推理
Apple 推出 Goldilocks RL,一種教師驅動的資料取樣策略,為學生模型預測問題難度,用於強化學習。它透過動態調整任務難度解決 LLM 推理中的稀疏獎勵問題,提升樣本效率,優於靜態課程學習。此方法有助模型以最小回饋探索廣大搜尋空間。
Tag: #llm-reasoning33 results

Apple 推出 Goldilocks RL,一種教師驅動的資料取樣策略,為學生模型預測問題難度,用於強化學習。它透過動態調整任務難度解決 LLM 推理中的稀疏獎勵問題,提升樣本效率,優於靜態課程學習。此方法有助模型以最小回饋探索廣大搜尋空間。

Anthropic 於 2 月 20 日推出 Claude Code Security,利用 LLM 推理發現傳統 SAST 遺漏的 500 多個未知高嚴重性漏洞。OpenAI 於 3 月 6 日跟進推出 Codex Security,掃描 120 萬筆提交記錄,找出 792 個關鍵問題與 14 個 CVE,虛陽性率低。這兩個企業免費工具透過推理而非模式匹配,揭露 SAST 的結構盲點。

多代理辯論(MAD)受馬丁格爾詛咒影響,代理因相關錯誤而匯聚至錯誤共識。AceMAD 透過同儕預測利用非對稱認知勢能打破此詛咒,將匯聚導向真相。在六個基準的挑戰子集上大幅優於基準方法。

ConstraintBench 推出一個基準測試,用於評估 LLM 在 10 個營運研究領域中直接解決約束最佳化問題,無需求解器。對六個前沿模型在 200 個任務上的評估顯示,可行性是主要瓶頸,最佳模型僅達 65% 約束滿足率,但聯合最佳性低。基準測試與評估工具將公開發布。

香港浸會大學與上海交通大學研究人員提出Co-rewarding,一個獲ICLR 2026接收的自監督RL框架。它透過互補自監督訊號,在無ground-truth標註下穩定訓練,防止LLM推理誘導中的獎勵駭客與崩潰。解決RLVR標註瓶頸與自獎勵失敗問題。

NVIDIA 分析了 Nemotron Model Reasoning Challenge 的數據,該挑戰賽吸引了超過 5,000 名參與者探索提升推理準確性的技術。研究重點在於標準化基準測試與基礎架構如何揭示開源模型的有效優化策略。

本研究將潛在思維鏈(Latent CoT)推理建模為表徵空間中的軌跡,並應用動力系統分析來理解 CODI 和 COCONUT 等模型的推理演化過程。研究識別出不同的穩定性行為,為提升潛在推理方法的解釋性與效能提供了新框架。

研究人員推出了 HALE 框架,將 LLM 整合至代理人基於建模 (ABM) 中,以動態模擬人類決策。此方法克服了傳統模擬中靜態先驗的限制,並透過 Salt Lake County 的 COVID-19 案例研究進行了驗證。

ProMAS 是一種針對 LLM 驅動的多代理系統,使用馬可夫轉換動態進行錯誤預測的主動框架。它提取因果 Delta 特徵,並將推理建模為量化向量馬可夫空間中的機率轉換。在 Who&When 基準測試中,它達到 22.97% 步驟級準確率,僅處理 27% 的推理日誌,比反應式方法減少 73% 資料開銷。
阿里巴巴的 Qwen 模型成功預測了世界盃首日的比分、紅牌以及絕殺進球。這次展示突顯了該模型在處理複雜現實場景時的進階推理與預測能力。