Search

Tag: #llm-reasoning33 results

Goldilocks RL:調整任務難度提升LLM推理

Goldilocks RL:調整任務難度提升LLM推理

Apple 推出 Goldilocks RL,一種教師驅動的資料取樣策略,為學生模型預測問題難度,用於強化學習。它透過動態調整任務難度解決 LLM 推理中的稀疏獎勵問題,提升樣本效率,優於靜態課程學習。此方法有助模型以最小回饋探索廣大搜尋空間。

Apple Machine LearningOfficialMar 18#curriculum-learning#llm-reasoning
Anthropic 與 OpenAI 推出免費 LLM 安全掃描器

Anthropic 與 OpenAI 推出免費 LLM 安全掃描器

Anthropic 於 2 月 20 日推出 Claude Code Security,利用 LLM 推理發現傳統 SAST 遺漏的 500 多個未知高嚴重性漏洞。OpenAI 於 3 月 6 日跟進推出 Codex Security,掃描 120 萬筆提交記錄,找出 792 個關鍵問題與 14 個 CVE,虛陽性率低。這兩個企業免費工具透過推理而非模式匹配,揭露 SAST 的結構盲點。

VentureBeatMediaMar 10#llm-reasoning#sast-alternative
ConstraintBench:LLM 最佳化基準測試

ConstraintBench:LLM 最佳化基準測試

ConstraintBench 推出一個基準測試,用於評估 LLM 在 10 個營運研究領域中直接解決約束最佳化問題,無需求解器。對六個前沿模型在 200 個任務上的評估顯示,可行性是主要瓶頸,最佳模型僅達 65% 約束滿足率,但聯合最佳性低。基準測試與評估工具將公開發布。

Page 3 of 4