Search

Tag: #chain-of-thought30 results

CAP-CoT 提升 LLM 思考鏈穩定性

CAP-CoT 提升 LLM 思考鏈穩定性

CAP-CoT 提出循環對抗提示框架,提升大型語言模型(LLM)中思考鏈(CoT)推理的準確性和穩定性。正向求解器產生推理鏈,對抗挑戰者使用針對性錯誤策略製造有瑕疵鏈,反饋代理對比兩者並產生步驟對齊的結構化反饋。在 2-3 個循環後,六個基準測試和四個 LLM 骨幹顯示變異性降低及魯棒性提升。

ArXiv AIResearchApr 29#chain-of-thought#prompt-optimization
推理模型難控思維鏈

推理模型難控思維鏈

新CoT-Control評估套件顯示,推理模型對思維鏈的控制力遠低於最終輸出,例如Claude Sonnet 4.5僅2.7%控制思維鏈,但61.9%控制輸出。控制力隨模型規模、RL訓練、計算資源及難度增加而降低。結果顯示儘管有規避企圖,CoT監控仍具可行性。

RLCER Evolves CoT Rubrics

RLCER Evolves CoT Rubrics

RLCER reinforces chain-of-thought via self-evolving rubrics without human labels. Outperforms outcome-centric RLVR on reasoning tasks. Rubrics boost inference as prompts.

ArXiv AIResearchFeb 12#research#rlcer#v1
Page 3 of 3