Search

Tag: #llm-agents89 results

代理從論文重現社會科學結果

代理從論文重現社會科學結果

LLM 代理僅使用論文方法描述和原始資料,即可重現實證社會科學結果,無需存取程式碼或結果。系統提取結構化方法、在隔離環境執行重新實作,並逐单元格比較輸出。在 48 篇論文評估中,不同模型與支架表現差異大,失敗原因來自代理錯誤或論文描述不足。

LLM 代理時間概念的共形可解釋性

LLM 代理時間概念的共形可解釋性

研究人員提出共形可解釋性框架,用以解碼 LLM 代理在序列任務中內部表示的時間概念。它使用逐步獎勵建模與共形預測,將激活標記為成功或失敗,然後訓練線性探針識別如推理漂移等關鍵方向。在 ScienceWorld 和 AlfWorld 的實驗證實線性可分離性,並展示用於提升效能的導向潛力。

Page 7 of 9