
TrajGenAgent:用於合成移動數據的階層式 LLM Agent
TrajGenAgent 是一個創新的階層式 LLM 框架,無需模型微調即可生成逼真的人類移動軌跡。它採用兩階段的協調者-執行者設計,結合了上下文學習與確定性的時空基礎定位。
Tag: #llm-agents89 results

TrajGenAgent 是一個創新的階層式 LLM 框架,無需模型微調即可生成逼真的人類移動軌跡。它採用兩階段的協調者-執行者設計,結合了上下文學習與確定性的時空基礎定位。

本研究分析了 LLM 代理如何透過提示詞、工具等外部 Harness 進行自我演化。研究發現,儘管不同等級的模型都能有效更新 Harness,但從這些更新中獲益的能力並非線性增長,中階模型反而表現出最強的獲益能力。
第二屆 COLM 大型語言模型社會模擬研討會 (Social Sim'26) 現正徵稿,重點關注模擬的真實性、穩健性與可解釋性。該研討會邀請跨領域研究人員探討基於 LLM 的模擬社會。

據報導,DeepSeek 正在組建名為「Harness」的新團隊,專注於開發 AI 編程智能體。此舉顯示其正朝向自主軟體開發能力的戰略方向邁進。

研究顯示,儘管 LLM 能準確建模對手的偏好,但在談判中卻無法有效利用這些資訊來獲取策略優勢。最終協議往往受限於表面的錨定效應,而非真正的效用最佳化。

SkillLens 提出階層式技能演化框架,將技能組織成政策、策略、程序與原語四層結構。它透過技能圖的隨機遊走檢索相關子技能,並使用驗證器高效適應。系統超越基準,在 ALFWorld 上成功率提升至 51.31%。

ADAPTS框架使用混合代理LLM從臨床訪談中評分憂鬱與焦慮嚴重度,將其分解為症狀特定任務並提供可審核理由。在高差異訪談中優於人類評分(誤差22 vs 26),並在N=204樣本上以擴展協議達ICC 0.877。純文字但可擴展至多模態,用於可擴充精神評估。

LLM 代理僅使用論文方法描述和原始資料,即可重現實證社會科學結果,無需存取程式碼或結果。系統提取結構化方法、在隔離環境執行重新實作,並逐单元格比較輸出。在 48 篇論文評估中,不同模型與支架表現差異大,失敗原因來自代理錯誤或論文描述不足。

研究人員提出共形可解釋性框架,用以解碼 LLM 代理在序列任務中內部表示的時間概念。它使用逐步獎勵建模與共形預測,將激活標記為成功或失敗,然後訓練線性探針識別如推理漂移等關鍵方向。在 ScienceWorld 和 AlfWorld 的實驗證實線性可分離性,並展示用於提升效能的導向潛力。

LDTL將順序臨床診斷表述為規劃LLM代理與診斷LLM代理的框架。它將診斷序列視為潛在軌跡,由優先減少不確定性的後驗分佈引導。在MIMIC-CDM基準上超越基線,診斷準確率更高且測試次數更少。