
MOCHA:透過 Chebyshev 退火優化 LLM 代理技能
MOCHA 是一個將 LLM 代理技能開發視為多目標問題的新優化框架。透過使用 Chebyshev 純量化與指數退火技術,它在平衡任務效能與平台限制方面優於傳統的提示詞優化器。
Tag: #llm-agents89 results

MOCHA 是一個將 LLM 代理技能開發視為多目標問題的新優化框架。透過使用 Chebyshev 純量化與指數退火技術,它在平衡任務效能與平台限制方面優於傳統的提示詞優化器。

DeepSeek 正在組建一個名為「Harness」的新團隊,專注於 AI 程式碼代理產品。該計畫旨在直接對標 Anthropic 旗下的 Claude Code,此消息已由資深研究員陳德里證實。

SkillSmith 是一個全新的編譯器執行時框架,透過將原始技能轉換為最小化的邊界導向執行介面,優化 LLM Agent 的效能。此方法消除了冗餘的推理與上下文注入,顯著降低了 Token 使用量、延遲與營運成本。

SPIN 是一種新型的 LLM 代理規劃封裝工具,透過強制執行有向無環圖 (DAG) 結構來減少無效工作流與工具成本。它在工業場景中透過在執行前驗證計畫,顯著提升了任務執行的效率與準確性。

這項研究提出了一種利用 LLM 代理根據任務分佈樣本合成專用求解器代碼的框架。合成後的求解器在執行速度和解的品質上,均顯著優於標準啟發式演算法及工業級工具如 Gurobi。

這項研究發現 LLM 在判斷工具必要性與實際執行工具呼叫之間存在顯著落差。研究指出,模型往往無法將其對工具需求的「認知」轉化為實際的「行動」。

這項研究為 LLM Agent 引入了一種模仿人類認知過程(如睡眠階段鞏固和基於干擾的遺忘)的記憶架構。它能有效管理長期互動數據,同時保持高檢索準確度並減少儲存需求。

Agent-BOM 提出統一階層圖形,用以使 LLM 代理具備安全可審計性,彌補低階事件與高階意圖的語義差距。它將模型與工具等靜態能力,分離自目標與動作等動態狀態。評估顯示能偵測記憶體中毒及多代理劫持等隱匿攻擊。

提出常數上下文技能學習,解決 LLM 代理在個人助理應用中的隱私-成本-能力衝突。重複程序提煉成輕量模組,經 SFT 和 RL 訓練,僅依賴當前觀察與緊湊狀態推斷。在 ALFWorld 達 89.6% 成功率,提示令牌減 2-7 倍,優於 ReAct。

BALAR 是一種任務無關的外迴圈演算法,讓大型語言模型在多輪互動中主動推理,無需微調。它維護潛在狀態的貝氏信念,透過最大化期望互信息選擇澄清問題,並動態擴展狀態表示。它在 AR-Bench-DC 上優於基準 14.6%、AR-Bench-SP 上 38.5%、iCraft-MD 上 30.5%。