
SkillJuror:優化 LLM Agent 技能組織以提升執行效能
SkillJuror 是一個評估程序性知識組織方式如何影響 LLM Agent 行為的新框架。研究發現,與扁平化的技能結構相比,「漸進式揭露」(Progressive Disclosure)能顯著提升 Agent 的資源利用率與任務成功率。
Tag: #prompt-engineering165 results

SkillJuror 是一個評估程序性知識組織方式如何影響 LLM Agent 行為的新框架。研究發現,與扁平化的技能結構相比,「漸進式揭露」(Progressive Disclosure)能顯著提升 Agent 的資源利用率與任務成功率。

一位 OpenAI 員工分享了一種利用 Codex 自我蒸餾技術來自動化重複性編碼工作的方法。透過使用特定的提示詞,開發者可以顯著減少手動勞動。

MOCHA 是一個將 LLM 代理技能開發視為多目標問題的新優化框架。透過使用 Chebyshev 純量化與指數退火技術,它在平衡任務效能與平台限制方面優於傳統的提示詞優化器。

ReElicit 是一個全新的貝葉斯優化框架,利用大型語言模型 (LLM) 來提取可解釋的特徵空間,進而優化系統提示詞。即使在僅有總體標量回饋的情況下,它也能實現有效的提示詞優化,表現優於傳統基準方法。
本文探討了用戶在思考任務中過度依賴AI而產生的「認知投降」現象。文章建議應將AI作為深度探索的工具,而非獲取答案的捷徑,以避免認知能力退化。

這篇 arXiv 研究將「政治可塑性」定義為大型語言模型根據使用者上下文調整政治回應的能力。使用少樣本範例的使用者提示有效在較大、較新模型中轉變意識形態,特別在經濟自由軸上。結果透過問題反轉揭示資料洩漏,並觀察到多語言變異。

OpenAI 和 Anthropic 發布 GPT-5.5 和 Claude 4.7 的提示詞指南,警告舊式逐步提示現在會增加噪音。新模型適合結果導向指令、更少絕對規則及明確停止條件。使用者須明確定義目標和個性以達最佳效能。

安德烈·卡帕西宣布軟體3.0轉變:LLM透過提示成為通用解釋器,取代程式碼與訓練。智能體工程監督AI叢集實現10倍生產力,人類保留品味與理解力。即使頂尖專家也感AI進化太快。

OpenAI 發表最新圖像生成模型 Images 2.0。它搭載「Thinking 模式」,能更深入解讀使用者指示。這讓製作簡報資料等視覺內容更輕鬆。

Anthropic 發布 Claude Opus 4.7,能可靠處理複雜編碼任務而無需持續監督。指示遵守能力大幅提升。建議重新調整提示以獲最佳效果。