
使用 Amazon Nova 與 rDPO 進行選擇性遺忘
AWS 介紹了 Reverse Direct Preference Optimization (rDPO),這是一種專為模型選擇性遺忘設計的新技術。此方法有助於減少內容審核中的過度拒絕問題,同時保持模型的整體效能。
Tag: #llm-optimization47 results

AWS 介紹了 Reverse Direct Preference Optimization (rDPO),這是一種專為模型選擇性遺忘設計的新技術。此方法有助於減少內容審核中的過度拒絕問題,同時保持模型的整體效能。

CreativityNeuro 是一種無需數據的新方法,透過對比權重引導來增強大型語言模型 (LLM) 的發散性思考能力。它能有效減少模式崩潰,並在無需微調或額外訓練數據的情況下,提升模型在創意任務中的表現。

阿里巴巴研究人員推出了 SkillWeaver 框架,透過執行圖與回饋迴圈進行組合式工具路由,優化 AI 代理效能。此方法避免了為每個子任務載入整個工具庫,從而顯著降低了 Token 消耗。

Contrastive Reflection 是一個透過識別錯誤行為片段並利用 Teacher LLM 提出針對性修改,進而優化 LLM 提示詞的新框架。此方法在 HotpotQA 基準測試中顯著優於隨機證據選擇,並達到了業界領先的效能。

ATOD 結合了策略內蒸餾與強化學習,突破了小型語言模型代理的效能上限。透過退火排程與回合級重權重機制,該方法在長程互動任務中展現了更高的成功率。

新加坡國立大學的研究人員開發了 MRAgent,這是一個以主動式、多步驟記憶重構取代靜態檢索的框架。與 LangMem 等傳統代理記憶系統相比,此方法顯著降低了 Token 消耗與運行成本。

針對七家主要 LLM 推論供應商的定價比較分析顯示,快取策略對總成本有顯著影響。作者強調,對於 AI Agent 和 RAG 管道而言,快取命中率通常比標題上的 Token 單價更為關鍵。

上海人工智慧實驗室的研究人員推出了 Self-Harness,這是一個讓基於 LLM 的 Agent 能夠系統性地優化其執行協議的框架。透過分析執行軌跡,該系統以實證驅動的自我優化取代了手動且隨機的除錯過程。

Stanford 研究人員推出了 DeLM,這是一個去中心化的框架,允許 AI 代理透過共享知識庫直接協調,無需中央協調器。與傳統的集中式多代理系統相比,這種方法減少了通訊瓶頸並降低了 50% 的推理成本。
OrcaRouter 引入了一種多模型協作方法,其性能優於單一大型模型,為 Fable 5 提供了一種具成本效益的替代方案。