📄較早收集於 24h

CWM提升具身代理動作可行性

CWM提升具身代理動作可行性
PostLinkedIn
📄閱讀原文: ArXiv AI
#embodied-ai#contrastive-learning#world-modelscwmcwmsciworldllm

💡具身代理動作評分硬負例Precision@1提升6.76%(67字)

⚡ 30-Second TL;DR

有什麼變化

使用InfoNCE對比目標與硬負例(語義相似但物理不相容)

為什麼重要

透過更好過濾不可行動作,提升具身代理管道可靠性。在ScienceWorld等需精準物理推理任務特別有影響。

下一步行動

使用ScienceWorld硬負例以InfoNCE微調你的LLM動作評分器。

誰應關注:Researchers & Academics

關鍵要點

  • 使用InfoNCE對比目標與硬負例(語義相似但物理不相容)
  • 在605個最小編輯負例對上Precision@1優於SFT +6.76個百分點
  • AUC-ROC 0.929 對比SFT的0.906
  • 即時過濾:OOD下安全邊際-2.39 優於SFT的-3.96

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 8 個來源。

🔑 增強重點摘要

  • CWM特別在拒絕式負例(詞彙明顯不同的無效動作)上與SFT表現相同(97.8% P@1),但在跨任務移植負例上優化+3.3個百分點。[1][2]
  • CWM將動作評分框架為對比排序問題,使用InfoNCE損失訓練模型在正例與負例間拉開邊際,特別強調硬負例的softmax正規化。[1][2]
  • ScienceWorld基準測試確認CWM在活體過濾中於OOD壓力下金標準動作排名更靠前,提供更可靠的物理可行性表示。[1]

🔮 前景展望AI analysis grounded in cited sources

CWM將成為具身代理標準動作評分組件
其在硬負例上的顯著優勢證明對比訓練能捕捉物理可行性邊界,提升代理在真實世界部署的安全性。[1][2]
InfoNCE硬負例微調將擴展至其他LLM代理任務
論文討論顯示此方法在狹窄分數邊界時最有效,可推廣至規劃與推理上游模組。[2]

時間線

2026-02
發表CWM論文於ArXiv,提出使用InfoNCE對比學習提升動作可行性評分
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。