📄ArXiv AI•較早收集於 24h
CWM提升具身代理動作可行性

💡具身代理動作評分硬負例Precision@1提升6.76%(67字)
⚡ 30-Second TL;DR
有什麼變化
使用InfoNCE對比目標與硬負例(語義相似但物理不相容)
為什麼重要
透過更好過濾不可行動作,提升具身代理管道可靠性。在ScienceWorld等需精準物理推理任務特別有影響。
下一步行動
使用ScienceWorld硬負例以InfoNCE微調你的LLM動作評分器。
誰應關注:Researchers & Academics
關鍵要點
- •使用InfoNCE對比目標與硬負例(語義相似但物理不相容)
- •在605個最小編輯負例對上Precision@1優於SFT +6.76個百分點
- •AUC-ROC 0.929 對比SFT的0.906
- •即時過濾:OOD下安全邊際-2.39 優於SFT的-3.96
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 8 個來源。
🔑 增強重點摘要
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2026-02
發表CWM論文於ArXiv,提出使用InfoNCE對比學習提升動作可行性評分
📎 來源 (8)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- arXiv — 2602
- arXiv — 2602
- arXiv — 2602
- pmc.ncbi.nlm.nih.gov — Pmc8932622
- par.nsf.gov — 10464796
- openaccess.thecvf.com — Shah Multi View Action Recognition Using Contrastive Learning Wacv 2023 Paper
- lmb.informatik.uni-freiburg.de — Paper Rince
- proceedings.neurips.cc — 03b13b0db740b95cb741e007178ef5e5 Paper Conference
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
每週 AI 簡報
每週一封,可隨時退訂。
