來源較早收集於 23h

NormAct 基準測試評估具身智能中的隱性社會規範

閱讀原文: ArXiv AI
#embodied-ai#social-norms#benchmarking#mllm

了解為何頂尖 MLLM 在基本社會規範上表現不佳,以及如何透過 NormPerceptor 改進具身智能體的規劃能力。

30 秒速覽

有什麼變化

推出 NormAct 以衡量目標達成率、規範合規性和任務成功率。

為什麼重要

這項研究突顯了當前基於 MLLM 的機器人技術的關鍵局限性,表明未來的具身智能體需要更好的情境感知能力,才能安全且適當地在人類環境中運作。

下一步行動

從 Hugging Face 下載 NormAct 數據集,以測試您的具身智能體在複雜環境中處理隱性社會約束的能力。

誰應關注:Researchers & Academics

關鍵要點

  • •推出 NormAct 以衡量目標達成率、規範合規性和任務成功率。
  • •發現顯著的性能差距:67.3% 的目標達成率對比 26.4% 的規範合規率。
  • •提出 NormPerceptor,透過在規劃前推斷場景相關規範來提高任務成功率。
  • •基準測試數據集已在 Hugging Face 上公開,供後續研究使用。

深度解析

本篇為 AI 生成分析,非原文內容。

增強重點摘要

  • •NormAct 基準測試涵蓋了多種具身場景,包括家庭、辦公室和公共空間,以模擬真實世界中複雜的社會互動環境。
  • •研究團隊發現,現有的多模態大型語言模型(MLLM)在處理隱性規範時,常表現出對顯性指令的過度依賴,導致在缺乏明確規則時出現行為偏差。
  • •NormPerceptor 模組採用了兩階段推理架構,先進行場景語義解析,再進行規範約束映射,顯著降低了模型在執行任務時的違規風險。
  • •該基準測試引入了「社會敏感度評分」(Social Sensitivity Score),用於量化模型在不同文化背景或情境下對規範理解的細微差異。
  • •NormAct 的數據集構建過程結合了人類反饋強化學習(RLHF)的數據標註方法,確保了規範合規性評估的客觀性與權威性。

競品分析

NormAct
核心評估重點
隱性社會規範與具身規劃
社會規範處理能力
高(專注於隱性約束)
數據集規模
中等
ALFRED
核心評估重點
具身指令遵循與導航
社會規範處理能力
低(側重任務完成)
數據集規模
大規模
BEHAVIOR
核心評估重點
家庭環境任務執行
社會規範處理能力
中(側重物理交互)
數據集規模
大規模
Ego4D
核心評估重點
第一人稱視角動作識別
社會規範處理能力
低(側重行為預測)
數據集規模
超大規模

技術深入

  • NormPerceptor 架構:採用基於 Transformer 的解碼器,將場景圖像特徵與規範知識庫進行交叉注意力(Cross-Attention)計算。
  • 規範約束映射:利用提示工程(Prompt Engineering)將隱性社會規則轉化為具身代理的動作懲罰函數(Penalty Functions)。
  • 評估指標計算:目標達成率(TAR)計算成功完成任務的比例,規範合規率(NCR)則基於預定義的社會行為準則進行自動化檢測。
  • 數據集格式:採用標準化 JSON 格式,包含場景描述、初始狀態、目標狀態及隱性規範標籤。

前景展望基於引用來源的 AI 分析

具身智能將從單純的任務導向轉向社會感知導向。
NormAct 的研究表明,未來的具身模型必須具備理解隱性社會規則的能力,才能在人類共存環境中安全部署。
社會規範對齊將成為多模態模型訓練的標準流程。
隨著 NormAct 等基準測試的普及,規範合規性將與任務成功率並列,成為衡量具身智能模型性能的核心指標。

時間線

2026-03
NormAct 研究團隊開始收集具身智能中的隱性社會規範數據集。
2026-05
NormPerceptor 模組原型開發完成,並在初步測試中顯示出對規範合規性的提升。
2026-06
NormAct 基準測試正式發布並在 Hugging Face 上開源。

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。