📄ArXiv AI•最新收集於 15h
基準揭示語音代理的隱性指令遵循缺口

#floor-management#voice-agents#safety-conflictduplexspeechbench-ifevalduplexspeechbench-ifevalf-actorpersonaplexgpt-realtimeminicpm-o
💡了解語音代理為何能遵循角色內容,卻無法靈活管理對話話語權。
⚡ 30-Second TL;DR
有什麼變化
基準涵蓋五種條件設定:預設行為、明確規則、僅角色設定、角色加規則,以及指令衝突。
為什麼重要
研究結果顯示,角色提示、對話時機掌控與以安全為導向的指令解析,是彼此獨立的工程問題,而非單一的指令遵循能力。開發即時語音代理的團隊應明確測試推斷出的行為,不應只依賴角色描述。
下一步行動
在部署前,使用類似 DuplexSpeechBench-IFEval 的測試,分別評估全雙工語音代理在僅角色設定、明確規則與安全衝突條件下的表現。
誰應關注:Researchers & Academics
關鍵要點
- •基準涵蓋五種條件設定:預設行為、明確規則、僅角色設定、角色加規則,以及指令衝突。
- •研究使用 Instruction Adherence Score 以決定性方式評估對話輪次管理,並使用由 LLM 判定的 Persona Adherence Score 評估內容一致性。
- •在僅使用角色設定時,F-Actor 與 PersonaPlex 的遵循度分別下降 9.7% 與 4.5%。
- •GPT-Realtime、MiniCPM-o 與 Fun-Audio-Chat 能維持符合角色的內容,但對話輪次行為適應有限,主動行動能力也受約束。
- •系統即使能依照衝突指令維持指定角色,遇到安全衝突時仍難以覆寫原有指令。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
每週 AI 簡報
每週一封,可隨時退訂。