
AMUSE Benchmark for Multi-Speaker AV Agents
Apple introduces AMUSE, a benchmark for multimodal LLMs in agentic multi-speaker dialogue scenarios. Models like GPT-4o and Qwen3-Omni excel in perception but falter in tracking speakers, roles, and events across audio-video streams. It targets applications like conversational assistants and meeting analytics.






