Artificial Intelligence #voice activity projection#turn-taking prediction
MuVAP: New AI Model Predicts Turn-Taking in Multiparty Conversations Using Audio and Video
Researchers introduce MuVAP, a causal multimodal framework that predicts turn-taking in multiparty conversations using monaural audio and a single camera. The model extends Voice Activity Projection by grounding acoustic predictions in face tracks, and a new 31-hour corpus of unedited conversations supports training.
Jun 17, 2026 1 source