Presentation
MAViD: A Multimodal Framework for Audio-Visual Dialogue Understanding and Generation
SessionMultimodal Learning
DescriptionMAViD is a multimodal framework for interactive audio-visual dialogue. Its Conductor-Creator architecture integrates multimodal understanding and reasoning into response generation. By combining AR and diffusion models, MAViD enables synchronized, long-duration audio-video generation with consistent identity and timbre, delivering vivid and contextually coherent digital human interactions.

Event Type
Technical Paper
TimeThursday, 23 July 20264:05pm - 4:15pm PDT
LocationRoom 403 A
Digital Library
PDF
Session Time & Location
Sunday, 19 July 20266:00pm - 8:45pm PDTHall K
Thursday, 23 July 20263:45pm - 5:15pm PDTRoom 403 A
Generative AI
Full Conference Supporter
Full Conference