MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control
MAVIN:具有叙事控制的多镜头视听生成
机构 * Peking University(北京大学) ; Kling Team, Kuaishou Technology(快手团队) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Sun Yat-sen University(中山大学)
AI总结 提出MAVIN框架,通过边界感知注意力、ID感知传播和多智能体脚本管线,实现多镜头视听生成中的叙事控制,解决时间错位、可控性差和脚本不完整问题。
Comments Accepted to ECCV 2026