Controllable Audio-Visual Viewpoint Generation from 360° Spatial Information
机构 * Sapienza University of Rome, Italy(罗马大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、cs.MM
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Sapienza University of Rome, Italy(罗马大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、cs.MM
机构 * University of Michigan(密歇根大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Toronto(多伦多大学) ; University of Toronto Mississauga(多伦多大学滑铁卢分校)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
Comments 7 pages, accepted to SIGCSE2026
专题命中 音频语音多模态 :multimodal(abstract)