Physics-Aware Novel-View Acoustic Synthesis with Vision-Language Priors and 3D Acoustic Environment Modeling
具有视觉-语言先验和3D声学环境建模的物理感知新视角声音合成
机构 * Group of Intelligent Signal Processing(智能信号处理组) ; Harbin Engineering University(哈尔滨工程大学) ; School of Intelligence Science and Technology(智能科学与技术学院) ; Nanjing University(南京大学) ; Processing Speech and Images(语音与图像处理) ; KU Leuven(库尔勒文大学) ; Acoustics Lab(声学实验室) ; University of Technology Sydney(悉尼技术大学) ; State Key Laboratory of Space Information System and Integrated Application(空间信息系统与集成应用国家重点实验室) ; Centre for Vision Speech and Signal Processing(视觉语音与信号处理中心) ; University of Surrey(萨里大学)
专题命中 文档图表理解 :vision-language model(abstract)
AI总结 Phys-NVAS通过整合视觉-语言语义先验与3D声学环境建模,实现了具有物理感知的新视角声音合成,提升了声音的真实感和物理一致性。
Comments ICASSP 2026 Accept, Project page: https://physnvas.github.io/