arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-28 至 2026-01-28 共收录 1 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 1 篇

2601.19712 2026-01-28 cs.SD cs.MM 50%

Physics-Aware Novel-View Acoustic Synthesis with Vision-Language Priors and 3D Acoustic Environment Modeling

具有视觉-语言先验和3D声学环境建模的物理感知新视角声音合成

Congyi Fan, Jian Guan, Youtian Lin, Dongli Xu, Tong Ye, Qiaoxi Zhu, Pengming Feng, Wenwu Wang

机构 * Group of Intelligent Signal Processing(智能信号处理组) Harbin Engineering University(哈尔滨工程大学) School of Intelligence Science and Technology(智能科学与技术学院) Nanjing University(南京大学) Processing Speech and Images(语音与图像处理) KU Leuven(库尔勒文大学) Acoustics Lab(声学实验室) University of Technology Sydney(悉尼技术大学) State Key Laboratory of Space Information System and Integrated Application(空间信息系统与集成应用国家重点实验室) Centre for Vision Speech and Signal Processing(视觉语音与信号处理中心) University of Surrey(萨里大学)

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 Phys-NVAS通过整合视觉-语言语义先验与3D声学环境建模,实现了具有物理感知的新视角声音合成,提升了声音的真实感和物理一致性。

Comments ICASSP 2026 Accept, Project page: https://physnvas.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏