Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model
机构 * Chinese Academy of Sciences(中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tencent AI Lab(腾讯AI实验室) ; Institute of Automation School of Artificial Intelligence(自动化研究所人工智能学院)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)
Comments Accepted by Interspeech 2025