ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
机构 * Hong Kong University of Science and Technology (HKUST)(香港理工大学) ; Tongyi Fun Team, Alibaba Group(阿里云团队) ; Zhejiang University(浙江大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV
Comments Accepted by NeurIPS 2025 Main