Investigating and Enhancing Vision-Audio Capability in Omnimodal Large Language Models
机构 * Beijing Key Lab of Traffic Data Analysis and Mining(北京交通数据挖掘重点实验室) ; Beijing Jiaotong University(北京交通大学) ; Unisound AI Technology Co., Ltd.(Unisound人工智能技术有限公司) ; Peng Cheng Lab(鹏城实验室)
Comments Accepted to ACL 2025 Findings
Journal ref Findings of the Association for Computational Linguistics: ACL 2025