SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language Models
机构 * Columbia University(哥伦比亚大学) ; University of Washington(华盛顿大学)
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(abstract);分类 cs.CL、cs.AI、eess.AS
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Columbia University(哥伦比亚大学) ; University of Washington(华盛顿大学)
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(abstract);分类 cs.CL、cs.AI、eess.AS
机构 * School of Physical Sciences University of Science and Technology of China(中国科学技术大学物理科学学院)
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Accepted to BMVC 2024
机构 * Fudan University(复旦大学) ; Multimodal Art Projection Research Community(多模态艺术投影研究社区) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 音频语音多模态 :multimodal(title,abstract);any-to-any(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 28 pages, 16 figures, under review, work in progress
机构 * Zhengzhou University(郑州大学) ; Zhejiang Lab(浙江实验室) ; Xi'an Jiaotong University(西安交通大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Accepted by the ACM MM 2025 Workshop on SVC
机构 * China University of Mining and Technology(中国矿业大学) ; Kuaishou Technology(快手科技)
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments 12 pages, 2 figures
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Project page: https://github.com/jasongief/TGS-Agent
机构 * School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学) ; Kuaishou Technology(快手科技) ; Tianjin Key Laboratory of Cognitive Computing and Application, College of Intelligence and Computing, Tianjin University(认知计算与应用重点实验室,智能计算学院,天津大学) ; Department of Automation, BNRist, Tsinghua University(自动化系,北研所,清华大学) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Science(深圳先进技术研究院,中国科学院)
专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
机构 * School of Electronics and Information, Northwestern Polytechnical University(电子与信息学院,西北工业大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Shaanxi Key Laboratory of Information Acquisition and Processing(信息获取与处理陕西省重点实验室)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS
Journal ref IEEE Transactions on Image Processing 2025
机构 * Kuaishou Technology(快手科技)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CL、cs.AI、eess.AS
机构 * Xiamen University(厦门大学) ; Beijing Jiaotong University(北京交通大学) ; School of Electronic Science and Engineering(电子科学与技术学院) ; School of Electronic Information(电子信息学院) ; School of Informatics(信息学院)
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract)
机构 * School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学) ; Kuaishou Technology Co., Ltd.(快手科技有限公司) ; Tianjin Key Laboratory of Cognitive Computing and Application, College of Intelligence and Computing, Tianjin University(认知计算与应用重点实验室,智能计算学院,天津大学) ; Department of Automation, Tsinghua University(自动化系,清华大学) ; Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学与技术国家研究中心,清华大学) ; Migu Culture Technology Co., Ltd.(咪咕文化科技有限公司) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Science(深圳先进技术研究院,中国科学院)
专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
机构 * Technische Universität Berlin(柏林技术大学) ; Rice Univ(莱斯大学) ; Univ of Bonn(波恩大学) ; Spector Inc(Spector公司) ; Microsoft(微软) ; IIIT Hyderabad(海得拉巴国家理工学院)
专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments 26 pages, 15 figures, The Thirteenth International Conference on Learning Representations, ICLR-2025, Singapore. https://openreview.net/pdf?id=0dELcFHig2
Journal ref ICLR-2025, Sinapore
机构 * Goethe University of Frankfurt(法兰克福歌德大学) ; MIT(麻省理工学院) ; IBM Research(IBM研究院) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) ; Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments To be published at CVPR 2025, code available at https://github.com/edsonroteia/cav-mae-sync
机构 * Peking University(北京大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of Illinois Chicago(伊利诺伊大学香槟分校) ; University of Washington(华盛顿大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM、eess.AS
专题命中 音频语音多模态 :omni-modal(title);multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Accepted to ICLR 2025
专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI、eess.AS
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Accepted by CVPR 2025
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、eess.AS
专题命中 音频语音多模态 :multimodal(title);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Accepted by WACV2025
Journal ref WACV2025
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted by AAAI 2025
专题命中 音频语音多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Github Repo: https://github.com/InternLM/InternLM-XComposer/tree/main/InternLM-XComposer-2.5-OmniLive
专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments 16 pages, 4 figures
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Published in the Proceedings of the International Symposium on Visual Computing, 2021 https://dl.acm.org/doi/10.1007/978-3-030-90436-4_10
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Under-review
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments NeurIPS 2024
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Accepted to INTERSPEECH 2024
Journal ref Proc. Interspeech 2024, 4728-4732