Towards General Auditory Intelligence: Large Multimodal Models for Machine Listening and Speaking
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 eess.AS
Comments 22 pages, 11 figures
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 eess.AS
Comments 22 pages, 11 figures
机构 * School of Information and Communication Engineering, Dalian University of Technology(信息与通信工程学院,大连理工大学) ; School of Future Technology and the School of Artificial Intelligence, Dalian University of Technology(未来技术学院和人工智能学院,大连理工大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV
Comments Accepted to IEEE Transactions on Multimedia
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV
机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) ; School of Cyber Science and Engineering, Zhengzhou University(郑州大学网络科学与工程学院) ; School of Software, Northwestern Polytechnical University(西北工业大学软件学院) ; Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) ; Inspur Group(Inspur集团) ; Research Center for Space Computing System, Zhejiang Lab(浙江实验室空间计算系统研究中心)
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV
机构 * Tsinghua University(清华大学) ; Tongyi Lab(通义实验室) ; Peking University(北京大学) ; OpenRL Lab(OpenRL实验室)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.CL
Comments 22 pages, 10 figures, 12 tables
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV
机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队)
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);audio-visual(abstract);分类 cs.CV
Comments Technical Report. Project Page: https://klingavatar.github.io/
机构 * 1 Department of Artificial Intelligence, Sogang University, Seoul 04107, Republic of Korea 2 Department of Electronic Engineering, Sogang University, Seoul 04107, Republic of Korea 3 Language Technologies Institute, Carnegie Mellon University, Pittsburgh, PA 15213, USA 4 Mindslab Inc., Gyeonggi-do 13493, Republic of Korea 5 ICT Convergence Disaster/Safety Research Institute, Sogang University, Seoul 04107, Republic of Korea
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted to ICASSP 2024
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Meta AI Research(Meta AI 研究)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.MM
Comments EMNLP 2025 (Findings)
机构 * Fudan University, China(复旦大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);MLLM(abstract);分类 cs.CV
Comments ICCV 2025, Project Page: https://henghuiding.com/OmniAVS/
机构 * Xi'an Jiaotong University(西安交通大学) ; Zhengzhou University(郑州大学) ; University of Science and Technology of China(中国科学技术大学) ; Dalian University of Technology(大连理工大学) ; Zhejiang Lab(浙江实验室)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV
机构 * Faculty of Engineering Bar-Ilan University Ramat-Gan, Israel(工程学院 巴伊兰大学 拉马特-甘, 以色列)
专题命中 音频语音多模态 :multi-modal(title,abstract);multimodal(abstract);audio-visual(abstract);分类 eess.AS
Comments 5 pages, 4 figures, 2 tables. Accepted to EUSIPCO 2025
机构 * Social Networks and Human-Centered Computing Program, Taiwan International Graduate Program, Academia Sinica(社会网络与以人为本计算计划、台湾国际研究生计划、中国科学院) ; Institute of Information Systems and Applications, National Tsing Hua University(信息系统与应用研究所、国立清华大学) ; Department of Computer Science, National Chengchi University(计算机科学系、国立成功大学) ; Research Center for Information Technology Innovation, Academia Sinica(信息技术创新研究中心、中国科学院) ; Institute of Information Science, Academia Sinica(信息科学研究所、中国科学院)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Project website with demo videos: https://zijuncui02.github.io/SAVVY/
机构 * Tsinghua University(清华大学) ; Tencent Hunyuan Research(腾讯文睿实验室) ; S-Lab, NTU(国立科技大学S实验室)
专题命中 音频语音多模态 :omni-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM
机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机科学学院) ; School of Computing and Information Systems, Singapore Management University(新加坡管理学院计算与信息系统学院) ; School of Artifical Intelligence, Xidian University(西安电子科技大学人工智能学院)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV
Comments 12 pages, 6 figures, 9 tables. This work has been submitted to the IEEE for possible publication
机构 * School of Computer Science, Nanjing University of Information Science and Technology(信息科学与技术南京大学计算机科学学院) ; Jiangsu Collaborative Innovation Center of Atmospheric Environment and Equipment Technology, Nanjing University of Information Science and Technology(大气环境与设备技术江苏省协同创新中心) ; School of Computer Science and Informatics, Cardiff University(计算机科学与信息学院卡斯尔大学) ; Faculty of Information Technology and Communication Sciences, Tampere University(信息科技与通讯科学学院坦佩雷大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV
专题命中 音频语音多模态 :multi-modal(title,abstract);multimodal(abstract);audio-visual(abstract);分类 cs.CV
Comments P. Liu is with the Department of Computer Science and Engineering, University of Nevada, Reno, NV, 89512. Q. Tao and J. Zhou are with Centre for Frontier AI Research (CFAR), and Institute of High Performance Computing (IHPC), A*STAR, Singapore. J. Zhou is also with Centre for Advanced Technologies in Online Safety (CATOS), A*STAR, Singapore. J. Zhou is the corresponding author
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV
专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 eess.AS
Comments accepted to Pattern Recognition
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments 5 pages, 3 figures, 2 tables. Accepted by ICASSP 2025
专题命中 音频语音多模态 :multi-modal(title,abstract);image-text(abstract);audio-visual(abstract);分类 cs.MM
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted by 31st International Conference on MultiMedia Modeling (MMM2025)
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV
Comments Accepted by ACM MM 2024. Code is available at this https://github.com/Brain-Cog-Lab/CACE-Net
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 eess.AS
Comments accepted by icme2024
专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);cross-modal(abstract);audio-visual(abstract)
Comments Accepted at INTERSPEECH 2024
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments CVPR 2024. Code & Demo: https://choijeongsoo.github.io/av2av