A Survey of Generative Categories and Techniques in Multimodal Generative Models
多模态生成模型中生成类别的综述
Longzhen Han, Awes Mubarak, Almas Baimagambetov, Nikolaos Polatidis, Thar Baker
机构
*
School of Architecture, Technology and Engineering, University of Brighton, Lewes Road, BN2 4GJ(建筑、科技与工程学院,布里顿大学,勒斯路,BN2 4GJ)
;
University of Khorfakkan, Sharjah(柯法克坎大学,沙迦)
Audio-Visual Speech Enhancement In Complex Scenarios With Separation And Dereverberation Joint Modeling
Jiarong Du, Zhan Jin, Peijun Yang, Juan Liu, Zhuo Li, Xin Liu, Ming Li
机构
*
School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院)
;
School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)
;
School of Computer Science, Wuhan University(武汉大学计算机学院)
;
Suzhou Municipal Key Laboratory of Multimodal Intelligent Systems, Digital Innovation Research Center, Duke Kunshan University(多模态智能系统苏州市级重点实验室、杜克昆山大学数字创新研究中心)
;
Hardware Engineering System, OPPO(OPPO硬件工程系统)
Audio-Guided Visual Perception for Audio-Visual Navigation
Yi Wang, Yinfeng Yu, Fuchun Sun, Liejun Wang, Wendong Zheng
机构
*
School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)
;
Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing(丝绸之路多语种认知计算国际联合实验室)
;
Tsinghua University(清华大学)
;
Tianjin University of Technology(天津工业大学)
Automating Steering for Safe Multimodal Large Language Models
Lyucheng Wu, Mengru Wang, Ziwen Xu, Tri Cao, Nay Oo, Bryan Hooi, Shumin Deng
机构
*
Zhejiang University(浙江大学)
;
Zhejiang University - Ant Group Joint Lab of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)
;
National University of Singapore, NUS-NCS Joint Lab(新加坡国立大学NUS-NCS联合实验室)
机构
*
School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学)
;
Kuaishou Technology(快手科技)
;
Tianjin Key Laboratory of Cognitive Computing and Application, College of Intelligence and Computing, Tianjin University(认知计算与应用重点实验室,智能计算学院,天津大学)
;
Department of Automation, BNRist, Tsinghua University(自动化系,北研所,清华大学)
;
Shenzhen Institute of Advanced Technology, Chinese Academy of Science(深圳先进技术研究院,中国科学院)
机构
*
School of Electronics and Information, Northwestern Polytechnical University(电子与信息学院,西北工业大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Shaanxi Key Laboratory of Information Acquisition and Processing(信息获取与处理陕西省重点实验室)
Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge
Zhaoyang Li, Haodong Zhou, Longjie Luo, Xiaoxiao Li, Yongxin Chen, Lin Li, Qingyang Hong
机构
*
Xiamen University(厦门大学)
;
Beijing Jiaotong University(北京交通大学)
;
School of Electronic Science and Engineering(电子科学与技术学院)
;
School of Electronic Information(电子信息学院)
;
School of Informatics(信息学院)
VQ-CTAP: Cross-Modal Fine-Grained Sequence Representation Learning for Speech Processing
Chunyu Qiang, Wang Geng, Yi Zhao, Ruibo Fu, Tao Wang, Cheng Gong, Tianrui Wang, Qiuyu Liu, Jiangyan Yi, Zhengqi Wen, Chen Zhang, Hao Che, Longbiao Wang, Jianwu Dang, Jianhua Tao
机构
*
School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学)
;
Kuaishou Technology Co., Ltd.(快手科技有限公司)
;
Tianjin Key Laboratory of Cognitive Computing and Application, College of Intelligence and Computing, Tianjin University(认知计算与应用重点实验室,智能计算学院,天津大学)
;
Department of Automation, Tsinghua University(自动化系,清华大学)
;
Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学与技术国家研究中心,清华大学)
;
Migu Culture Technology Co., Ltd.(咪咕文化科技有限公司)
;
Shenzhen Institute of Advanced Technology, Chinese Academy of Science(深圳先进技术研究院,中国科学院)
Comments26 pages, 15 figures, The Thirteenth International Conference on Learning Representations, ICLR-2025, Singapore. https://openreview.net/pdf?id=0dELcFHig2
CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment
Edson Araujo, Andrew Rouditchenko, Yuan Gong, Saurabhchand Bhati, Samuel Thomas, Brian Kingsbury, Leonid Karlinsky, Rogerio Feris, James R. Glass, Hilde Kuehne
机构
*
Goethe University of Frankfurt(法兰克福歌德大学)
;
MIT(麻省理工学院)
;
IBM Research(IBM研究院)
;
MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)
;
Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)
Multifaceted Evaluation of Audio-Visual Capability for MLLMs: Effectiveness, Efficiency, Generalizability and Robustness
Yusheng Zhao, Junyu Luo, Xiao Luo, Weizhi Zhang, Zhiping Xiao, Wei Ju, Philip S. Yu, Ming Zhang
机构
*
Peking University(北京大学)
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
University of Illinois Chicago(伊利诺伊大学香槟分校)
;
University of Washington(华盛顿大学)