arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-30 至 2025-09-30 共收录 142 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 14 篇

2509.23673 2025-09-30 cs.CV cs.AI cs.CL cs.MM 83%

RCI: A Score for Evaluating Global and Local Reasoning in Multimodal Benchmarks

Amit Agarwal, Hitesh Laxmichand Patel, Srikant Panda, Hansa Meghwani, Jyotika Singh, Karan Dua, Paul Li, Tao Sheng, Sujith Ravi, Dan Roth

机构 * Oracle AI

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted in EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23344 2025-09-30 cs.CV cs.AI 81%

DentVLM: A Multimodal Vision-Language Model for Comprehensive Dental Diagnosis and Enhanced Clinical Practice

Zijie Meng, Jin Hao, Xiwei Dai, Yang Feng, Jiaxiang Liu, Bin Feng, Huikai Wu, Xiaotang Gai, Hengchuan Zhu, Tianxiang Hu, Yangyang Wu, Hongxia Xu, Jin Li, Jun Xiao, Xiaoqiang Liu, Joey Tianyi Zhou, Fudong Zhu, Zhihe Zhao, Lunguo Xia, Bing Fang, Jimeng Sun, Jian Wu, Zuozhu Liu

机构 * Stomatology Hospital, School of Stomatology, Zhejiang University School of Medicine, Zhejiang University, Hangzhou(牙科医院,口腔医学院,浙江大学医学院,浙江大学,杭州) College of Computer Science and Technology, Zhejiang University-University of Illinois Urbana-Champaign Institute, Zhejiang University, Hangzhou(计算机科学与技术学院,浙江大学-伊利诺伊大学 Urbana-Champaign 院,浙江大学,杭州) Department of Orthodontics, Shanghai Ninth People’s Hospital, College of Stomatology, Shanghai Jiao Tong University School of Medicine(正畸科,上海第九人民医院,口腔医学院,上海交通大学医学院) Angelalign Technology Inc.(Angelalign 技术公司)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09736 2025-09-30 cs.CV cs.AI 81%

Revisiting Visual Understanding in Multimodal Reasoning through a Lens of Image Perturbation

Yuting Li, Lai Wei, Kaipeng Zheng, Jingyuan Huang, Guilin Li, Bo Wang, Linghe Kong, Lichao Sun, Weiran Huang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Shanghai Innovation Institute(上海创新研究院) Zhongguancun Academy(中关村学院) Tencent(腾讯) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Lehigh University(莱斯大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23281 2025-09-30 cs.RO 78%

Preventing Robotic Jailbreaking via Multimodal Domain Adaptation

Francesco Marchiori, Rohan Sinha, Christopher Agia, Alexander Robey, George J. Pappas, Mauro Conti, Marco Pavone

机构 * University of Padova(帕多瓦大学) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学) Örebro University(奥雷布罗大学) NVIDIA Research(NVIDIA研究)

专题命中 图文多模态 :multimodal(title,abstract)

Comments Project page: https://j-dapt.github.io/. 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23827 2025-09-30 cs.CV cs.LG 74%

Assessing Visual Privacy Risks in Multimodal AI: A Novel Taxonomy-Grounded Evaluation of Vision-Language Models

Efthymios Tsaprazlis, Tiantian Feng, Anil Ramakrishna, Rahul Gupta, Shrikanth Narayanan

机构 * University of Southern California(南加州大学) Amazon AGI(亚马逊人工智能实验室)

专题命中 图文多模态 :multimodal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24491 2025-09-30 cs.CV cs.AI 73%

Mitigating Visual Hallucinations via Semantic Curriculum Preference Optimization in MLLMs

Yuanshuai Li, Yuping Yan, Junfeng Tang, Yunxuan Li, Zeqi Zheng, Yaochu Jin

机构 * School of Engineering, Westlake University, Hangzhou, China(西湖大学工程学院) School of Cyberspace Security, Nanjing University of Science and Technology, Nanjing, China(南京理工大学网络安全学院)

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24258 2025-09-30 cs.CV 70%

When MLLMs Meet Compression Distortion: A Coding Paradigm Tailored to MLLMs

Jinming Liu, Zhaoyang Jia, Jiahao Li, Bin Li, Xin Jin, Wenjun Zeng, Yan Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东部技术研究所) Microsoft Research Asia(微软亚洲研究院)

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24192 2025-09-30 cs.CV cs.AI 62%

Talk in Pieces, See in Whole: Disentangling and Hierarchical Aggregating Representations for Language-based Object Detection

Sojung An, Kwanyong Park, Yong Jae Lee, Donghyun Kim

机构 * Korea University(韩国大学) University of Seoul(首尔大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 23 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15963 2025-09-30 cs.CV cs.CL 62%

OViP: Online Vision-Language Preference Learning for VLM Hallucination

Shujun Liu, Siyuan Wang, Zejun Li, Jianxiang Wang, Cheng Zeng, Zhongyu Wei

机构 * Fudan University(复旦大学) University of Southern California(南加州大学) ByteDance(字节跳动)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25151 2025-09-30 cs.CV 57%

VideoAnchor: Reinforcing Subspace-Structured Visual Cues for Coherent Visual-Spatial Reasoning

Zhaozhi Wang, Tong Zhang, Mingyue Guo, Yaowei Wang, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) Peng Cheng Lab(鹏城实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24231 2025-09-30 cs.CV 57%

EVLF-FM: Explainable Vision Language Foundation Model for Medicine

Yang Bai, Haoran Cheng, Yang Zhou, Jun Zhou, Arun Thirunavukarasu, Yuhe Ke, Jie Yao, Kanae Fukutsu, Chrystie Wan Ning Quek, Ashley Hong, Laura Gutierrez, Zhen Ling Teo, Darren Shu Jeng Ting, Brian T. Soetikno, Christopher S. Nielsen, Tobias Elze, Zengxiang Li, Linh Le Dinh, Hiok Hong Chan, Victor Koh, Marcus Tan, Kelvin Z. Li, Leonard Yip, Ching Yu Cheng, Yih Chung Tham, Gavin Siew Wei Tan, Leopold Schmetterer, Marcus Ang, Rahat Hussain, Jod Mehta, Tin Aung, Lionel Tim-Ee Cheng, Tran Nguyen Tuan Anh, Chee Leong Cheng, Tien Yin Wong, Nan Liu, Iain Beehuat Tan, Soon Thye Lim, Eyal Klang, Tony Kiat Hon Lim, Rick Siow Mong Goh, Yong Liu, Daniel Shu Wei Ting

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17127 2025-09-30 cs.CV cs.LG 57%

Pixels Versus Priors: Controlling Knowledge Priors in Vision-Language Models through Visual Counterfacts

Michal Golovanevsky, William Rudman, Michael Lepori, Amir Bar, Ritambhara Singh, Carsten Eickhoff

机构 * Brown University(布朗大学) Tel Aviv University(特拉维夫大学) University of Tübingen(图宾根大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23917 2025-09-30 cs.CV 57%

Bridging the Task Gap: Multi-Task Adversarial Transferability in CLIP and Its Derivatives

Kuanrong Liu, Siyuan Liang, Cheng Qian, Ming Zhang, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University, China(中山大学深圳校区) The National University of Singapore, Singapore(新加坡国立大学) National Key Laboratory of Science and Technology on Information System Security, China(信息系统安全科学技术国家重点实验室)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22674 2025-09-30 cs.CV 57%

Pathological Truth Bias in Vision-Language Models

Yash Thube

机构 * Savitribai Phule Pune University (SPPU)(萨维特里·布尔大学(SPPU))

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 10 pages, 12 figures. Code for MATS released at https://github.com/thubZ09/mats-spatial-reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 14 篇

2508.12334 2025-09-30 cs.SD cs.MM 88%

HDA-SELD: Hierarchical Cross-Modal Distillation with Multi-Level Data Augmentation for Low-Resource Audio-Visual Sound Event Localization and Detection

Qing Wang, Ya Jiang, Hang Chen, Sabato Marco Siniscalchi, Jun Du, Jianqing Gao

机构 * University of Science and Technology of China(中国科学技术大学) University of Palermo(巴勒莫大学) iFLYTEK Research(iFLYTEK研究院)

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.MM

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24214 2025-09-30 cs.CV 85%

Scalable Audio-Visual Masked Autoencoders for Efficient Affective Video Facial Analysis

Xuecheng Wu, Junxiao Xue, Xinyi Yin, Yunyun Shi, Liangyu Fu, Danlei Huang, Yifan Wang, Jia Zhang, Jiayu Nie, Jun Wang

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Cyber Science and Engineering, Zhengzhou University(郑州大学网络科学与工程学院) School of Software, Northwestern Polytechnical University(西北工业大学软件学院) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) Inspur Group(Inspur集团) Research Center for Space Computing System, Zhejiang Lab(浙江实验室空间计算系统研究中心)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22744 2025-09-30 eess.AS cs.AI cs.MM cs.SD 85%

Index-MSR: A high-efficiency multimodal fusion framework for speech recognition

Jinming Chen, Lu Wang, Zheshu Song, Wei Deng

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM、eess.AS

Comments Submit to icassp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24322 2025-09-30 cs.CL 83%

Multimodal Large Language Models Meet Multimodal Emotion Recognition and Reasoning: A Survey

Yuntao Shou, Tao Meng, Wei Ai, Keqin Li

机构 * Central South University of Forestry and Technology(林业科技大学) State University of New York(纽约州立大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

Comments 35 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23251 2025-09-30 cs.MM cs.SD 83%

XGC-AVis: Towards Audio-Visual Content Understanding with a Multi-Agent Collaborative System

Yuqin Cao, Xiongkuo Min, Yixuan Gao, Wei Sun, Zicheng Zhang, Jinliang Han, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02247 2025-09-30 cs.CV 83%

EgoVIS@CVPR: PAIR-Net: Enhancing Egocentric Speaker Detection via Pretrained Audio-Visual Fusion and Alignment Loss

Yu Wang, Juhyung Ha, David J. Crandall

机构 * Indiana University(印第安纳大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

Comments 4 pages, 1 figure, and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15017 2025-09-30 cs.CL cs.AI cs.SD eess.AS 82%

DM-Codec: Distilling Multimodal Representations for Speech Tokenization

Md Mubtasim Ahasan, Md Fahim, Tasnim Mohiuddin, A K M Mahbubur Rahman, Aman Chadha, Tariq Iqbal, M Ashraful Amin, Md Mofijul Islam, Amin Ahsan Ali

机构 * Center for Computational & Data Sciences, Independent University, Bangladesh(计算与数据科学中心,独立大学,孟加拉国) Amazon GenAI(亚马逊生成人工智能) Qatar Computing Research Institute(卡塔尔计算研究所) University of Virginia(弗吉尼亚大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23833 2025-09-30 eess.AS cs.CV cs.MM cs.SD 82%

AISHELL6-whisper: A Chinese Mandarin Audio-visual Whisper Speech Dataset with Speech Recognition Baselines

Cancan Li, Fei Su, Juan Liu, Hui Bu, Yulong Wan, Hongbin Suo, Ming Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Beijing AISHELL Technology Co., Ltd.(北京AISHELL科技有限公司) AI Center, OPPO(OPPO人工智能中心)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25131 2025-09-30 cs.SD cs.AI cs.CL cs.CV cs.MM 81%

MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech

Chengyao Wang, Zhisheng Zhong, Bohao Peng, Senqiao Yang, Yuqi Liu, Haokun Gui, Bin Xia, Jingyao Li, Bei Yu, Jiaya Jia

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Code is available at https://github.com/dvlab-research/MGM-Omni

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22718 2025-09-30 eess.AS cs.MM cs.SD 81%

PerformSinger: Multimodal Singing Voice Synthesis Leveraging Synchronized Lip Cues from Singing Performance Videos

Ke Gu, Zhicong Wu, Peng Bai, Sitong Qiao, Zhiqi Jiang, Junchen Lu, Xiaodong Shi, Xinyuan Qian

机构 * Xiamen University(厦门大学) University of Science and Technology Beijing(北京科技大学) National University of Singapore(新加坡国立大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22698 2025-09-30 cs.RO cs.AI 79%

Advancing Audio-Visual Navigation Through Multi-Agent Collaboration in 3D Environments

Hailong Zhang, Yinfeng Yu, Liejun Wang, Fuchun Sun, Wendong Zheng

机构 * Xinjiang Multimodal Intelligent Processing and Information Security Engineering Technology Research Center(新疆多模态智能处理与信息安全工程技术研究中心) School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Electrical Engineering and Automation, Tianjin University of Technology(天津理工大学电气工程与自动化学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI

Comments Main paper (15 pages). Accepted for publication by ICONIP( International Conference on Neural Information Processing) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19951 2025-09-30 cs.CV cs.AI 73%

Audio-centric Video Understanding Benchmark without Text Shortcut

Yudong Yang, Jimin Zhuang, Guangzhi Sun, Changli Tang, Yixuan Li, Peihan Li, Yifan Jiang, Wei Li, Zejun Ma, Chao Zhang

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学) ByteDance(字节跳动)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

Comments Accepted for publication in the Proceedings of EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04592 2025-09-30 cs.CV 70%

Face-voice Association in Multilingual Environments (FAME) 2026 Challenge Evaluation Plan

Marta Moscati, Ahmed Abdullah, Muhammad Saad Saeed, Shah Nawaz, Rohan Kumar Das, Muhammad Zaigham Zaheer, Junaid Mir, Muhammad Haroon Yousaf, Khalid Malik, Markus Schedl

机构 * Johannes Kepler University Linz(约翰·凯撒大学林茨分校) National University of Computer and Emerging Sciences(国家计算机与新兴科学大学) University of Michigan(密歇根大学) Fortemedia Singapore(Fortemedia新加坡分公司) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Engineering and Technology Taxila(塔希尔工程与技术大学) Human-centered AI Group(以人为本的人工智能小组)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

Comments 4 pages, ICASSP'26, SP Grand Challenge'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08753 2025-09-30 cs.CL 57%

Streaming Sequence-to-Sequence Learning with Delayed Streams Modeling

Neil Zeghidour, Eugene Kharitonov, Manu Orsini, Václav Volhejn, Gabriel de Marmiesse, Edouard Grave, Patrick Pérez, Laurent Mazaré, Alexandre Défossez

机构 * Kyutai

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 14 篇

2412.19178 2025-09-30 cs.CV cs.AI cs.CL cs.IR cs.LG 87%

Reversed in Time: A Novel Temporal-Emphasized Benchmark for Cross-Modal Video-Text Retrieval

Yang Du, Yuqi Liu, Qin Jin

机构 * Renmin University of China(中国人民大学)

专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments ACMMM 2024 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23284 2025-09-30 cs.CV 83%

Bidirectional Likelihood Estimation with Multi-Modal Large Language Models for Text-Video Retrieval

Dohwan Ko, Ji Soo Lee, Minhyuk Choi, Zihang Meng, Hyunwoo J. Kim

机构 * Korea University(韩国大学) Meta GenAI(Meta 生成人工智能) KAIST(韩国科学技术院)

专题命中 视频多模态 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV

Comments ICCV 2025 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏