arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-10-17 至 2025-10-17 共收录 54 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 6 篇

2509.25373 2025-10-17 cs.AI 79%

From Perception to Cognition: A Survey of Vision-Language Interactive Reasoning in Multimodal Large Language Models

Chenyue Zhou, Mingxuan Wang, Yanbiao Ma, Chenxu Wu, Wanyi Chen, Zhe Qian, Xinyu Liu, Yiwei Zhang, Junhao Wang, Hengbo Xu, Fei Luo, Xiaohua Chen, Xiaoshuai Hao, Hehan Li, Andi Zhang, Wenxuan Wang, Kaiyan Zhang, Guoli Jia, Lingling Li, Zhiwu Lu, Yang Lu, Yike Guo

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Xiamen University(厦门大学) The Hong Kong University of Science and Technology(香港理工大学) Nanyang Technological University(南洋理工大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14583 2025-10-17 cs.CV cs.CL 62%

Talking Points: Describing and Localizing Pixels

Matan Rusanovsky, Shimon Malnick, Shai Avidan

机构 * Tel Aviv University(特拉维夫大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14304 2025-10-17 cs.CV cs.AI 62%

Watermarking for Factuality: Guiding Vision-Language Models Toward Truth via Tri-layer Contrastive Decoding

Kyungryul Back, Seongbeom Park, Milim Kim, Mincheol Kwon, SangHyeok Lee, Hyunyoung Lee, Junhee Cho, Seunghyun Park, Jinkyu Kim

机构 * CSE, Korea University(韩国大学计算机科学与工程系) KT Corporation(KT公司) Soongsil University(顺成大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments EMNLP 2025 Findings; Project: https://github.com/KR-0822/TCD

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12126 2025-10-17 cs.CV 57%

MetaCaptioner: Towards Generalist Visual Captioning with Open-source Suites

Zhenxin Lei, Zhangwei Gao, Changyao Tian, Erfei Cui, Guanzhou Chen, Danni Yang, Yuchen Duan, Zhaokai Wang, Wenhao Li, Weiyun Wang, Xiangyu Zhao, Jiayi Ji, Yu Qiao, Wenhai Wang, Gen Luo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) University of Chinese Academy of Science(中国科学院大学) Xiamen University(厦门大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16411 2025-10-17 cs.CV cs.LG 57%

Mitigating Hallucinations in Vision-Language Models through Image-Guided Head Suppression

Sreetama Sarkar, Yue Che, Alex Gavin, Peter A. Beerel, Souvik Kundu

机构 * University of Southern California(美国南加州大学) Intel Labs(英特尔实验室) Harvard-Westlake School(哈佛-韦斯利学校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14254 2025-10-17 cs.LG 50%

Generalist vs Specialist Time Series Foundation Models: Investigating Potential Emergent Behaviors in Assessing Human Health Using PPG Signals

Saurabh Kataria, Yi Wu, Zhaoliang Chen, Hyunjung Gloria Kwak, Yuhao Xu, Lovely Yeswanth Panchumarthi, Ran Xiao, Jiaying Lu, Ayca Ermis, Anni Zhao, Runze Yan, Alex Federov, Zewen Liu, Xu Wu, Wei Jin, Carl Yang, Jocelyn Grunwell, Stephanie R. Brown, Amit Shah, Craig Jabaley, Tim Buchman, Sivasubramanium V Bhavani, Randall J. Lee, Xiao Hu

机构 * Nell Hodgson Woodruff School of Nursing(Nell Hodgson Woodruff护理学院) School of Computer Science(计算机科学学院) Department of Pediatrics(儿科系) Department of Computer Science(计算机科学系) Department of Epidemiology(流行病学系) Department of Anesthesiology(麻醉学系) Department of Surgery(外科系) Department of Medicine(医学系) School of Medicine(医学院)

专题命中 图文多模态 :cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 2 篇

2510.13979 2025-10-17 cs.AI cs.CL 81%

Do Slides Help? Multi-modal Context for Automatic Transcription of Conference Talks

Supriti Sinhamahapatra, Jan Niehues

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12171 2025-10-17 cs.CL cs.AI 62%

Preservation of Language Understanding Capabilities in Speech-aware Large Language Models

Marek Kubis, Paweł Skórzewski, Iwona Christop, Mateusz Czyżnikiewicz, Jakub Kubiak, Łukasz Bondaruk, Marcin Lewandowski

机构 * Adam Mickiewicz University(亚当·密茨凯维奇大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI

Comments 5 pages, 1 figure; benchmark code available at https://github.com/SamsungLabs/C3T

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 5 篇

2510.14203 2025-10-17 cs.CV cs.CL cs.MM 82%

Joint Modeling of Big Five and HEXACO for Multimodal Apparent Personality-trait Recognition

Ryo Masumura, Shota Orihashi, Mana Ihori, Tomohiro Tanaka, Naoki Makishima, Taiga Yamane, Naotaka Kawata, Satoshi Suzuki, Taichi Katayama

机构 * NTT, Inc.(日本NTT公司)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.MM

Comments Accepted at APSIPA ASC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14672 2025-10-17 cs.CV 70%

VTimeCoT: Thinking by Drawing for Video Temporal Grounding and Reasoning

Jinglei Zhang, Yuanfan Guo, Rolandos Alexandros Potamias, Jiankang Deng, Hang Xu, Chao Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Noah’s Ark Lab(诺亚实验室) Imperial College London(伦敦帝国理工学院)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14241 2025-10-17 cs.CV 70%

PIA: Deepfake Detection Using Phoneme-Temporal and Identity-Dynamic Analysis

Soumyya Kanti Datta, Tanvi Ranga, Chengzhe Sun, Siwei Lyu

机构 * University at Buffalo, SUNY Buffalo, NY, USA(布法罗大学)

专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13891 2025-10-17 cs.LG cs.AI 57%

K-frames: Scene-Driven Any-k Keyframe Selection for long video understanding

Yifeng Yao, Yike Yun, Jing Wang, Huishuai Zhang, Dongyan Zhao, Ke Tian, Zhihao Wang, Minghui Qiu, Tao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) Bytedance(字节跳动)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14286 2025-10-17 cs.LG 50%

Stable Prediction of Adverse Events in Medical Time-Series Data

Mayank Keoliya, Seewon Choi, Rajeev Alur, Mayur Naik, Eric Wong

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 视频多模态 :multi-modal(abstract)

Comments 18 pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 7 篇

2510.14592 2025-10-17 cs.LG cs.IR 82%

Multimodal RAG for Unstructured Data:Leveraging Modality-Aware Knowledge Graphs with Hybrid Retrieval

Rashmi R, Vidyadhar Upadhya

机构 * National Institute of Technology Karnataka, Surathkal, India(印度卡纳塔克国家理工学院)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

Comments 12 pages, 6 figures, submitted for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13856 2025-10-17 cs.CL cs.AI cs.CV 82%

Multimodal Retrieval-Augmented Generation with Large Language Models for Medical VQA

A H M Rezaul Karim, Ozlem Uzuner

机构 * George Mason University(乔治·马歇尔大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14824 2025-10-17 cs.CL cs.CV cs.IR 81%

Supervised Fine-Tuning or Contrastive Learning? Towards Better Multimodal LLM Reranking

Ziqi Dai, Xin Zhang, Mingxin Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie, Meishan Zhang, Wenjie Li, Min Zhang

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14136 2025-10-17 cs.AI 79%

A Multimodal Approach to Heritage Preservation in the Context of Climate Change

David Roqui, Adèle Cormier, nistor Grozavu, Ann Bourges

机构 * ETIS laboratory, Cergy university(Cergy大学ETIS实验室) Research and Restoration Center for the Museums of France (C2RMF)(法国博物馆研究与修复中心(C2RMF))

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22369 2025-10-17 cs.LG cs.DC 78%

Role-Aware Multi-modal federated learning system for detecting phishing webpages

Bo Wang, Imran Khan, Martin White, Natalia Beloff

专题命中 跨模态检索 :multi-modal(title,abstract)

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18623 2025-10-17 cs.CV 70%

Training-Free Personalization via Retrieval and Reasoning on Fingerprints

Deepayan Das, Davide Talon, Yiming Wang, Massimiliano Mancini, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯瑟实验室)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14965 2025-10-17 cs.CV 57%

ChangingGrounding: 3D Visual Grounding in Changing Scenes

Miao Hu, Zhiwei Huang, Tai Wang, Jiangmiao Pang, Dahua Lin, Nanning Zheng, Runsen Xu

机构 * Xi’an Jiaotong University(西安交通大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 8 篇

2510.13721 2025-10-17 cs.CL cs.AI cs.CV cs.MM 89%

NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching

Run Luo, Xiaobo Xia, Lu Wang, Longze Chen, Renke Shan, Jing Luo, Min Yang, Tat-Seng Chua

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) NExT++ Research Center(NExT++研究中心) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :any-to-any(title,abstract);multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14866 2025-10-17 cs.CV cs.AI cs.CL 85%

Benchmarking Multimodal Large Language Models for Face Recognition

Hatef Otroshi Shahreza, Sébastien Marcel

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17692 2025-10-17 cs.CL cs.AI cs.LG 84%

MIO: A Foundation Model on Multimodal Tokens

Zekun Wang, King Zhu, Chunpu Xu, Wangchunshu Zhou, Jiaheng Liu, Yibo Zhang, Jiashuo Wang, Ning Shi, Siyu Li, Yizhi Li, Haoran Que, Zhaoxiang Zhang, Yuanxing Zhang, Ge Zhang, Ke Xu, Jie Fu, Wenhao Huang

机构 * Beihang University(北航) M-A-P The Hong Kong Polytechnic University(香港理工大学) AIWaves University of Alberta(阿尔伯塔大学) University of Waterloo(滑铁卢大学) University of Manchester(曼彻斯特大学) Chinese Academy of Sciences(中国科学院) Peking University(北京大学) Shanghai AI Lab(上海AI实验室) Nanjing University(南京大学) Kuaishou Technology(快手科技)

专题命中 多模态生成 :multimodal(title,abstract);any-to-any(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 (Oral). Codes and models are available in https://github.com/MIO-Team/MIO

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14954 2025-10-17 cs.CV 83%

OmniMotion: Multimodal Motion Generation with Continuous Masked Autoregression

Zhe Li, Weihao Yuan, Weichao Shen, Siyu Zhu, Zilong Dong, Chang Xu

机构 * University of Sydney(悉尼大学) Alibaba Group(阿里集团) Fudan University(复旦大学)

专题命中 多模态生成 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08209 2025-10-17 cs.CV cs.AI cs.LG 81%

Emergent Visual Grounding in Large Multimodal Models Without Grounding Supervision

Shengcao Cao, Liang-Yan Gui, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments ICCV 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13883 2025-10-17 q-bio.NC cs.MA 67%

Large Language Model Agents Enable Autonomous Design and Image Analysis of Microwell Microfluidics

Dinh-Nguyen Nguyen, Sadia Shakil, Raymond Kai-Yu Tong, Ngoc-Duy Dinh

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18668 2025-10-17 cs.CV cs.CL 62%

ChartGalaxy: A Dataset for Infographic Chart Understanding and Generation

Zhen Li, Duan Li, Yukai Guo, Xinyuan Guo, Bowen Li, Lanxi Xiao, Shenyu Qiao, Jiashu Chen, Zijian Wu, Hui Zhang, Xinhuan Shu, Shixia Liu

机构 * Tsinghua University(清华大学) Newcastle University(新castle大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

Comments 58 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23402 2025-10-17 cs.CV 57%

WorldSplat: Gaussian-Centric Feed-Forward 4D Scene Generation for Autonomous Driving

Ziyue Zhu, Zhanqian Wu, Zhenxin Zhu, Lijun Zhou, Haiyang Sun, Bing Wan, Kun Ma, Guang Chen, Hangjun Ye, Jin Xie, jian Yang

机构 * Nankai University(南开大学) Nanjing University, Suzhou(南京大学苏州校区)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 11 篇

2405.13571 2025-10-17 cs.CV 90%

Incomplete Multimodal Industrial Anomaly Detection via Cross-Modal Distillation

Wenbo Sui, Daniel Lichau, Josselin Lefèvre, Harold Phelippeau

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

Comments For a published version refer to the Information Fusion, DOI. 10.1016/j.inffus.2025.103572

Journal ref Sui, W., Lichau, D., Lefèvre, J., & Phelippeau, H. (2026). Incomplete multimodal industrial anomaly detection via cross-modal distillation. Information Fusion, 126, Article 103572

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14958 2025-10-17 cs.CV cs.CL 81%

MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning

Weikang Shi, Aldrich Yu, Rongyao Fang, Houxing Ren, Ke Wang, Aojun Zhou, Changyao Tian, Xinyu Fu, Yuxuan Hu, Zimu Lu, Linjiang Huang, Si Liu, Rui Liu, Hongsheng Li

机构 * Multimedia Laboratory (MMLab), The Chinese University of Hong Kong(中文大学多媒体实验室) Huawei Research(华为研究) BUAA(北京航空学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Project Page: https://mathcanvas.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏