arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-10-31 至 2025-10-31 共收录 39 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 3 篇

2509.04448 2025-10-31 cs.CV cs.MM 84%

TRUST-VL: An Explainable News Assistant for General Multimodal Misinformation Detection

Zehong Yan, Peng Qi, Wynne Hsu, Mong Li Lee

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

Comments EMNLP 2025 Oral; Project Homepage: https://yanzehong.github.io/trust-vl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20392 2025-10-31 cs.CV 83%

Defending Multimodal Backdoored Models by Repulsive Visual Prompt Tuning

Zhifang Zhang, Shuo He, Haobo Wang, Bingquan Shen, Lei Feng

机构 * Southeast University(东南大学) University of Queensland(昆士兰大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26151 2025-10-31 cs.CV cs.AI 73%

MV-MLM: Bridging Multi-View Mammography and Language for Breast Cancer Diagnosis and Risk Prediction

Shunjie-Fabian Zheng, Hyeonjun Lee, Thijs Kooi, Ali Diba

机构 * Department of Medicine I, LMU University Hospital, LMU Munich, Germany(慕尼黑大学医学部第一部门,LMU大学医院,慕尼黑,德国) Lunit Inc.(Lunit公司)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

Comments Accepted to Computer Vision for Automated Medical Diagnosis (CVAMD) Workshop at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 1 篇

2510.26096 2025-10-31 cs.SD cs.CR cs.LG 50%

ALMGuard: Safety Shortcuts and Where to Find Them as Guardrails for Audio-Language Models

Weifei Jin, Yuxin Cao, Junjie Su, Minhui Xue, Jie Hao, Ke Xu, Jin Song Dong, Derui Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) National University of Singapore(新加坡国立大学) CSIRO’s Data61(CSIRO数据61) Responsible AI Research (RAIR) Centre, The University of Adelaide(负责任人工智能研究(RAIR)中心,阿德莱德大学) Tsinghua University(清华大学)

专题命中 音频语音多模态 :multimodal(abstract)

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 3 篇

2510.26027 2025-10-31 cs.CV 57%

Enhancing Temporal Understanding in Video-LLMs through Stacked Temporal Attention in Vision Encoders

Ali Rasekh, Erfan Bagheri Soula, Omid Daliran, Simon Gottschalk, Mohsen Fayyaz

机构 * Leibniz University Hannover(莱比锡大学汉诺威分校) L3S Research Center(L3S研究中心) Microsoft(微软公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01701 2025-10-31 cs.CV 57%

Signal-SGN: A Spiking Graph Convolutional Network for Skeletal Action Recognition via Learning Temporal-Frequency Dynamics

Naichuan Zheng, Yuchen Du, Hailun Xia, Zeyu Liang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26628 2025-10-31 cs.NI eess.SP 50%

Low-Altitude UAV-Carried Movable Antenna for Joint Wireless Power Transfer and Covert Communications

Chuang Zhang, Geng Sun, Jiahui Li, Jiacheng Wang, Qingqing Wu, Dusit Niyato, Shiwen Mao, Tony Q. S. Quek

专题命中 视频多模态 :multimodal(abstract)

Comments This paper has been submitted to IEEE Journal on Selected Areas in Communications

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 1 篇

2509.17784 2025-10-31 cs.LG cs.AI 83%

Revealing Multimodal Causality with Large Language Models

Jin Li, Shoujin Wang, Qi Zhang, Feng Liu, Tongliang Liu, Longbing Cao, Shui Yu, Fang Chen

机构 * University of Technology Sydney(技术大学悉尼大学) Tongji University(同济大学) University of Melbourne(墨尔本大学) University of Sydney(悉尼大学) Macquarie University(麦考瑞大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 7 篇

2510.26105 2025-10-31 cs.CV cs.AI cs.CR 81%

Security Risk of Misalignment between Text and Image in Multi-modal Model

Xiaosen Wang, Zhijin Ge, Shaokang Wang

机构 * Xidian University(西安电子科技大学) Shanghai Jiaotong University(上海交通大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26583 2025-10-31 cs.CV 79%

Emu3.5: Native Multimodal Models are World Learners

Yufeng Cui, Honghao Chen, Haoge Deng, Xu Huang, Xinghang Li, Jirong Liu, Yang Liu, Zhuoyan Luo, Jinsheng Wang, Wenxuan Wang, Yueze Wang, Chengyuan Wang, Fan Zhang, Yingli Zhao, Ting Pan, Xianduo Li, Zecheng Hao, Wenxuan Ma, Zhuo Chen, Yulong Ao, Tiejun Huang, Zhongyuan Wang, Xinlong Wang

机构 * BAAI(百度人工智能研究院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments project page: https://emu.world

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01074 2025-10-31 cs.LG 78%

Omni-Mol: Multitask Molecular Model for Any-to-any Modalities

Chengxin Hu, Hao Li, Yihe Yuan, Zezheng Song, Chenyang Zhao, Haixin Wang

机构 * National University of Singapore(新加坡国立大学) University of Maryland, College Park(马里兰大学 College Park 分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 多模态生成 :any-to-any(title);multimodal(abstract)

Comments 44 pages, 9 figures, 13 tables, paper accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25798 2025-10-31 cs.LG cs.AI cs.CL 73%

MemEIC: A Step Toward Continual and Compositional Knowledge Editing

Jin Seong, Jiyun Park, Wencke Liermann, Hongseok Choi, Yoonji Nam, Hyun Kim, Soojong Lim, Namhoon Lee

机构 * Electronics and Telecommunications Research Institute, Republic of Korea(韩国电子电信研究院) POSTECH Sungkyunkwan University(全南大学)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2025, 38 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26670 2025-10-31 cs.RO 71%

Hybrid Consistency Policy: Decoupling Multi-Modal Diversity and Real-Time Efficiency in Robotic Manipulation

Qianyou Zhao, Yuliang Shen, Xuanran Zhai, Ce Hao, Duidi Wu, Jin Qi, Jie Hu, Qiaojun Yu

机构 * Shanghai Jiao Tong University(上海交通大学) National University of Singapore(国立新加坡大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 多模态生成 :multi-modal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13267 2025-10-31 cs.CV 70%

Dynamic Traceback Learning for Medical Report Generation

Shuchang Ye, Mingyuan Meng, Mingjian Li, Dagan Feng, Usman Naseem, Jinman Kim

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

Comments Accepted to IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21451 2025-10-31 cs.SE 50%

Scalpel: Automotive Deep Learning Framework Testing via Assembling Model Components

Yinglong Zou, Juan Zhai, Chunrong Fang, An Guo, Jiawei Liu, Zhenyu Chen

专题命中 多模态生成 :multi-modal(abstract)

Comments Accepted by the 48th IEEE/ACM International Conference on Software Engineering (ICSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 10 篇

2510.18915 2025-10-31 cs.CL cs.AI 84%

UNO-Bench: A Unified Benchmark for Exploring the Compositional Law Between Uni-modal and Omni-modal in Omni Models

Chen Chen, ZeYang Hu, Fengjiao Chen, Liya Ma, Jiaxing Liu, Xiaoyu Li, Ziwen Wang, Xuezhi Cao, Xunliang Cai

机构 * Meituan(美团)

专题命中 多模态评测 :omni-modal(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI

Comments v3: Switch the paper template. Work in progress. Github: https://github.com/meituan-longcat/UNO-Bench Hugging Face: https://huggingface.co/datasets/meituan-longcat/UNO-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06771 2025-10-31 cs.CV 79%

D-HUMOR: Dark Humor Understanding via Multimodal Open-ended Reasoning -- A Benchmark Dataset and Method

Sai Kartheek Reddy Kasu, Mohammad Zia Ur Rehman, Shahid Shafi Dar, Rishi Bharat Junghare, Dhanvin Sanjay Namboodiri, Nagendra Kumar

机构 * Indian Institute of Information Technology Dharwad, India(印度达拉瓦德信息科技学院) Indian Institute of Technology Indore, India(印度印度理工学院) Malaviya National Institute of Technology Jaipur, India(马拉维亚国家理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments Accepted at IEEE International Conference on Data Mining (ICDM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26160 2025-10-31 cs.CV 79%

CRAG-MM: Multi-modal Multi-turn Comprehensive RAG Benchmark

Jiaqi Wang, Xiao Yang, Kai Sun, Parth Suresh, Sanat Sharma, Adam Czyzewski, Derek Andersen, Surya Appini, Arkav Banerjee, Sajal Choudhary, Shervin Ghasemlou, Ziqiang Guan, Akil Iyer, Haidar Khan, Lingkun Kong, Roy Luo, Tiffany Ma, Zhen Qiao, David Tran, Wenfang Xu, Skyler Yeatman, Chen Zhou, Gunveer Gujral, Yinglong Xia, Shane Moon, Nicolas Scheffer, Nirav Shah, Eun Chang, Yue Liu, Florian Metze, Tammy Stark, Zhaleh Feizollahi, Andrea Jessee, Mangesh Pujari, Ahmed Aly, Babak Damavandi, Rakesh Wanga, Anuj Kumar, Rohit Patel, Wen-tau Yih, Xin Luna Dong

机构 * Meta Reality Labs(Meta现实实验室) Meta Superintelligence Labs(Meta超智能实验室) FAIR, Meta(FAIR,Meta) Meta

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11094 2025-10-31 cs.CV 79%

Open3D-VQA: A Benchmark for Comprehensive Spatial Reasoning with Multimodal Large Language Model in Open Space

Weichen Zhang, Zile Zhou, Xin Zeng, Xuchen Liu, Jianjie Fang, Chen Gao, Yong Li, Jinqiang Cui, Xinlei Chen, Xiao-Ping Zhang

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室) Sun Yat-sen University(中山大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01294 2025-10-31 cs.SE cs.RO 78%

Metamorphic Testing of Multimodal Human Trajectory Prediction

Helge Spieker, Nadjib Lazaar, Arnaud Gotlieb, Nassim Belmecheri

机构 * Simula Research Laboratory(Simula研究实验室)

专题命中 多模态评测 :multimodal(title,abstract)

Comments Information and Software Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21497 2025-10-31 cs.CV cs.AI cs.CL cs.MA 78%

Paper2Poster: Towards Multimodal Poster Automation from Scientific Papers

Wei Pang, Kevin Qinghong Lin, Xiangru Jian, Xi He, Philip Torr

机构 * University of Waterloo(滑铁卢大学) University of Oxford(牛津大学) Vector Institute(向量研究所)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL、cs.AI

Comments Project Page: https://github.com/Paper2Poster/Paper2Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01001 2025-10-31 cs.CL cs.AI 62%

Zero-shot Benchmarking: A Framework for Flexible and Scalable Automatic Evaluation of Language Models

José Pombal, Nuno M. Guerreiro, Ricardo Rei, André F. T. Martins

机构 * Unbabel Instituto de Telecomunicações(电信研究所) Instituto Superior Técnico, Universidade de Lisboa(里斯本大学技术学院) MICS, CentraleSupélec, Université Paris-Saclay(MICS、CentraleSupélec、巴黎萨克雷大学) ELLIS Unit Lisbon(里斯本ELLIS单位)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26769 2025-10-31 cs.CV cs.LG 57%

SteerVLM: Robust Model Control through Lightweight Activation Steering for Vision Language Models

Anushka Sivakumar, Andrew Zhang, Zaber Hakim, Chris Thomas

机构 * Department of Computer Science(计算机科学系) Virginia Tech(弗吉尼亚理工学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16556 2025-10-31 cs.CV 57%

Fit for Purpose? Deepfake Detection in the Real World

Guangyu Lin, Li Lin, Christina P. Walker, Daniel S. Schiff, Shu Hu

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26358 2025-10-31 cs.RO cs.CV 57%

AgriGS-SLAM: Orchard Mapping Across Seasons via Multi-View Gaussian Splatting SLAM

Mirko Usuelli, David Rapado-Rincon, Gert Kootstra, Matteo Matteucci

机构 * Dipartimento di Bioingegneria, Elettronica e Informazione, Politecnico di Milano(生物工程、电子与信息系,米兰理工大学) Agricultural Biosystems Engineering, Wageningen University & Research(农业生物系统工程,瓦赫宁根大学与研究)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态Agent 4 篇

2510.26114 2025-10-31 cs.CV 79%

OracleAgent: A Multimodal Reasoning Agent for Oracle Bone Script Research

Caoshuo Li, Zengmao Ding, Xiaobin Hu, Bang Li, Donghao Luo, Xu Peng, Taisong Jin, Yongge Liu, Shengwei Han, Jing Yang, Xiaoping He, Feng Gao, AndyPian Wu, SevenShu, Chaoyang Wang, Chengjie Wang

机构 * Xiamen University(厦门大学) Anyang Normal University(安阳师范学院) Tencent YouTu Lab(腾讯YouTu实验室) Tencent SSV(腾讯SSV)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00056 2025-10-31 math.OC 78%

Sustainable Multi-Modal Transportation and Routing focusing on Costs and Carbon Emissions Reduction

Saba Javanpour, A. Radman, Sarow Saeedi, Sina Feizi Karimabadi, Daniel A. Larson, Eric C. Jones

专题命中 多模态Agent :multi-modal(title,abstract)

Comments Abstracted submitted in the Proceedings of the IISE Annual Conference & Expo 2025

Journal ref Proceedings of the IISE Annual Conference & Expo 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26022 2025-10-31 eess.IV cs.CV 57%

Groupwise Registration with Physics-Informed Test-Time Adaptation on Multi-parametric Cardiac MRI

Xinqi Li, Yi Zhang, Li-Ting Huang, Hsiao-Huang Chang, Thoralf Niendorf, Min-Chi Ku, Qian Tao, Hsin-Jung Yang

机构 * Biomedical Imaging Research Institute, Cedars-Sinai Medical Center, United States Berlin Ultrahigh Field Facility (B.U.F.F.), Max Delbrück Center for Molecular Medicine in the Helmholtz Association (MDC), Germany Department of Imaging Physics, Delft University of Technology, Netherlands TUM School of Computation, Information Technology, Technische Universität München, Germany Department of Surgery, Taipei Veterans General Hospital, Taiwan

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17197 2025-10-31 cs.LG cs.AI eess.SP 57%

SignalLLM: A General-Purpose LLM Agent Framework for Automated Signal Processing

Junlong Ke, Qiying Hu, Shenghai Yuan, Yuecong Xu, Jianfei Yang

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院) MARS Lab, Nanyang Technological University, Singapore(南洋理工大学MARS实验室)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.AI

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 多模态训练与对齐 4 篇

2504.11331 2025-10-31 cs.CL cs.MM 84%

Dependency Structure Augmented Contextual Scoping Framework for Multimodal Aspect-Based Sentiment Analysis

Hao Liu, Lijun He, Jiaxi Liang, Zhihan Ren, Haixia Bi, Fan Li

专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract);分类 cs.CL、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏