arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4672 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4672 篇

2506.16673 2025-06-23 cs.CV 79%

Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge

Ruiming Chen, Junming Yang, Shiyu Xia, Xu Yang, Jing Wang, Xin Geng

机构 * School of Computer Science and Engineering, Southeast University, Nanjing 210096, China(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其跨学科应用关键实验室)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00473 2025-06-19 cs.CV 79%

Jailbreak Large Vision-Language Models Through Multi-Modal Linkage

Yu Wang, Xiaofei Zhou, Yichen Wang, Geyuan Zhang, Tianxing He

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Shanghai Qi Zhi Institute(上海启智研究所) University of Chicago(芝加哥大学)

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14212 2025-06-18 cs.AI 79%

What's in the Box? Reasoning about Unseen Objects from Multimodal Cues

Lance Ying, Daniel Xu, Alicia Zhang, Katherine M. Collins, Max H. Siegel, Joshua B. Tenenbaum

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

Comments Paper published at CogSci 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11155 2025-06-16 cs.CV 79%

Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search

Linhao Yu, Xinguang Ji, Yahui Liu, Fanheng Kong, Chenxi Sun, Jingyuan Zhang, Hongzhi Zhang, V. W., Fuzheng Zhang, Deyi Xiong

机构 * TJUNLP Lab, College of Intelligence and Computing, Tianjin University(天津大学智能计算学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

Comments 28 pages; ACL 2025(main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09473 2025-06-12 cs.CV 79%

Provoking Multi-modal Few-Shot LVLM via Exploration-Exploitation In-Context Learning

Cheng Chen, Yunpeng Zhai, Yifan Zhao, Jinyang Gao, Bolin Ding, Jia Li

机构 * State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV

Comments 10 pages, 6 figures, CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18941 2025-06-06 cs.CV cs.LG 79%

LEMoN: Label Error Detection using Multimodal Neighbors

Haoran Zhang, Aparna Balagopalan, Nassim Oufattole, Hyewon Jeong, Yan Wu, Jiacheng Zhu, Marzyeh Ghassemi

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

Comments Published in ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15228 2025-06-04 cs.LG cs.CV 79%

Learning from True-False Labels via Multi-modal Prompt Retrieving

Zhongnian Li, Jinghao Xu, Peng Ying, Meng Wei, Xinzheng Xu

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24837 2025-06-02 cs.CV 79%

Zero-Shot Chinese Character Recognition with Hierarchical Multi-Granularity Image-Text Aligning

Yinglian Zhu, Haiyang Yu, Qizao Wang, Wei Lu, Xiangyang Xue, Bin Li

机构 * Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理关键实验室) School of Computer Science, Fudan University(复旦大学计算机学院)

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV

Comments The first three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22869 2025-05-30 cs.CV 79%

SIGHT: Synthesizing Image-Text Conditioned and Geometry-Guided 3D Hand-Object Trajectories

Alexey Gavryushin, Alexandros Delitzas, Luc Van Gool, Marc Pollefeys, Kaichun Mo, Xi Wang

机构 * ETHZ(苏黎世联邦理工学院) MPI for Informatics(信息研究所) INSAIT(国际人工智能技术研究所) KU Leuven(鲁汶大学) Microsoft(微软公司) NVIDIA(英伟达公司) TUM(慕尼黑工业大学)

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13199 2025-05-28 cs.CR cs.AI 79%

Building Trustworthy Multimodal AI: A Review of Fairness, Transparency, and Ethics in Vision-Language Tasks

Mohammad Saleh, Azadeh Tabatabaei

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

Journal ref International Journal of Web Research, vol.8, no.2,pp.11-24, 2025,

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04395 2025-05-27 cs.CV cs.LG 79%

Time-VLM: Exploring Multimodal Vision-Language Models for Augmented Time Series Forecasting

Siru Zhong, Weilin Ruan, Ming Jin, Huan Li, Qingsong Wen, Yuxuan Liang

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19702 2025-05-27 cs.CV 79%

Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning

Minheng Ni, Zhengyuan Yang, Linjie Li, Chung-Ching Lin, Kevin Lin, Wangmeng Zuo, Lijuan Wang

机构 * Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学) Microsoft(微软公司)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17214 2025-05-26 cs.AI 79%

MEDMKG: Benchmarking Medical Knowledge Exploitation with Multimodal Knowledge Graph

Xiaochen Wang, Yuan Zhong, Lingwei Zhang, Lisong Dai, Ting Wang, Fenglong Ma

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Renmin Hospital of Wuhan University(武汉大学仁民医院) Stony Brook University(石溪大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

Comments Submitted to Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15629 2025-05-22 cs.MM 79%

Relationship Analysis of Image-Text Pair in SNS Posts

Takuto Nabeoka, Yijun Duan, Qiang Ma

专题命中 图文多模态 :image-text(title,abstract);分类 cs.MM

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15217 2025-05-22 cs.CV 79%

Multimodal Conditional Information Bottleneck for Generalizable AI-Generated Image Detection

Haotian Qin, Dongliang Chang, Yueying Gao, Bingyao Yu, Lei Chen, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

Comments 24 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14340 2025-05-21 cs.CV cs.LG 79%

Plane Geometry Problem Solving with Multi-modal Reasoning: A Survey

Seunghyuk Cho, Zhenyue Qin, Yang Liu, Youngbin Choi, Seungbeom Lee, Dongwoo Kim

机构 * Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院) Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系) Australian National University(澳大利亚国立大学)

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08851 2025-05-20 cs.LG cs.AI 79%

Mimic In-Context Learning for Multimodal Tasks

Yuchu Jiang, Jiale Fu, Chenduo Hao, Xinting Hu, Yingzhe Peng, Xin Geng, Xu Yang

机构 * Southeast University(东南大学) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, (Southeast University), Ministry of Education(新一代人工智能技术及其跨学科应用重点实验室) Nanyang Technological University(南洋理工大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

Comments 14 pages, 7 figures,CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18589 2025-05-14 cs.CV 79%

Benchmarking Multimodal Mathematical Reasoning with Explicit Visual Dependency

Zhikai Wang, Jiashuo Sun, Wenqi Zhang, Zhiqiang Hu, Xin Li, Fan Wang, Deli Zhao

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(虎扑实验室) Zhejiang University(浙江大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

Comments Home page: https://alibaba-damo-academy.github.io/VCBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02278 2025-05-06 cs.CV 79%

Compositional Image-Text Matching and Retrieval by Grounding Entities

Madhukar Reddy Vongala, Saurabh Srivastava, Jana Košecká

机构 * Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学)

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV

Comments Accepted at CVPR-W

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11786 2025-04-17 cs.CV 79%

DART: Disease-aware Image-Text Alignment and Self-correcting Re-alignment for Trustworthy Radiology Report Generation

Sang-Jun Park, Keun-Soo Heo, Dong-Hee Shin, Young-Han Son, Ji-Hye Oh, Tae-Eui Kam

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV

Comments The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09130 2025-04-15 cs.CL 79%

VisuoThink: Empowering LVLM Reasoning with Multimodal Tree Search

Yikun Wang, Siyin Wang, Qinyuan Cheng, Zhaoye Fei, Liang Ding, Qipeng Guo, Dacheng Tao, Xipeng Qiu

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05644 2025-04-09 cs.CV 79%

iEBAKER: Improved Remote Sensing Image-Text Retrieval Framework via Eliminate Before Align and Keyword Explicit Reasoning

Yan Zhang, Zhong Ji, Changxu Meng, Yanwei Pang, Jungong Han

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05575 2025-04-09 cs.CV cs.LG 79%

A Lightweight Large Vision-language Model for Multimodal Medical Images

Belal Alsinglawi, Chris McCarthy, Sara Webb, Christopher Fluke, Navid Toosy Saidy

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01700 2025-04-03 cs.HC cs.AI cs.RO 79%

Reasoning LLMs for User-Aware Multimodal Conversational Agents

Hamed Rahimi, Jeanne Cattoni, Meriem Beghili, Mouad Abrini, Mahdi Khoramshahi, Maribel Pino, Mohamed Chetouani

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24182 2025-04-01 cs.CV 79%

CIBR: Cross-modal Information Bottleneck Regularization for Robust CLIP Generalization

Yingrui Ji, Xi Xiao, Gaofei Chen, Hao Xu, Chenrui Ma, Lijing Zhu, Aokun Liang, Jiansheng Chen

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23667 2025-04-01 cs.CV 79%

Context-Independent OCR with Multimodal LLMs: Effects of Image Resolution and Visual Complexity

Kotaro Inoue

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23503 2025-04-01 cs.CL 79%

Evolutionary Prompt Optimization Discovers Emergent Multimodal Reasoning Strategies in Vision-Language Models

Sid Bharthulwar, John Rho, Katrina Brown

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL

Comments Published at ICLR 2025 Workshop on Reasoning and Planning for LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01167 2025-04-01 cs.CV 79%

Enhancing Vision-Language Compositional Understanding with Multimodal Synthetic Data

Haoxin Li, Boyang Li

专题命中 图文多模态 :multimodal(title);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16707 2025-03-31 cs.CV 79%

Cross-Modal and Uncertainty-Aware Agglomeration for Open-Vocabulary 3D Scene Understanding

Jinlong Li, Cristiano Saltori, Fabio Poiesi, Nicu Sebe

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20188 2025-03-27 cs.CV 79%

Rethinking Vision-Language Model in Face Forensics: Multi-Modal Interpretable Forged Face Detector

Xiao Guo, Xiufeng Song, Yue Zhang, Xiaohong Liu, Xiaoming Liu

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV

Comments 8 figures; 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏