arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4657 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4657 篇

2510.03858 2025-10-07 cs.CV 57%

Cross-View Open-Vocabulary Object Detection in Aerial Imagery

Jyoti Kini, Rohit Gupta, Mubarak Shah

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18857 2025-10-07 cs.CV cs.LG 57%

Probabilistic Language-Image Pre-Training

Sanghyuk Chun, Wonjae Kim, Song Park, Sangdoo Yun

机构 * NAVER AI Lab(NAVER AI实验室)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Code: https://github.com/naver-ai/prolip HuggingFace Hub: https://huggingface.co/collections/SanghyukChun/prolip-6712595dfc87fd8597350291 33 pages, 4.5 MB; LongProLIP paper: arXiv:2503.08048; Multiplicity paper for more background: arxiv.org:2505.19614; v4: fix typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02780 2025-10-06 cs.CV 57%

Reasoning Riddles: How Explainability Reveals Cognitive Limits in Vision-Language Models

Prahitha Movva

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Journal ref COLM 2025: First Workshop on the Application of LLM Explainability to Reasoning and Planning

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09047 2025-10-06 cs.CL 57%

Same Task, Different Circuits: Disentangling Modality-Specific Mechanisms in VLMs

Yaniv Nikankin, Dana Arad, Yossi Gandelsman, Yonatan Belinkov

机构 * Technion – Israel Institute of Technology(技术学院 – 以色列理工学院) UC Berkeley(加州大学伯克利分校)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18035 2025-10-06 cs.CV 57%

Vehicle-Scene Interaction: A Text-Driven 3D Lidar Place Recognition Method for Autonomous Driving

Tianyi Shang, Zhenyu Li, Pengjie Xu, Zhaojun Deng

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01534 2025-10-06 cs.CV 57%

Toward a Holistic Evaluation of Robustness in CLIP Models

Weijie Tu, Weijian Deng, Tom Gedeon

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted to IEEE TPAMI, extension of NeurIPS'23 work: A Closer Look at the Robustness of Contrastive Language-Image Pre-Training (CLIP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00690 2025-10-02 cs.AI 57%

ACPO: Adaptive Curriculum Policy Optimization for Aligning Vision-Language Models in Complex Reasoning

Yunhao Wang, Ziting Li, Shuai Chen, Tao Liu, Chao Song, Junjie Jiang, Jian Zhu, Peng Gao, Bin Qin

机构 * Xiaomi Inc.(小米公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17349 2025-10-02 cs.CV 57%

Beyond Semantics: Rediscovering Spatial Awareness in Vision-Language Models

Jianing Qi, Jiawei Liu, Hao Tang, Zhigang Zhu

机构 * CUNY Graduate Center(纽约大学研究生中心) Borough of Manhattan Community College(曼哈顿社区学院) The City College of New York(纽约城市学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08561 2025-10-02 cs.CV 57%

ComicsPAP: understanding comic strips by picking the correct panel

Emanuele Vivoli, Artemis Llabrés, Mohamed Ali Souibgui, Marco Bertini, Ernest Valveny Llobet, Dimosthenis Karatzas

机构 * CVC, Autonomous University of Barcelona, Spain(CVC,巴塞罗那自治大学,西班牙) MICC, University of Florence, Italy(MICC,佛罗伦萨大学,意大利)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Journal ref Document Analysis and Recognition - ICDAR 2025. ICDAR 2025. Lecture Notes in Computer Science, vol 16023. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21432 2025-10-01 cs.RO cs.CV 57%

UAV-VLN: End-to-End Vision Language guided Navigation for UAVs

Pranav Saxena, Nishant Raghuvanshi, Neena Goveas

机构 * Birla Institute of Technology and Science Pilani, K.K Birla Goa Campus(比拉理工学院和科学学院,K.K比拉果阿校区)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Journal ref Proc. European Conference on Mobile Robots (ECMR), 2025, pp. 1-6

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25151 2025-09-30 cs.CV 57%

VideoAnchor: Reinforcing Subspace-Structured Visual Cues for Coherent Visual-Spatial Reasoning

Zhaozhi Wang, Tong Zhang, Mingyue Guo, Yaowei Wang, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) Peng Cheng Lab(鹏城实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24231 2025-09-30 cs.CV 57%

EVLF-FM: Explainable Vision Language Foundation Model for Medicine

Yang Bai, Haoran Cheng, Yang Zhou, Jun Zhou, Arun Thirunavukarasu, Yuhe Ke, Jie Yao, Kanae Fukutsu, Chrystie Wan Ning Quek, Ashley Hong, Laura Gutierrez, Zhen Ling Teo, Darren Shu Jeng Ting, Brian T. Soetikno, Christopher S. Nielsen, Tobias Elze, Zengxiang Li, Linh Le Dinh, Hiok Hong Chan, Victor Koh, Marcus Tan, Kelvin Z. Li, Leonard Yip, Ching Yu Cheng, Yih Chung Tham, Gavin Siew Wei Tan, Leopold Schmetterer, Marcus Ang, Rahat Hussain, Jod Mehta, Tin Aung, Lionel Tim-Ee Cheng, Tran Nguyen Tuan Anh, Chee Leong Cheng, Tien Yin Wong, Nan Liu, Iain Beehuat Tan, Soon Thye Lim, Eyal Klang, Tony Kiat Hon Lim, Rick Siow Mong Goh, Yong Liu, Daniel Shu Wei Ting

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17127 2025-09-30 cs.CV cs.LG 57%

Pixels Versus Priors: Controlling Knowledge Priors in Vision-Language Models through Visual Counterfacts

Michal Golovanevsky, William Rudman, Michael Lepori, Amir Bar, Ritambhara Singh, Carsten Eickhoff

机构 * Brown University(布朗大学) Tel Aviv University(特拉维夫大学) University of Tübingen(图宾根大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23917 2025-09-30 cs.CV 57%

Bridging the Task Gap: Multi-Task Adversarial Transferability in CLIP and Its Derivatives

Kuanrong Liu, Siyuan Liang, Cheng Qian, Ming Zhang, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University, China(中山大学深圳校区) The National University of Singapore, Singapore(新加坡国立大学) National Key Laboratory of Science and Technology on Information System Security, China(信息系统安全科学技术国家重点实验室)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22674 2025-09-30 cs.CV 57%

Pathological Truth Bias in Vision-Language Models

Yash Thube

机构 * Savitribai Phule Pune University (SPPU)(萨维特里·布尔大学(SPPU))

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 10 pages, 12 figures. Code for MATS released at https://github.com/thubZ09/mats-spatial-reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22447 2025-09-29 cs.AI cs.NE 57%

Guiding Evolution of Artificial Life Using Vision-Language Models

Nikhil Baid, Hannah Erlebach, Paul Hellegouarch, Frederico Wieser

机构 * University College London(伦敦大学学院) Institut Pasteur(巴斯德研究院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

Comments 9 pages, 6 figures. Accepted for publication in the Proceedings of the Artificial Life Conference 2025 (MIT Press)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22093 2025-09-29 cs.RO cs.AI 57%

Action-aware Dynamic Pruning for Efficient Vision-Language-Action Manipulation

Xiaohuan Pei, Yuxing Chen, Siyu Xu, Yunke Wang, Yuheng Shi, Chang Xu

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21980 2025-09-29 cs.CV 57%

Resolving Ambiguity in Gaze-Facilitated Visual Assistant Interaction Paradigm

Zeyu Wang, Baiyu Chen, Kun Yan, Hongjing Piao, Hao Xue, Flora D. Salim, Yuanchun Shi, Yuntao Wang

机构 * Key Laboratory of Pervasive Computing, Tsinghua University(清华大学普适计算重点实验室) The University of New South Wales(新南威尔士大学) SKLSDE Lab, Beihang University(北航SKLSDE实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20196 2025-09-25 cs.CV cs.LG 57%

Universal Camouflage Attack on Vision-Language Models for Autonomous Driving

Dehong Kong, Sifan Yu, Siyuan Liang, Jiawei Liang, Jianhou Gan, Aishan Liu, Wenqi Ren

机构 * School of Cyber Science and Technology, SUN YAT-SEN UNIVERSITY(中山大学计算机科学与技术学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Key Laboratory of Education Informatization for Nationalities, Yunnan Normal University(云南师范大学民族教育信息化重点实验室) SCSE, Beihang University(北航软件学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18485 2025-09-25 q-bio.NC cs.CV 57%

Deciphering Functions of Neurons in Vision-Language Models

Jiaqi Xu, Cuiling Lan, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted by the 31st ACM International Conference on Multimedia (ACM MM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19870 2025-09-25 cs.CV 57%

FreezeVLA: Action-Freezing Attacks against Vision-Language-Action Models

Xin Wang, Jie Li, Zejia Weng, Yixu Wang, Yifeng Gao, Tianyu Pang, Chao Du, Yan Teng, Yingchun Wang, Zuxuan Wu, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai AI Lab(上海人工智能实验室) Sea AI Lab(Sea人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19003 2025-09-24 cs.CV 57%

Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards

Honghao Chen, Xingzhou Lou, Xiaokun Feng, Kaiqi Huang, Xinlong Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19269 2025-09-23 cs.CV 57%

Neural Antidote: Class-Wise Prompt Tuning for Purifying Backdoors in CLIP

Jiawei Kong, Hao Fang, Sihang Guo, Chenxi Qing, Kuofeng Gao, Bin Chen, Shu-Tao Xia, Ke Xu

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10894 2025-09-23 cs.CV 57%

ViLReF: An Expert Knowledge Enabled Vision-Language Retinal Foundation Model

Shengzhu Yang, Jiawei Du, Jia Guo, Weihang Zhang, Hanruo Liu, Huiqi Li, Ningli Wang

机构 * Beijing Institute of Technology(北京理工大学) Beijing Key Laboratory of Intelligent Diagnosis Technology and Equipment for Optic Nerve-Related Eye Diseases(北京智能诊断技术与设备重点实验室) Tsinghua University(清华大学) Beijing Tongren Hospital, Capital Medical University(北京同仁医院) Henan Academy of Innovations in Medical Science(河南医学创新研究院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14312 2025-09-22 cs.CV 57%

CLIPTTA: Robust Contrastive Vision-Language Test-Time Adaptation

Marc Lafon, Gustavo Adolfo Vargas Hakim, Clément Rambour, Christian Desrosier, Nicolas Thome

机构 * Conservatoire National des Arts et Métiers(法国国家艺术与工艺学院) Sorbonne Université(索邦大学) ETS Montreal(蒙特利尔ETS) Institut universitaire de France(法国国家科学研究中心)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Journal ref 39th Conference on Neural Information Processing Systems, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07620 2025-09-22 cs.CV 57%

ViLU: Learning Vision-Language Uncertainties for Failure Prediction

Marc Lafon, Yannis Karmim, Julio Silva-Rodríguez, Paul Couairon, Clément Rambour, Raphaël Fournier-Sniehotta, Ismail Ben Ayed, Jose Dolz, Nicolas Thome

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Journal ref International Conference on Computer Vision, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00743 2025-09-22 cs.CV 57%

Quality-Driven Curation of Remote Sensing Vision-Language Data via Learned Scoring Models

Dilxat Muhtar, Enzhuo Zhang, Zhenshi Li, Feng Gu, Yanglangxing He, Pengfeng Xiao, Xueliang Zhang

机构 * Nanjing University(南京大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 39 pages, 13 figures. Accept for NeruIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14033 2025-09-22 cs.CV 57%

SAIL-VL2 Technical Report

Weijie Yin, Yongjie Ye, Fangxun Shu, Yue Liao, Zijian Kang, Hongyuan Dong, Haiyang Yu, Dingkang Yang, Jiacong Wang, Han Wang, Wenzhuo Liu, Xiao Liang, Shuicheng Yan, Chao Feng

机构 * Douyin SAIL Team(字节跳动 SAIL 团队) LV-NUS Lab(NUS 实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14571 2025-09-19 cs.HC cs.AI cs.LG 57%

VisMoDAl: Visual Analytics for Evaluating and Improving Corruption Robustness of Vision-Language Models

Huanchen Wang, Wencheng Zhang, Zhiqiang Wang, Zhicong Lu, Yuxin Ma

机构 * Southern University of Science and Technology(南方科技大学) City University of Hong Kong(香港城市大学) George Mason University(乔治·马歇尔大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI

Comments 11 pages, 7 figures, 1 table, accepted to IEEE VIS 2025 (IEEE Transactions on Visualization and Computer Graphics)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12492 2025-09-17 cs.CV 57%

Evaluating Robustness of Vision-Language Models Under Noisy Conditions

Purushoth, Alireza

机构 * University of Nevada Reno(内华达大学拉斯维加斯分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏