arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2506.21627 2025-06-30 cs.RO cs.AI 57%

FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models

Shiyi Wang, Wenbo Li, Yiteng Chen, Qingyao Wu, Huiping Zhuang

机构 * School of Future Technology, South China University of Technology(未来技术学院,华南理工大学) School of Software Engineering, South China University of Technology(软件工程学院,华南理工大学) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程学院,华南理工大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

Comments 15 pages, 4 figures, under review of NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21476 2025-06-27 cs.CV 57%

Global and Local Entailment Learning for Natural World Imagery

Srikumar Sastry, Aayush Dhakal, Eric Xing, Subash Khanal, Nathan Jacobs

机构 * Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21227 2025-06-26 cs.CL 57%

LLaVA-CMoE: Towards Continual Mixture of Experts for Large Vision-Language Models

Hengyuan Zhao, Ziqin Wang, Qixin Sun, Kaiyou Song, Yilin Li, Xiaolin Hu, Qingpei Guo, Si Liu

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Tsinghua University(清华大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19513 2025-06-25 cs.CV cs.LG 57%

Visual hallucination detection in large vision-language models via evidential conflict

Tao Huang, Zhekun Liu, Rui Wang, Yang Zhang, Liping Jing

机构 * Beijing Key Lab of Traffic Data Mining(北京交通数据挖掘与具身智能重点实验室) State Key Laboratory of Advanced Rail Autonomous Operation(先进轨道交通自主运行国家重点实验室) School of Computer Science and Technology(计算机科学与技术学院) Beijing Jiaotong University(北京交通大学) School of Automation and Intelligence(自动化与智能学院) School of Electronic and Information Engineering(电子与信息工程学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Journal ref International Journal of Approximate Reasoning, Volume 186, November 2025, Article 109507

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19389 2025-06-25 cs.CV 57%

Emergence of Text Readability in Vision Language Models

Jaeyoo Park, Sanghyuk Chun, Wonjae Kim, Sangdoo Yun, Bohyung Han

机构 * Naver AI Lab Seoul National University(首尔国立大学) Computer Vision Laboratory, ECE(计算机视觉实验室,电子与计算机工程系) IPAI

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments EVAL-FoMo Workshop @ CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19320 2025-06-25 cs.CV 57%

Continual Retinal Vision-Language Pre-training upon Incremental Imaging Modalities

Yuang Yao, Ruiqi Wu, Yi Zhou, Tao Zhou

机构 * School of Computer Science and Engineering, Southeast University, China(计算机科学与工程学院,东南大学,中国) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Ministry of Education, China(新一代人工智能技术及其交叉应用重点实验室,教育部,中国) Nanjing University of Science and Technology, China(南京理工大学,中国)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18322 2025-06-24 cs.CV cs.LG 57%

Escaping the SpuriVerse: Can Large Vision-Language Models Generalize Beyond Seen Spurious Correlations?

Yiwei Yang, Chung Peng Lee, Shangbin Feng, Dora Zhao, Bingbing Wen, Anthony Z. Liu, Yulia Tsvetkov, Bill Howe

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) University of Michigan(密歇根大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07491 2025-06-24 cs.CV 57%

Kimi-VL Technical Report

Kimi Team, Angang Du, Bohong Yin, Bowei Xing, Bowen Qu, Bowen Wang, Cheng Chen, Chenlin Zhang, Chenzhuang Du, Chu Wei, Congcong Wang, Dehao Zhang, Dikang Du, Dongliang Wang, Enming Yuan, Enzhe Lu, Fang Li, Flood Sung, Guangda Wei, Guokun Lai, Han Zhu, Hao Ding, Hao Hu, Hao Yang, Hao Zhang, Haoning Wu, Haotian Yao, Haoyu Lu, Heng Wang, Hongcheng Gao, Huabin Zheng, Jiaming Li, Jianlin Su, Jianzhou Wang, Jiaqi Deng, Jiezhong Qiu, Jin Xie, Jinhong Wang, Jingyuan Liu, Junjie Yan, Kun Ouyang, Liang Chen, Lin Sui, Longhui Yu, Mengfan Dong, Mengnan Dong, Nuo Xu, Pengyu Cheng, Qizheng Gu, Runjie Zhou, Shaowei Liu, Sihan Cao, Tao Yu, Tianhui Song, Tongtong Bai, Wei Song, Weiran He, Weixiao Huang, Weixin Xu, Xiaokun Yuan, Xingcheng Yao, Xingzhe Wu, Xinhao Li, Xinxing Zu, Xinyu Zhou, Xinyuan Wang, Y. Charles, Yan Zhong, Yang Li, Yangyang Hu, Yanru Chen, Yejie Wang, Yibo Liu, Yibo Miao, Yidao Qin, Yimin Chen, Yiping Bao, Yiqin Wang, Yongsheng Kang, Yuanxin Liu, Yuhao Dong, Yulun Du, Yuxin Wu, Yuzhi Wang, Yuzi Yan, Zaida Zhou, Zhaowei Li, Zhejun Jiang, Zheng Zhang, Zhilin Yang, Zhiqi Huang, Zihao Huang, Zijia Zhao, Ziwei Chen, Zongyu Lin

机构 * Kimi Team(Kimi 团队)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Updated Kimi-VL-A3B-Thinking-2506 information

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14744 2025-06-24 cs.CL 57%

HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States

Yilei Jiang, Xinyan Gao, Tianshuo Peng, Yingshui Tan, Xiaoyong Zhu, Bo Zheng, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(中文大学香港大学) Future Lab, Alibaba Group(阿里集团未来实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

Comments Accepted by ACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04975 2025-06-24 cs.CV 57%

V2C-CBM: Building Concept Bottlenecks with Vision-to-Concept Tokenizer

Hangzhou He, Lei Zhu, Xinliang Zhang, Shuang Zeng, Qian Chen, Yanye Lu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by AAAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16691 2025-06-23 cs.CV 57%

LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation

Tongtian Yue, Longteng Guo, Yepeng Tang, Zijia Zhao, Xinxin Zhu, Hua Huang, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11215 2025-06-23 cs.CV 57%

A CLIP-Powered Framework for Robust and Generalizable Data Selection

Suorong Yang, Peng Ye, Wanli Ouyang, Dongzhan Zhou, Furao Shen

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments ICLR 2025 Spotlight

Journal ref ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13039 2025-06-17 cs.CV 57%

Evolution of ReID: From Early Methods to LLM Integration

Amran Bhuiyan, Mizanur Rahman, Md Tahmid Rahman Laskar, Aijun An, Jimmy Xiangji Huang

机构 * Information Retrieval and Knowledge Management Research Lab, York University, Toronto, Canada(信息检索与知识管理研究实验室,约克大学,多伦多,加拿大) Department of Electrical Engineering and Computer Science, York University, Toronto, Canada(电气工程与计算机科学系,约克大学,多伦多,加拿大)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05061 2025-06-17 cs.CV 57%

Test-time Contrastive Concepts for Open-world Semantic Segmentation with Vision-Language Models

Monika Wysoczańska, Antonin Vobecky, Amaia Cardiel, Tomasz Trzciński, Renaud Marlet, Andrei Bursuc, Oriane Siméoni

机构 * Warsaw University of Technology(华沙技术大学) CIIRC CTU Prague(布拉格CTU计算机科学与机器人研究所) FEE CTU Prague(布拉格CTU电子工程系) Tooploox LIGM, École des Ponts et Chaussées, IP Paris, CNRS, France(法国巴黎理工学院LIGM研究所) Université Grenoble Alpes(格勒诺布尔大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments TMLR camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12214 2025-06-17 cs.CV 57%

CLIP the Landscape: Automated Tagging of Crowdsourced Landscape Images

Ilya Ilyankou, Natchapon Jongwiriyanurak, Tao Cheng, James Haworth

机构 * UCL SpaceTimeLab(伦敦大学空间时间实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09506 2025-06-12 cs.MM 57%

Dynamic Sub-region Search in Homogeneous Collections Using CLIP

Bastian Jäckl, Vojtěch Kloda, Daniel A. Keim, Jakub Lokoč

专题命中 图文多模态 :multimodal(abstract);分类 cs.MM

Comments 18 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09429 2025-06-12 cs.CV 57%

A Novel Lightweight Transformer with Edge-Aware Fusion for Remote Sensing Image Captioning

Swadhin Das, Divyansh Mundra, Priyanshu Dayal, Raksha Sharma

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08691 2025-06-11 cs.CV 57%

VReST: Enhancing Reasoning in Large Vision-Language Models through Tree Search and Self-Reward Mechanism

Congzhi Zhang, Jiawei Peng, Zhenglin Wang, Yilong Lai, Haowen Sun, Heng Chang, Fei Ma, Weijiang Yu

机构 * School of Computer Science and Engineering, Sun Yat-Sen University(中山大学计算机科学与工程学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy(广东省人工智能与数字经济实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by ACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08566 2025-06-11 cs.CV 57%

Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations

Yibo Cui, Liang Xie, Yu Zhao, Jiawei Sun, Erwei Yin

机构 * Defense Innovation Institute, Chinese Academy of Military Science(国防科技研究院,中国军事科学院) Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心) School of Mechanical Engineering, Tianjin University(天津大学机械工程学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20024 2025-06-11 cs.CV 57%

SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning

Wufei Ma, Yu-Cheng Chou, Qihao Liu, Xingrui Wang, Celso de Melo, Jianwen Xie, Alan Yuille

机构 * DEVCOM Army Research Laboratory(DEVCOM陆军研究实验室) Lambda Inc(Lambda公司)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Project page: https://spatial-reasoner.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07957 2025-06-11 cs.AI 57%

Intrinsic Bias is Predicted by Pretraining Data and Correlates with Downstream Performance in Vision-Language Encoders

Kshitish Ghate, Isaac Slaughter, Kyra Wilson, Mona Diab, Aylin Caliskan

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.AI

Comments Accepted to NAACL Main, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14853 2025-06-10 cs.CV 57%

Unlocking the Capabilities of Large Vision-Language Models for Generalizable and Explainable Deepfake Detection

Peipeng Yu, Jianwei Fei, Hui Gao, Xuan Feng, Zhihua Xia, Chip Hong Chang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06279 2025-06-09 cs.CV 57%

CoMemo: LVLMs Need Image Context with Image Memory

Shi Liu, Weijie Su, Xizhou Zhu, Wenhai Wang, Jifeng Dai

机构 * Shi Liu Weijie Su Xizhou Zhu Wenhai Wang Jifeng Dai

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05318 2025-06-09 cs.CV 57%

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs

Haoyuan Li, Yanpeng Zhou, Yufei Gao, Tao Tang, Jianhua Han, Yujie Yuan, Dave Zhenyu Chen, Jiawang Bian, Hang Xu, Xiaodan Liang

机构 * Shenzhen campus of Sun Yat-sen University(中山大学深圳校区) Huawei Noah’s Ark Lab(华为诺亚实验室) MBZUAI Peng Cheng Laboratory(鹏城实验室) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05061 2025-06-06 cs.CV 57%

A Survey on Vietnamese Document Analysis and Recognition: Challenges and Future Directions

Anh Le, Thanh Lam, Dung Nguyen

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04501 2025-06-06 cs.CV 57%

AuthGuard: Generalizable Deepfake Detection via Language Guidance

Guangyu Shen, Zhihua Li, Xiang Xu, Tianchen Zhao, Zheng Zhang, Dongsheng An, Zhuowen Tu, Yifan Xing, Qin Zhang

机构 * Purdue University(普渡大学) AWS AI Labs(AWS人工智能实验室)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03569 2025-06-05 cs.CL 57%

MiMo-VL Technical Report

Core Team, Zihao Yue, Zhenru Lin, Yifan Song, Weikun Wang, Shuhuai Ren, Shuhao Gu, Shicheng Li, Peidian Li, Liang Zhao, Lei Li, Kainan Bao, Hao Tian, Hailin Zhang, Gang Wang, Dawei Zhu, Cici, Chenhong He, Bowen Ye, Bowen Shen, Zihan Zhang, Zihan Jiang, Zhixian Zheng, Zhichao Song, Zhenbo Luo, Yue Yu, Yudong Wang, Yuanyuan Tian, Yu Tu, Yihan Yan, Yi Huang, Xu Wang, Xinzhe Xu, Xingchen Song, Xing Zhang, Xing Yong, Xin Zhang, Xiangwei Deng, Wenyu Yang, Wenhan Ma, Weiwei Lv, Weiji Zhuang, Wei Liu, Sirui Deng, Shuo Liu, Shimao Chen, Shihua Yu, Shaohui Liu, Shande Wang, Rui Ma, Qiantong Wang, Peng Wang, Nuo Chen, Menghang Zhu, Kangyang Zhou, Kang Zhou, Kai Fang, Jun Shi, Jinhao Dong, Jiebao Xiao, Jiaming Xu, Huaqiu Liu, Hongshen Xu, Heng Qu, Haochen Zhao, Hanglong Lv, Guoan Wang, Duo Zhang, Dong Zhang, Di Zhang, Chong Ma, Chang Liu, Can Cai, Bingquan Xia

机构 * LLM-Core Xiaomi(小米)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11479 2025-06-04 cs.CL 57%

Value-Spectrum: Quantifying Preferences of Vision-Language Models via Value Decomposition in Social Media Contexts

Jingxuan Li, Yuning Yang, Shengqi Yang, Linfan Zhang, Ying Nian Wu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

Comments ACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01366 2025-06-03 cs.CV 57%

CLIP-driven rain perception: Adaptive deraining with pattern-aware network routing and mask-guided cross-attention

Cong Guan, Osamu Yoshie

机构 * Graduate School of Information, Production and Systems, Waseda University(信息、生产与系统研究生院,早稻田大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18022 2025-06-03 cs.CV 57%

RemoteSAM: Towards Segment Anything for Earth Observation

Liang Yao, Fan Liu, Delong Chen, Chuanyi Zhang, Yijun Wang, Ziyun Chen, Wei Xu, Shimin Di, Yuhui Zheng

机构 * Hohai University(河海大学) HKUST(香港科技大学) Southeast University(东南大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏