arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4657 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4657 篇

2406.03015 2025-07-03 cs.RO cs.CV 57%

Balancing Performance and Efficiency in Zero-shot Robotic Navigation

Dmytro Kuzmenko, Nadiya Shvai

机构 * Department of Multimedia Systems, National University of Kyiv-Mohyla Academy, Kyiv, Ukraine(多媒体系统系,基辅-莫希拉学院国家大学,乌克兰基辅) Department of Mathematics, National University of Kyiv-Mohyla Academy, Kyiv, Ukraine(数学系,基辅-莫希拉学院国家大学,乌克兰基辅)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Submitted to ICTERI 2024 Posters Track

Journal ref ICTERI 2024: Communications in Computer and Information Science, vol. 2020, pp. 370-381, Springer, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00886 2025-07-02 cs.CV cs.RO 57%

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond

Anna-Maria Halacheva, Jan-Nico Zaech, Xi Wang, Danda Pani Paudel, Luc Van Gool

机构 * ETH Zurich(苏黎世联邦理工学院) TU Munich(慕尼黑技术大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.24102 2025-07-01 cs.CV 57%

DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World

Xiangtai Li, Tao Zhang, Yanwei Li, Haobo Yuan, Shihao Chen, Yikang Zhou, Jiahao Meng, Yueyi Sun, Shilin Xu, Lu Qi, Tianheng Cheng, Yi Lin, Zilong Huang, Wenhao Huang, Jiashi Feng, Guang Shi

机构 * ByteDance Seed(字节跳动种子) Wuhan University(武汉大学) Peking University(北京大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Datasets and Models: https://github.com/lxtGH/DenseWorld-1M

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22979 2025-07-01 cs.CV 57%

Probabilistic Prototype Calibration of Vision-Language Models for Generalized Few-shot Semantic Segmentation

Jie Liu, Jiayi Shen, Pan Zhou, Jan-Jakob Sonke, Efstratios Gavves

机构 * University of Amsterdam(阿姆斯特丹大学) Singapore Management University(新加坡管理大学) The Netherlands Cancer Institute(荷兰癌症研究院)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments ICCV2025 Proceeding

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07503 2025-07-01 cs.CV 57%

Think Before You Segment: High-Quality Reasoning Segmentation with GPT Chain of Thoughts

Shiu-hong Kao, Yu-Wing Tai, Chi-Keung Tang

机构 * HKUST(香港理工大学) Dartmouth College(达特茅斯学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Project page: https://danielshkao.github.io/thinkfirst.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22395 2025-06-30 cs.CV 57%

Test-Time Consistency in Vision Language Models

Shih-Han Chou, Shivam Chandhok, James J. Little, Leonid Sigal

机构 * Department of Computer Science, University of British Columbia(不列颠哥伦比亚大学计算机科学系) Vector Institute for AI(人工智能矢量研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21627 2025-06-30 cs.RO cs.AI 57%

FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models

Shiyi Wang, Wenbo Li, Yiteng Chen, Qingyao Wu, Huiping Zhuang

机构 * School of Future Technology, South China University of Technology(未来技术学院,华南理工大学) School of Software Engineering, South China University of Technology(软件工程学院,华南理工大学) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程学院,华南理工大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

Comments 15 pages, 4 figures, under review of NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21476 2025-06-27 cs.CV 57%

Global and Local Entailment Learning for Natural World Imagery

Srikumar Sastry, Aayush Dhakal, Eric Xing, Subash Khanal, Nathan Jacobs

机构 * Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21227 2025-06-26 cs.CL 57%

LLaVA-CMoE: Towards Continual Mixture of Experts for Large Vision-Language Models

Hengyuan Zhao, Ziqin Wang, Qixin Sun, Kaiyou Song, Yilin Li, Xiaolin Hu, Qingpei Guo, Si Liu

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Tsinghua University(清华大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19513 2025-06-25 cs.CV cs.LG 57%

Visual hallucination detection in large vision-language models via evidential conflict

Tao Huang, Zhekun Liu, Rui Wang, Yang Zhang, Liping Jing

机构 * Beijing Key Lab of Traffic Data Mining(北京交通数据挖掘与具身智能重点实验室) State Key Laboratory of Advanced Rail Autonomous Operation(先进轨道交通自主运行国家重点实验室) School of Computer Science and Technology(计算机科学与技术学院) Beijing Jiaotong University(北京交通大学) School of Automation and Intelligence(自动化与智能学院) School of Electronic and Information Engineering(电子与信息工程学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Journal ref International Journal of Approximate Reasoning, Volume 186, November 2025, Article 109507

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19389 2025-06-25 cs.CV 57%

Emergence of Text Readability in Vision Language Models

Jaeyoo Park, Sanghyuk Chun, Wonjae Kim, Sangdoo Yun, Bohyung Han

机构 * Naver AI Lab Seoul National University(首尔国立大学) Computer Vision Laboratory, ECE(计算机视觉实验室,电子与计算机工程系) IPAI

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments EVAL-FoMo Workshop @ CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19320 2025-06-25 cs.CV 57%

Continual Retinal Vision-Language Pre-training upon Incremental Imaging Modalities

Yuang Yao, Ruiqi Wu, Yi Zhou, Tao Zhou

机构 * School of Computer Science and Engineering, Southeast University, China(计算机科学与工程学院,东南大学,中国) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Ministry of Education, China(新一代人工智能技术及其交叉应用重点实验室,教育部,中国) Nanjing University of Science and Technology, China(南京理工大学,中国)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18322 2025-06-24 cs.CV cs.LG 57%

Escaping the SpuriVerse: Can Large Vision-Language Models Generalize Beyond Seen Spurious Correlations?

Yiwei Yang, Chung Peng Lee, Shangbin Feng, Dora Zhao, Bingbing Wen, Anthony Z. Liu, Yulia Tsvetkov, Bill Howe

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) University of Michigan(密歇根大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07491 2025-06-24 cs.CV 57%

Kimi-VL Technical Report

Kimi Team, Angang Du, Bohong Yin, Bowei Xing, Bowen Qu, Bowen Wang, Cheng Chen, Chenlin Zhang, Chenzhuang Du, Chu Wei, Congcong Wang, Dehao Zhang, Dikang Du, Dongliang Wang, Enming Yuan, Enzhe Lu, Fang Li, Flood Sung, Guangda Wei, Guokun Lai, Han Zhu, Hao Ding, Hao Hu, Hao Yang, Hao Zhang, Haoning Wu, Haotian Yao, Haoyu Lu, Heng Wang, Hongcheng Gao, Huabin Zheng, Jiaming Li, Jianlin Su, Jianzhou Wang, Jiaqi Deng, Jiezhong Qiu, Jin Xie, Jinhong Wang, Jingyuan Liu, Junjie Yan, Kun Ouyang, Liang Chen, Lin Sui, Longhui Yu, Mengfan Dong, Mengnan Dong, Nuo Xu, Pengyu Cheng, Qizheng Gu, Runjie Zhou, Shaowei Liu, Sihan Cao, Tao Yu, Tianhui Song, Tongtong Bai, Wei Song, Weiran He, Weixiao Huang, Weixin Xu, Xiaokun Yuan, Xingcheng Yao, Xingzhe Wu, Xinhao Li, Xinxing Zu, Xinyu Zhou, Xinyuan Wang, Y. Charles, Yan Zhong, Yang Li, Yangyang Hu, Yanru Chen, Yejie Wang, Yibo Liu, Yibo Miao, Yidao Qin, Yimin Chen, Yiping Bao, Yiqin Wang, Yongsheng Kang, Yuanxin Liu, Yuhao Dong, Yulun Du, Yuxin Wu, Yuzhi Wang, Yuzi Yan, Zaida Zhou, Zhaowei Li, Zhejun Jiang, Zheng Zhang, Zhilin Yang, Zhiqi Huang, Zihao Huang, Zijia Zhao, Ziwei Chen, Zongyu Lin

机构 * Kimi Team(Kimi 团队)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Updated Kimi-VL-A3B-Thinking-2506 information

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14744 2025-06-24 cs.CL 57%

HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States

Yilei Jiang, Xinyan Gao, Tianshuo Peng, Yingshui Tan, Xiaoyong Zhu, Bo Zheng, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(中文大学香港大学) Future Lab, Alibaba Group(阿里集团未来实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

Comments Accepted by ACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04975 2025-06-24 cs.CV 57%

V2C-CBM: Building Concept Bottlenecks with Vision-to-Concept Tokenizer

Hangzhou He, Lei Zhu, Xinliang Zhang, Shuang Zeng, Qian Chen, Yanye Lu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by AAAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16691 2025-06-23 cs.CV 57%

LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation

Tongtian Yue, Longteng Guo, Yepeng Tang, Zijia Zhao, Xinxin Zhu, Hua Huang, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11215 2025-06-23 cs.CV 57%

A CLIP-Powered Framework for Robust and Generalizable Data Selection

Suorong Yang, Peng Ye, Wanli Ouyang, Dongzhan Zhou, Furao Shen

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments ICLR 2025 Spotlight

Journal ref ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13039 2025-06-17 cs.CV 57%

Evolution of ReID: From Early Methods to LLM Integration

Amran Bhuiyan, Mizanur Rahman, Md Tahmid Rahman Laskar, Aijun An, Jimmy Xiangji Huang

机构 * Information Retrieval and Knowledge Management Research Lab, York University, Toronto, Canada(信息检索与知识管理研究实验室,约克大学,多伦多,加拿大) Department of Electrical Engineering and Computer Science, York University, Toronto, Canada(电气工程与计算机科学系,约克大学,多伦多,加拿大)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05061 2025-06-17 cs.CV 57%

Test-time Contrastive Concepts for Open-world Semantic Segmentation with Vision-Language Models

Monika Wysoczańska, Antonin Vobecky, Amaia Cardiel, Tomasz Trzciński, Renaud Marlet, Andrei Bursuc, Oriane Siméoni

机构 * Warsaw University of Technology(华沙技术大学) CIIRC CTU Prague(布拉格CTU计算机科学与机器人研究所) FEE CTU Prague(布拉格CTU电子工程系) Tooploox LIGM, École des Ponts et Chaussées, IP Paris, CNRS, France(法国巴黎理工学院LIGM研究所) Université Grenoble Alpes(格勒诺布尔大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments TMLR camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12214 2025-06-17 cs.CV 57%

CLIP the Landscape: Automated Tagging of Crowdsourced Landscape Images

Ilya Ilyankou, Natchapon Jongwiriyanurak, Tao Cheng, James Haworth

机构 * UCL SpaceTimeLab(伦敦大学空间时间实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09506 2025-06-12 cs.MM 57%

Dynamic Sub-region Search in Homogeneous Collections Using CLIP

Bastian Jäckl, Vojtěch Kloda, Daniel A. Keim, Jakub Lokoč

专题命中 图文多模态 :multimodal(abstract);分类 cs.MM

Comments 18 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09429 2025-06-12 cs.CV 57%

A Novel Lightweight Transformer with Edge-Aware Fusion for Remote Sensing Image Captioning

Swadhin Das, Divyansh Mundra, Priyanshu Dayal, Raksha Sharma

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08691 2025-06-11 cs.CV 57%

VReST: Enhancing Reasoning in Large Vision-Language Models through Tree Search and Self-Reward Mechanism

Congzhi Zhang, Jiawei Peng, Zhenglin Wang, Yilong Lai, Haowen Sun, Heng Chang, Fei Ma, Weijiang Yu

机构 * School of Computer Science and Engineering, Sun Yat-Sen University(中山大学计算机科学与工程学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy(广东省人工智能与数字经济实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by ACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08566 2025-06-11 cs.CV 57%

Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations

Yibo Cui, Liang Xie, Yu Zhao, Jiawei Sun, Erwei Yin

机构 * Defense Innovation Institute, Chinese Academy of Military Science(国防科技研究院,中国军事科学院) Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心) School of Mechanical Engineering, Tianjin University(天津大学机械工程学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20024 2025-06-11 cs.CV 57%

SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning

Wufei Ma, Yu-Cheng Chou, Qihao Liu, Xingrui Wang, Celso de Melo, Jianwen Xie, Alan Yuille

机构 * DEVCOM Army Research Laboratory(DEVCOM陆军研究实验室) Lambda Inc(Lambda公司)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Project page: https://spatial-reasoner.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07957 2025-06-11 cs.AI 57%

Intrinsic Bias is Predicted by Pretraining Data and Correlates with Downstream Performance in Vision-Language Encoders

Kshitish Ghate, Isaac Slaughter, Kyra Wilson, Mona Diab, Aylin Caliskan

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.AI

Comments Accepted to NAACL Main, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14853 2025-06-10 cs.CV 57%

Unlocking the Capabilities of Large Vision-Language Models for Generalizable and Explainable Deepfake Detection

Peipeng Yu, Jianwei Fei, Hui Gao, Xuan Feng, Zhihua Xia, Chip Hong Chang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06279 2025-06-09 cs.CV 57%

CoMemo: LVLMs Need Image Context with Image Memory

Shi Liu, Weijie Su, Xizhou Zhu, Wenhai Wang, Jifeng Dai

机构 * Shi Liu Weijie Su Xizhou Zhu Wenhai Wang Jifeng Dai

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05318 2025-06-09 cs.CV 57%

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs

Haoyuan Li, Yanpeng Zhou, Yufei Gao, Tao Tang, Jianhua Han, Yujie Yuan, Dave Zhenyu Chen, Jiawang Bian, Hang Xu, Xiaodan Liang

机构 * Shenzhen campus of Sun Yat-sen University(中山大学深圳校区) Huawei Noah’s Ark Lab(华为诺亚实验室) MBZUAI Peng Cheng Laboratory(鹏城实验室) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏