arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2257 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2257 篇

2512.01300 2025-12-02 cs.AI 83%

RoboDriveVLM: A Novel Benchmark and Baseline towards Robust Vision-Language Models for Autonomous Driving

RoboDriveVLM:一种面向自动驾驶鲁棒视觉-语言模型的新型基准与基线

Dacheng Liao, Mengshi Qi, Peng Shu, Zhining Zhang, Yuxin Lin, Liang Liu, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI

AI总结 RoboDriveVLM提出了一种新型基准和基线,用于评估视觉-语言模型在自动驾驶中的鲁棒性,通过模拟多种腐蚀场景提升系统可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06284 2025-12-02 cs.AI 83%

A Comprehensive Survey and Guide to Multimodal Large Language Models in Vision-Language Tasks

多模态大语言模型在视觉-语言任务中的综合综述与指南

Chia Xin Liang, Pu Tian, Caitlyn Heqi Yin, Yao Yua, Wei An-Hou, Li Ming, Xinyuan Song, Tianyang Wang, Ziqian Bi, Ming Liu

机构 * JTB Technology Corp.(JTB技术公司) Stockton University(斯托顿大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) AppCubic USA(AppCubic美国公司) Nomad Sustaintech LTD(Nomad可持续科技有限公司) Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学) University of Liverpool(利物浦大学) Indiana University(印第安纳大学) Purdue University(普渡大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文综述了多模态大语言模型在视觉-语言任务中的应用,探讨了其架构、训练方法及挑战,并提供了理论与实践的全面指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16423 2025-11-21 cs.AI cs.CL 83%

TOFA: Training-Free One-Shot Federated Adaptation for Vision-Language Models

TOFA: 无需训练的一次性联邦适应用于视觉-语言模型

Li Zhang, Zhongxuan Han, XiaoHua Feng, Jiaming Zhang, Yuyuan Li, Linbo Jiang, Jianan Lin, Chaochao Chen

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI

AI总结 TOFA提出一种无需训练的一次性联邦适应方法,通过视觉和文本管道提取任务相关表示,以高效适应视觉-语言模型在联邦学习中的应用。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14160 2025-11-20 cs.CL cs.LG 83%

Breaking Language Barriers or Reinforcing Bias? A Study of Gender and Racial Disparities in Multilingual Contrastive Vision Language Models

Zahraa Al Sahili, Ioannis Patras, Matthew Purver

机构 * Queen Mary University of London(伦敦大学玛丽女王学院) Institut Jožef Stefan(乔泽夫·斯蒂芬研究所)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.LG

Comments Accepted at IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16839 2025-11-18 cs.AI 83%

One VLM, Two Roles: Stage-Wise Routing and Specialty-Level Deployment for Clinical Workflows

Shayan Vassef, Soorya Ram Shimegekar, Abhay Goyal, Koustuv Saha, Pi Zonooz, Navin Kumar

机构 * Nimblemind USA(Nimblemind公司) Florida International University(佛罗里达国际大学) University of Illinois - Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08809 2025-11-04 cs.LG 83%

Decoupling Contrastive Decoding: Robust Hallucination Mitigation in Multimodal Large Language Models

Wei Chen, Xin Yan, Bin Wen, Fan Yang, Tingting Gao, Di Zhang, Long Chen

机构 * HKUST(香港科技大学) University of Waterloo(滑铁卢大学) Kuaishou Technology(快手科技)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.LG

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26830 2025-11-03 cs.LG cs.CR 83%

SmoothGuard: Defending Multimodal Large Language Models with Noise Perturbation and Clustering Aggregation

Guangzhi Su, Shuchang Huang, Yutong Ke, Zhuohang Liu, Long Qian, Kaizhu Huang

机构 * Independent Researcher(独立研究者)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17191 2025-10-29 cs.RO cs.AI 83%

SimpleVSF: VLM-Scoring Fusion for Trajectory Prediction of End-to-End Autonomous Driving

Peiru Zheng, Yun Zhao, Zhan Gong, Hong Zhu, Shaohua Wu

机构 * IEIT Systems(IEIT系统)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21906 2025-10-28 cs.NE cs.AI 83%

Structure-Aware Cooperative Ensemble Evolutionary Optimization on Combinatorial Problems with Multimodal Large Language Models

Jie Zhao, Kang Hao Cheong

机构 * School of Physical and Mathematical Sciences, Nanyang Technological University(南洋理工大学物理与数学科学学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01126 2025-10-02 cs.CV cs.RO 83%

Strategic Fusion of Vision Language Models: Shapley-Credited Context-Aware Dawid-Skene for Multi-Label Tasks in Autonomous Driving

Yuxiang Feng, Keyang Zhang, Hassane Ouchouid, Ashwil Kaniamparambil, Ioannis Souflas, Panagiotis Angeloudis

机构 * Centre for Transport Engineering and Modelling, Department of Civil and Environmental Engineering, Imperial College London(交通工程与建模中心,土木与环境工程系,帝国理工学院伦敦分校) ELM Europe(ELM欧洲)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22674 2025-09-30 cs.CV 83%

Pathological Truth Bias in Vision-Language Models

Yash Thube

机构 * Savitribai Phule Pune University (SPPU)(萨维特里·布尔大学(SPPU))

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);LLaVA(abstract);分类 cs.CV

Comments 10 pages, 12 figures. Code for MATS released at https://github.com/thubZ09/mats-spatial-reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15963 2025-09-30 cs.CV cs.CL 83%

OViP: Online Vision-Language Preference Learning for VLM Hallucination

Shujun Liu, Siyuan Wang, Zejun Li, Jianxiang Wang, Cheng Zeng, Zhongyu Wei

机构 * Fudan University(复旦大学) University of Southern California(南加州大学) ByteDance(字节跳动)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19212 2025-09-24 cs.CL cs.AI 83%

Steering Multimodal Large Language Models Decoding for Context-Aware Safety

Zheyuan Liu, Zhangchen Xu, Guangyao Dou, Xiangchi Yuan, Zhaoxuan Tan, Radha Poovendran, Meng Jiang

机构 * University of Notre Dame(notre dame 大学) University of Washington(华盛顿大学) Johns Hopkins University(约翰霍普金斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

Comments A lightweight and model-agnostic decoding framework that dynamically adjusts token generation based on multimodal context

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16645 2025-09-23 cs.CV 83%

ADVEDM:Fine-grained Adversarial Attack against VLM-based Embodied Agents

Yichen Wang, Hangtao Zhang, Hewen Pan, Ziqi Zhou, Xianlong Wang, Peijin Guo, Lulu Xue, Shengshan Hu, Minghui Li, Leo Yu Zhang

机构 * National Engineering Research Center for Big Data Technology and System(大数据技术与系统国家工程研究中心) Services Computing Technology and System Lab(服务计算技术与系统实验室) Cluster and Grid Computing Lab(集群与网格计算实验室) Hubei Engineering Research Center on Big Data Security(湖北省大数据安全工程研究中心) Hubei Key Laboratory of Distributed System Security(湖北省分布式系统安全重点实验室) School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学信息科学与工程学院) School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) Department of Computer Science, City University of HongKong(香港城市大学计算机科学系) School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23024 2025-09-19 cs.LG 83%

An Empirical Study of Federated Prompt Learning for Vision Language Model

Zhihao Wang, Wenke Huang, Tian Chen, Zekun Shi, Guancheng Wan, Yu Qiao, Bin Yang, Jian Wang, Bing Li, Mang Ye

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Laboratory, China(中关村实验室)

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);VLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07575 2025-09-09 cs.CV cs.CL 83%

VisBias: Measuring Explicit and Implicit Social Biases in Vision Language Models

Jen-tse Huang, Jiantong Qin, Jianping Zhang, Youliang Yuan, Wenxuan Wang, Jieyu Zhao

机构 * University of Southern California(南加州大学) University of Bristol(布里斯托大学) Centre National de la Recherche Scientifique(法国国家科学研究中心) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV

Comments Accepted to EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18805 2025-08-27 cs.CR cs.CV 83%

Hidden Tail: Adversarial Image Causing Stealthy Resource Consumption in Vision-Language Models

Rui Zhang, Zihan Wang, Tianli Yang, Hongwei Li, Wenbo Jiang, Qingchuan Zhao, Yang Liu, Guowen Xu

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02028 2025-08-21 cs.CV 83%

Bench2ADVLM: A Closed-Loop Benchmark for Vision-language Models in Autonomous Driving

Tianyuan Zhang, Ting Jin, Lu Wang, Jiangfan Liu, Siyuan Liang, Mingchuan Zhang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航大学) Nanyang Technological University(南洋理工大学) Henan University of Science and Technology(河南科技大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05148 2025-08-14 cs.RO cs.AI 83%

Chemist Eye: A Visual Language Model-Powered System for Safety Monitoring and Robot Decision-Making in Self-Driving Laboratories

Francisco Munguia-Galeano, Zhengxue Zhou, Satheeshkumar Veeramani, Hatem Fakhruldeen, Louis Longley, Rob Clowes, Andrew I. Cooper

机构 * Cooper Group, Department of Chemistry, University of Liverpool(Cooper集团,化学系,利物浦大学)

专题命中 幻觉与鲁棒性 :visual language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09230 2025-08-14 cs.MA cs.AI 83%

Cowpox: Towards the Immunity of VLM-based Multi-Agent Systems

Yutong Wu, Jie Zhang, Yiming Li, Chao Zhang, Qing Guo, Nils Lukas, Tianwei Zhang

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore, Singapore.(南洋理工大学计算机与数据科学学院) CFAR and IHPC, Agency for Science, Technology and Research, Singapore.(科技研究局) Network and Information Security Lab, Tsinghua University, Beijing, China.(清华大学网络与信息安全部门) Mohamed bin Zayed University of Artificial Intelligence, Masdar City, Abu Dhabi(马斯达尔城人工智能大学)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05167 2025-08-08 cs.CV 83%

PhysPatch: A Physically Realizable and Transferable Adversarial Patch Attack for Multimodal Large Language Models-based Autonomous Driving Systems

Qi Guo, Xiaojun Jia, Shanmin Pang, Simeng Qin, Lin Wang, Ju Jia, Yang Liu, Qing Guo

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04942 2025-08-08 cs.CV 83%

Accelerating Conditional Prompt Learning via Masked Image Modeling for Vision-Language Models

Phuoc-Nguyen Bui, Khanh-Binh Nguyen, Hyunseung Choo

机构 * Convergence Research Institute, Sungkyunkwan University(convergence research institute, 首尔大学) School of Information Technology, Deakin University(信息科技学院, 德金大学) Department of Electrical and Computer Engineering, Sungkyunkwan University(电气与计算机工程系, 首尔大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments ACMMM-LAVA 2025, 10 pages, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04576 2025-08-07 cs.AI 83%

ConfProBench: A Confidence Evaluation Benchmark for MLLM-Based Process Judges

Yue Zhou, Yi Chang, Yuan Wu

专题命中 幻觉与鲁棒性 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01308 2025-08-05 cs.CV 83%

Safeguarding Vision-Language Models: Mitigating Vulnerabilities to Gaussian Noise in Perturbation-based Attacks

Jiawei Wang, Yushen Zuo, Yuanjun Chai, Zhendong Liu, Yicheng Fu, Yichun Feng, Kin-Man Lam

机构 * University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) University of Washington(华盛顿大学) Nanjing University(南京大学) Stanford University(斯坦福大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13652 2025-08-05 cs.CV 83%

Web Artifact Attacks Disrupt Vision Language Models

Maan Qraitem, Piotr Teterwak, Kate Saenko, Bryan A. Plummer

机构 * Boston University(波士顿大学)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23391 2025-08-01 cs.LG cs.RO 83%

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling

Tung M. Luu, Donghoon Lee, Younghwan Lee, Chang D. Yoo

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.LG

Comments Accepted to IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14729 2025-08-01 cs.CV 83%

Uncovering Cultural Representation Disparities in Vision-Language Models

Ram Mohan Rao Kadiyala, Siddhant Gupta, Jebish Purbey, Srishti Yadav, Suman Debnath, Alejandro Salamanca, Desmond Elliott

机构 * Cohere Labs Community IIT Roorkee(印度理工学院罗尔克hee分校) University of Copenhagen(哥本哈根大学) Cohere Labs Amazon Datasets(亚马逊数据集)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);vision language model(abstract);分类 cs.CV

Comments 28 pages, 36 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12945 2025-07-18 cs.CV 83%

Analysis of Image-and-Text Uncertainty Propagation in Multimodal Large Language Models with Cardiac MR-Based Applications

Yucheng Tang, Yunguan Fu, Weixi Yi, Yipei Wang, Daniel C. Alexander, Rhodri Davies, Yipeng Hu

机构 * Department of Medical Physics and Biomedical Engineering, University College London, UK(医学物理与生物医学工程系,伦敦大学学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments It is accepted by 28th International Conference on Medical Image Computing and Computer Assisted Intervention (MICCAI) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11969 2025-07-17 cs.CV 83%

GS-Bias: Global-Spatial Bias Learner for Single-Image Test-Time Adaptation of Vision-Language Models

Zhaohong Huang, Yuxin Zhang, Jingjing Xie, Fei Chao, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception(多媒体可信感知关键实验室) Efficient Computing, Ministry of Education of China, Xiamen University(高效计算,中国教育部,厦门大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09209 2025-07-15 cs.CV 83%

Uncertainty-Driven Expert Control: Enhancing the Reliability of Medical Vision-Language Models

Xiao Liang, Di Wang, Zhicheng Jiao, Ronghan Li, Pengfei Yang, Quan Wang, Tat-Seng Chua

机构 * The Key Laboratory of Smart Human-Computer Interaction and Wearable Technology of Shaanxi Province, Xidian University, China(陕西省智能人机交互与可穿戴技术重点实验室,西安电子科技大学) Warren Alpert Medical School, Brown University, USA(布朗大学沃伦·阿尔珀特医学院) National University of Singapore, Singapore(新加坡国立大学)

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏