arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2272 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2272 篇

2410.16411 2025-12-04 cs.RO cs.LG 57%

The Duality of Generative AI and Reinforcement Learning in Robotics: A Review

生成式人工智能与强化学习在机器人中的双重性:综述

Angelo Moroncelli, Vishal Soni, Marco Forgione, Dario Piga, Blerina Spahiu, Loris Roveda

机构 * SUPSI(瑞士苏黎世联邦理工学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 本文综述了生成式人工智能与强化学习在机器人中的双重性,探讨了两者的整合方法、挑战及未来研究方向。

Comments Submitted for publication to Information Fusion

Journal ref Information Fusion Volume 129, May 2026, 104003

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02973 2025-12-03 cs.CV cs.CL cs.CR 57%

Contextual Image Attack: How Visual Context Exposes Multimodal Safety Vulnerabilities

基于上下文的图像攻击:如何通过视觉上下文暴露多模态安全漏洞

Yuan Xiong, Ziqi Miao, Lijun Li, Chen Qian, Jie Li, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学) Renmin University of China(中国人民大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出上下文图像攻击方法,通过多智能体系统和四种可视化策略,有效利用图像的上下文信息对多模态大语言模型进行劫持攻击,实验结果显示攻击效果优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22253 2025-12-01 cs.IR cs.CV 57%

UNION: A Lightweight Target Representation for Efficient Zero-Shot Image-Guided Retrieval with Optional Textual Queries

UNION: 一种轻量级的目标表示用于高效零样本图像引导检索与可选文本查询

Hoang-Bao Le, Allie Tran, Binh T. Nguyen, Liting Zhou, Cathal Gurrin

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 UNION通过融合图像嵌入与空文本提示,实现高效零样本图像引导检索,仅需5,000训练样本即在多个基准测试中超越传统基线。

Comments Accepted at ICDM - MMSR Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12336 2025-11-27 cs.CV 57%

Benchmarking the Trustworthiness in Multimodal LLMs for Video Understanding

对多模态大语言模型在视频理解中的可信度进行基准测试

Youze Wang, Zijun Chen, Ruoyu Chen, Shishen Gu, Wenbo Hu, Jiayang Liu, Yinpeng Dong, Hang Su, Jun Zhu, Meng Wang, Richang Hong

机构 * Hefei University of Technology(合肥工业大学) Tsinghua University(清华大学) Institute of Science Tokyo(东京科学研究所)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 本研究提出Trust-videoLLMs基准,评估23种视频LLMs在真实性、鲁棒性、安全性和隐私等方面的表现,揭示其在动态场景理解及现实风险缓解中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20627 2025-11-26 cs.AI 57%

Fighting AI with AI: Leveraging Foundation Models for Assuring AI-Enabled Safety-Critical Systems

用AI对抗AI:利用基础模型确保AI赋能的安全关键系统

Anastasia Mavridou, Divya Gopinath, Corina S. Păsăreanu

机构 * KBR Inc.(KBR公司) NASA Ames(美国国家航空航天局阿姆斯研究中心)

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.AI

AI总结 本文提出利用AI技术解决安全关键系统中AI保证问题,通过REACT和SemaLens两个组件实现需求工程与感知系统验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19659 2025-11-25 cs.CV 57%

Bias in the Picture: Benchmarking VLMs with Social-Cue News Images and LLM-as-Judge Assessment

图像中的偏见:使用社会线索新闻图像和LLM作为裁判的基准测试

Aravind Narayanan, Vahid Reza Khazaie, Shaina Raza

机构 * Vector Institute for AI(向量人工智能研究院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文通过社会线索新闻图像基准测试,揭示了VLMs在视觉上下文中存在系统性偏见,特别是性别和职业属性,指出高忠实度并不必然降低偏见,提出公平的多模态评估方法。

Comments Accepted to NeurIPS 2025 Workshop (Evaluating the Evolving LLM Lifecycle)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16163 2025-11-21 cs.CV 57%

An Image Is Worth Ten Thousand Words: Verbose-Text Induction Attacks on VLMs

一张图像等于一万字:针对视觉语言模型的冗余文本诱导攻击

Zhi Luo, Zenghui Yuan, Wenqi Wei, Daizong Liu, Pan Zhou

机构 * Huazhong University of Science and Technology(华中科技大学) Fordham University(福特汉姆大学) Wuhan University(武汉大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种针对视觉语言模型的冗余文本诱导攻击,通过两阶段框架生成恶意图像以诱导模型生成冗长文本,提升攻击效果与可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15005 2025-11-20 cs.CL cs.AI 57%

Mathematical Analysis of Hallucination Dynamics in Large Language Models: Uncertainty Quantification, Advanced Decoding, and Principled Mitigation

Moses Kiprono

机构 * Catholic University of America(美国天主教大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

Comments 10 pages, theoretical/mathematical LLM research, no figures, intended for peer-reviewed journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13378 2025-11-19 cs.CV 57%

Governance-Ready Small Language Models for Medical Imaging: Prompting, Abstention, and PACS Integration

Yiting Wang, Ziwei Wang, Di Zhu, Jiachen Zhong, Weiyi Li

机构 * Department of Data Science, University of Southern California(数据科学系,南加州大学) Department of Electrical and Computer Engineering, Carnegie Mellon University(电气与计算机工程系,卡内基梅隆大学) Department of Computer Science and Engineering, Santa Clara University(计算机科学与工程系,圣克拉拉大学) Department of Applied Mathematics, University of Washington(应用数学系,华盛顿大学) School of Computer Science, Georgia Institute of Technology(计算机科学学院,佐治亚理工学院)

专题命中 幻觉与鲁棒性 :LLaVA(abstract);分类 cs.CV

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16597 2025-11-19 cs.CV 57%

EventHallusion: Diagnosing Event Hallucinations in Video LLMs

Jiacheng Zhang, Yang Jiao, Shaoxiang Chen, Na Zhao, Zhiyu Tan, Hao Li, Xingjun Ma, Jingjing Chen

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12982 2025-11-18 cs.CR cs.CV 57%

SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization

Xuankun Rong, Wenke Huang, Tingfeng Wang, Daiguo Zhou, Bo Du, Mang Ye

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12575 2025-11-18 cs.CV 57%

Beyond Pixels: Semantic-aware Typographic Attack for Geo-Privacy Protection

Jiayi Zhu, Yihao Huang, Yue Cao, Xiaojun Jia, Qing Guo, Felix Juefei-Xu, Geguang Pu, Bin Wang

机构 * Hangzhou Institute of Technology, Xidian University, China(杭州科技学院,西安电子科技大学,中国) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Nankai University(南开大学) New York University(纽约大学) East China Normal University(华东师范大学) Hikvision Digital Technology Co., Ltd(海康威视数字技术有限公司) Shanghai Industrial Control Safety Innovation Tech. Co., Ltd(上海工业控制安全创新技术有限公司)

专题命中 幻觉与鲁棒性 :visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15249 2025-11-18 cs.CL cs.CV 57%

Fooling the LVLM Judges: Visual Biases in LVLM-Based Evaluation

Yerin Hwang, Dongryeol Lee, Kyungmin Min, Taegwan Kang, Yong-il Kim, Kyomin Jung

机构 * IPAI, Seoul National University(IPAI,首尔国立大学) Dept. of ECE, Seoul National University(电子工程系,首尔国立大学) LG AI Research(LG人工智能研究)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

Comments EMNLP 2025 Main (21pgs, 12 Tables, 9 Figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11106 2025-11-17 cs.MM cs.CV cs.SD 57%

AccKV: Towards Efficient Audio-Video LLMs Inference via Adaptive-Focusing and Cross-Calibration KV Cache Optimization

Zhonghua Jiang, Kui Chen, Kunxi Li, Keting Yin, Yiyun Zhou, Zhaode Wang, Chengfei Lv, Shengyu Zhang

专题命中 幻觉与鲁棒性 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10974 2025-11-17 cs.CV 57%

Preserving Cross-Modal Consistency for CLIP-based Class-Incremental Learning

Haoran Chen, Houze Xu, Micah Goldblum, Daoguo Dong, Zuxuan Wu

机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究院) Fudan University(复旦大学) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心) Columbia University(哥伦比亚大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10268 2025-11-14 cs.AI 57%

Causal-HalBench: Uncovering LVLMs Object Hallucinations Through Causal Intervention

Zhe Xu, Zhicai Wang, Junkang Wu, Jinda Lu, Xiang Wang

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

Comments accepted for publication in the Association for the Advancement of Artificial Intelligence (AAAI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15721 2025-11-14 cs.CL cs.AI 57%

EcomMMMU: Strategic Utilization of Visuals for Robust Multimodal E-commerce Models

Xinyi Ling, Hanwen Du, Zhihui Zhu, Xia Ning

机构 * Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系) Translational Data Analytics Institute, The Ohio State University(俄亥俄州立大学转化数据分析研究所) Department of Biomedical Informatics, The Ohio State University(俄亥俄州立大学生物医学信息学系)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

Comments ICJNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18638 2025-11-14 cs.CR cs.AI cs.CL 57%

Graph of Attacks with Pruning: Optimizing Stealthy Jailbreak Prompt Generation for Enhanced LLM Content Moderation

Daniel Schwartz, Dmitriy Bespalov, Zhe Wang, Ninad Kulkarni, Yanjun Qi

机构 * Amazon Bedrock Science(亚马逊Bedrock科学) Drexel University(德雷塞尔大学) University of Virginia(弗吉尼亚大学)

专题命中 幻觉与鲁棒性 :VLM(abstract);分类 cs.AI

Comments 14 pages, 5 figures; published in EMNLP 2025 ; Code at: https://github.com/dsbuddy/GAP-LLM-Safety

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09101 2025-11-13 cs.CV 57%

Ultra-Light Test-Time Adaptation for Vision--Language Models

Byunghyun Kim

机构 * Kyungpook National University(庆尚国立大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15503 2025-11-13 cs.CV 57%

Domain Adaptation from Generated Multi-Weather Images for Unsupervised Maritime Object Classification

Dan Song, Shumeng Huo, Wenhui Li, Lanjun Wang, Chao Xue, An-An Liu

机构 * The School of Electrical and Information Engineering, Tianjin University, China(天津大学电气与信息工程学院) Tiandy Technologies Co., Ltd, Tianjin, China(天津天盾科技有限公司)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24047 2025-11-12 cs.LG cs.SY eess.SY math.OC 57%

Optimism as Risk-Seeking in Multi-Agent Reinforcement Learning

Runyu Zhang, Na Li, Asuman Ozdaglar, Jeff Shamma, Gioele Zardini

机构 * Laboratory for Information & Decision Systems, Massachusetts Institute of Technology(信息与决策系统实验室,麻省理工学院) Harvard University(哈佛大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06475 2025-11-11 cs.CV 57%

NOAH: Benchmarking Narrative Prior driven Hallucination and Omission in Video Large Language Models

Kyuho Lee, Euntae Kim, Jinwoo Choi, Buru Chang

机构 * Korea University(韩国大学) Kyung Hee University(庆熙大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV

Comments 18 pages, 9 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21257 2025-11-11 cs.CV cs.CL 57%

Hallucination as an Upper Bound: A New Perspective on Text-to-Image Evaluation

Seyed Amir Kasaei, Mohammad Hossein Rohban

机构 * Department of Computer Engineering, Sharif University of Technology(谢里夫理工大学计算机工程系)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

Comments Accepted at GenProCC NeurIPS 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04247 2025-11-10 cs.MM cs.AI cs.IR 57%

On the Brittleness of CLIP Text Encoders

Allie Tran, Luca Rossetto

机构 * Dublin City University(都柏林城市大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

Comments Accepted for publication at MMM'26. Analysis code can be found here: https://github.com/allie-tran/clip-brittleness

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03900 2025-11-07 cs.CL cs.LG 57%

GRAD: Graph-Retrieved Adaptive Decoding for Hallucination Mitigation

Manh Nguyen, Sunil Gupta, Dai Do, Hung Le

机构 * Applied Artificial Intelligence Initiative(应用人工智能计划) Deakin University(德金大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02243 2025-11-05 cs.AI 57%

When Modalities Conflict: How Unimodal Reasoning Uncertainty Governs Preference Dynamics in MLLMs

Zhuoran Zhang, Tengyue Wang, Xilin Gong, Yang Shi, Haotian Wang, Di Wang, Lijie Hu

机构 * Peking University(北京大学) Provable Responsible AI and Data Analytics (PRADA) Lab(可证明负责任的人工智能和数据分析实验室) King Abdullah University of Science and Technology(卡布斯大学) South China University of Technology(华南理工大学) Tsinghua University(清华大学) University of Georgia(佐治亚大学) MBZUAI(马克斯·普朗克人工智能研究所)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01952 2025-11-05 cs.CR cs.AI 57%

Black-Box Membership Inference Attack for LVLMs via Prior Knowledge-Calibrated Memory Probing

Jinhua Yin, Peiru Yang, Chen Yang, Huili Wang, Zhiyang Hu, Shangguang Wang, Yongfeng Huang, Tao Qi

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院) College of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06534 2025-11-05 cs.RO cs.AI 57%

MetAdv: A Unified and Interactive Adversarial Testing Platform for Autonomous Driving

Aishan Liu, Jiakai Wang, Tianyuan Zhang, Hainan Li, Jiangfan Liu, Siyuan Liang, Yilong Ren, Xianglong Liu, Dacheng Tao

机构 * Beihang University, Beijing, China(北航大学,北京,中国) Zhongguancun Laboratory, Beijing, China(中关村实验室,北京,中国) Institute of Dataspace, Hefei, China(数据空间研究所,合肥,中国) Nanyang Technological University, Singapore, Singapore(南洋理工大学,新加坡,新加坡)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

Comments ACM MM 2025 Most Popular Demo Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01438 2025-11-04 cs.LG 57%

The Curvature Rate λ: A Scalar Measure of Input-Space Sharpness in Neural Networks

Jacob Poschl

机构 * University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00523 2025-11-04 cs.CV 57%

SegDebias: Test-Time Bias Mitigation for ViT-Based CLIP via Segmentation

Fangyu Wu, Yujun Cai

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏