arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2260 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2260 篇

2605.27595 2026-05-28 cs.CV cs.AI 79%

Hallucination Behavior in Multimodal LLMs Across Agricultural Image Interpretation and Generation Tasks

多模态大语言模型在农业图像解释与生成任务中的幻觉行为

Partho Ghose, Al Bashir, Prem Raj, Azlan Zahid

机构 * Texas A&M University System(德克萨斯大学系统)

专题命中 幻觉与鲁棒性 :LLaVA(abstract,abstract_cn);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本研究系统评估了多模态大语言模型在农业图像解释(图像到文本)和生成(文本到图像)任务中的幻觉行为,发现模型存在生物不一致、上下文不准确和农学不合理等错误模式,并通过少样本提示等方法分析了幻觉的残留影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24398 2026-05-26 cs.CV cs.AI cs.GR 79%

VectorArk: Learning Practical Image Vectorization with Rounded Polygon Representation

VectorArk: 学习基于圆角多边形表示的实际图像矢量化

Tarun Gehlaut, Difan Liu, Charu Bansal, Krutik Malani, Souymodip Chakraborty, Ankit Phogat, Matthew Fisher, Vineet Batra

机构 * Adobe

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出VectorArk模型,采用圆角多边形表示和退化模型,实现鲁棒且实用的图像矢量化,在多个数据集上取得优越的几何完整性和伪影抑制效果。

Comments CVPR 2026. Project page: https://vectorark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11107 2026-05-13 cs.CV cs.AI 79%

Birds of a Feather Flock Together: Background-Invariant Representations via Linear Structure in VLMs

同鸟同群:通过VLMs中的线性结构实现背景不变表示

Youssef Zaazou, Mark Thomas

机构 * Independent Researcher(独立研究者)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文通过VLMs嵌入空间的高线性可加性,提出一种利用合成数据构建背景不变表示的方法,实现了Waterbirds数据集上90%以上的最差组准确率,并展示了良好的仿真到现实迁移能力。

Comments 36 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13236 2026-04-16 cs.CV cs.AI eess.IV 79%

SemiFA: An Agentic Multi-Modal Framework for Autonomous Semiconductor Failure Analysis Report Generation

SemiFA:一种用于自主半导体故障分析报告生成的代理多模态框架

Shivam Chand Kaushik

机构 * School of Artificial Intelligence and Data Engineering (SAIDE)(人工智能与数据工程学院) Indian Institute of Technology Jodhpur(印度理工学院贾尔普尔)

专题命中 幻觉与鲁棒性 :LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 SemiFA通过多代理语言图框架实现自主生成半导体故障分析报告,利用多模态数据融合提升根因分析精度,首次整合SECS/GEM设备 telemetry 进行自动化报告生成。

Comments 11 pages, 6 figures, 8 tables. Dataset available at https://huggingface.co/datasets/ShivamChand/SemiFA-930. Code available at https://github.com/Shivamckaushik/SemiFA

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04897 2026-01-09 cs.CL cs.CV cs.LG cs.MM 79%

V-FAT: Benchmarking Visual Fidelity Against Text-bias

V-FAT:基于文本偏见的视觉真实性基准测试

Ziteng Wang, Yujie He, Guanliang Li, Siqi Yang, Jiaqi Xiong, Songxiang Liu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Meituan(美团) University of Oxford(牛津大学)

专题命中 幻觉与鲁棒性 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 V-FAT通过三级评估框架量化文本偏见对视觉真实性的干扰,揭示多模态大语言模型在高语言主导性下的视觉崩溃问题。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00817 2025-07-02 cs.CV cs.AI 79%

CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs

Jiaming Zhang, Rui Hu, Qing Guo, Wei Yang Bryan Lim

机构 * Nanyang Technological University(南洋理工大学) Beijing Jiaotong University(北京交通大学) A*STAR Project Page(A*STAR项目页面)

专题命中 幻觉与鲁棒性 :LLaVA(abstract);InternVL(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06169 2025-03-18 cs.CV cs.AI 79%

Treble Counterfactual VLMs: A Causal Approach to Hallucination

Shawn Li, Jiashu Qu, Yuxiao Zhou, Yuehan Qin, Tiankai Yang, Yue Zhao

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08567 2024-06-04 cs.CL cs.CR cs.CV cs.LG cs.MA 79%

Agent Smith: A Single Image Can Jailbreak One Million Multimodal LLM Agents Exponentially Fast

Xiangming Gu, Xiaosen Zheng, Tianyu Pang, Chao Du, Qian Liu, Ye Wang, Jing Jiang, Min Lin

专题命中 幻觉与鲁棒性 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22038 2026-08-11 cs.CL 版本更新 78%

Source-Modality Monitoring in Vision-Language Models

视觉-语言模型中的源模态监控

Etha Tianze Hua, Tian Yun, Ellie Pavlick

机构 * Department of Computer Science, Brown University(布朗大学计算机科学系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 研究探讨了多模态模型追踪并沟通信息来源的能力,分析了语法与语义信号在绑定提示词与输入组件中的作用,发现语义信号在模态分布差异大时更占主导。

Comments Accepted at COLM 2026. All resources will be available at https://github.com/ethahtz/source-modality-monitoring

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26566 2026-06-26 cs.CR cs.CL 新提交 78%

Adversarial Diffusion Across Modalities: A Fusion Survey of Attacks, Defenses, and Evaluation for Text, Vision, and Vision-Language Models

跨模态对抗扩散:文本、视觉与视觉-语言模型的攻击、防御与评估融合综述

Abrar Alotaibi, Moataz Ahmed

机构 * Information and Computer Science Department, King Fahd University of Petroleum & Minerals(国王法赫德石油矿物大学信息与计算机科学系) College of Computer Science and Information Technology, Imam Abdulrahman Bin Faisal University(伊玛目阿卜杜勒拉赫曼·本·法伊塞尔大学计算机科学与信息科技学院) SDAIA-KFUPM Joint Research Center for Artificial Intelligence, King Fahd University of Petroleum & Minerals(SDAIA-KFUPM人工智能联合研究中心,国王法赫德石油矿物大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 本文整合了文本、图像分类器和视觉-语言模型上的对抗攻击与防御研究,提出统一分类法和评估框架,并识别了当前文献中的五个常见弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05874 2026-06-05 cs.CL 78%

Evaluating Stochastic Collapse and Implicit Bias in Multimodal Large Language Models

评估多模态大语言模型中的随机坍缩与隐式偏差

Huiyuan Zheng, Houtao Zhang, Boyang Wang, Qingyi Si, Hongcheng Guo

机构 * Fudan University(复旦大学) Beihang University(北航) JD.com(京东)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract)

AI总结 提出RandomBench基准测试,通过熵和分布偏差指标揭示多模态大语言模型在逻辑中性场景下存在随机坍缩现象,即无法维持均匀随机性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18442 2026-05-19 cs.RO 78%

SG-CADVLM: A Context-Aware Decoding Powered Vision Language Model for Safety-Critical Scenario Generation

SG-CADVLM: 一种基于上下文感知解码的视觉语言模型,用于安全关键场景生成

Hongyi Zhao, Shuo Wang, Qijie He, Ziyuan Pu

机构 * School of Transportation, Southeast University(东南大学交通学院)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract)

AI总结 本文提出SG-CADVLM,一种结合上下文感知解码的多模态输入处理框架,用于从事故报告中生成高保真的安全关键场景,通过减少视觉语言模型的幻觉并同时生成道路几何和车辆轨迹,提升了生成场景的准确性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01333 2026-05-11 cs.CL 78%

OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice

OralMLLM-Bench: 评估多模态大语言模型在牙科实践中的认知能力

Rongyang Wang, Shuang Zhou, Jiashuo Wang, Wenya Xie, Xiaoxia Che

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract)

AI总结 本文提出OralMLLM-Bench,通过27个临床任务评估多模态大语言模型在牙科影像分析中的认知能力,揭示模型与牙科医生的性能差异及改进方向。

Comments 21 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13302 2026-04-29 cs.CL 78%

Images Amplify Misinformation Sharing in Vision-Language Models

图像在视觉-语言模型中放大虚假信息的传播

Alice Plebe, Timothy Douglas, Diana Riazi, R. Maria del Rio-Chanona

机构 * Department of Industrial Engineering, University of Trento(特伦托大学工业工程系) Computer Science Department, University College London(伦敦大学学院计算机科学系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 研究探讨了图像如何影响视觉-语言模型分享新闻内容的倾向,发现图像能提高虚假新闻的分享率,且不同模型对图像的反应存在差异。

Comments Accepted for oral presentation at ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18942 2026-04-22 cs.CL 78%

Disparities In Negation Understanding Across Languages In Vision-Language Models

多语言中否定理解差异在视觉-语言模型中的表现

Charikleia Moraitaki, Sarah Pan, Skyler Pulling, Gwendolyn Flusche, Kumail Alhamoud, Marzyeh Ghassemi

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 研究探讨了视觉-语言模型在不同语言中对否定理解的差异,通过多语言基准测试发现,CLIP在非拉丁文字语言表现不佳,而MultiCLIP在多语言中表现更优,SpaceVLM在部分语言中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05437 2026-04-22 cs.CL 78%

Once Correct, Still Wrong: Counterfactual Hallucination in Multilingual Vision-Language Models

一旦正确,仍错误:多语言视觉-语言模型中的反事实幻觉

Basel Mousi, Fahim Dalvi, Shammur Chowdhury, Firoj Alam, Nadir Durrani

机构 * Qatar Computing Research Institute, HBKU(卡塔尔计算研究所,哈姆丹·本·哈马德大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 研究探讨多语言视觉-语言模型在文化背景下反事实幻觉的问题,提出M²CQA基准测试,通过17个中东国家图像和多语言对比陈述评估模型性能,发现阿拉伯语尤其在方言中反事实幻觉率显著上升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21950 2026-04-20 cs.CL 78%

MEDSYN: Benchmarking Multi-EviDence SYNthesis in Complex Clinical Cases for Multimodal Large Language Models

MEDSYN:多证据合成在复杂临床病例中的基准测试用于多模态大语言模型

Boqi Chen, Xudong Liu, Jiachuan Peng, Marianne Frey-Marti, Bang Zheng, Kyle Lam, Lin Li, Jianing Qiu

机构 * ETH Zurich(苏黎世联邦理工学院) MBZUAI(马克斯·普朗克人工智能研究所) Amazon(亚马逊) University of Oxford(牛津大学) University of Bern(伯尔尼大学) Imperial College London(伦敦帝国理工学院) Peking University(北京大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract)

AI总结 MEDSYN是一个多语言、多模态的复杂临床病例基准测试,用于评估多模态大语言模型在差分诊断和最终诊断中的表现,揭示模型在异质临床证据合成中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09017 2026-04-13 cs.NI 78%

Multimodal Large Language Model Enabled Robust Beamforming for HAP Downlink Communications

多模态大语言模型赋能的HAP下行链路鲁棒波束成形

Xiaoyu Xing, Peng Yang, Guoquan Tao, Dingyi Lu, Zehui Xiong, Xianbin Cao

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract)

AI总结 本文提出基于多模态大语言模型的波束成形框架,通过飞行 telemetry 预测HAP姿态并实现鲁棒下行通信,提升用户服务比和总速率22.1%和12.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27091 2026-03-31 math.OC 78%

Meta-Contrastive Learning for Vision-Language Models via Task-Adaptive CLIP Training

通过任务自适应CLIP训练实现视觉语言模型的元对比学习

Merham Fouladvand, Peuroly Batra

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 本文提出一种域条件元对比学习框架,通过任务自适应CLIP训练提升视觉语言模型跨域泛化能力,引入域嵌入和交叉域对齐正则化,增强模型在域偏移下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20839 2026-03-24 cs.CV cs.AI cs.HC cs.LG 78%

Dodgersort: Uncertainty-Aware VLM-Guided Human-in-the-Loop Pairwise Ranking

Dodgersort: 一种考虑不确定性的视觉语言模型引导的人机协作成对排序

Yujin Park, Haejun Chung, Ikbeom Jang

机构 * Hanyang University(翰阳大学) Hankuk University of Foreign Studies(韩国民法大学)

专题命中 幻觉与鲁棒性 :VLM(title);分类 cs.CV、cs.AI、cs.LG

AI总结 Dodgersort通过CLIP基于的分层预排序、神经排名头和概率集成方法,减少人工比较并提升排序可靠性,在医学影像、历史 dating 和美学任务中实现11-16%的标注减少。

Comments 12 pages, 2 figures, Pacific-Asia Conference on Knowledge Discovery and Data Mining(PAKDD2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10846 2026-03-20 cs.CL 78%

DUAL-Bench: Measuring Over-Refusal and Robustness in Vision-Language Models

DUAL-Bench: 测量视觉语言模型中的过度拒绝与鲁棒性

Kaixuan Ren, Preslav Nakov, Usman Naseem

机构 * Macquarie University(麦考瑞大学) MBZUAI(马克斯·普朗克智能系统研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 本文提出DUAL-Bench,通过评估18种VLM在12类危险场景下的表现,揭示模型在双重使用场景中的脆弱安全边界,强调安全完成与过度拒绝的平衡需求。

Comments 26pages, 13 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15513 2026-03-17 cs.CL 78%

ViX-Ray: A Vietnamese Chest X-Ray Dataset for Vision-Language Models

ViX-Ray: 一个用于视觉-语言模型的越南胸部X光数据集

Duy Vu Minh Nguyen, Chinh Thanh Truong, Phuc Hoang Tran, Hung Tuan Le, Nguyen Van-Thanh Dat, Trung Hieu Pham, Kiet Van Nguyen

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 本文提出ViX-Ray数据集,包含5400张越南胸部X光图像,用于评估和推动视觉-语言模型在越南临床领域的应用,发现现有模型在印象生成上存在低精度和过度幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10061 2026-03-13 cs.RO 78%

Decision-Aware Uncertainty Evaluation of Vision-Language Model-Based Early Action Anticipation for Human-Robot Interaction

基于视觉语言模型的早期动作预测在人机交互中的决策感知不确定性评估

Zhaoda Du, Michael Bowman, Qiaojie Zheng, Xiaoli Zhang

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 本文提出了一种系统评估基于视觉语言模型的短期动作识别在人机交互中的不确定性方法,通过引入时间前缀评估协议和校准度量标准,揭示了部分观测下的误校准模式和失败模式,为信心门控的人机交互模块提供了可靠性证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02147 2026-01-06 cs.CV cs.AI cs.LG 78%

BiPrompt: Bilateral Prompt Optimization for Visual and Textual Debiasing in Vision-Language Models

BiPrompt:面向视觉与文本去偏的双重视觉语言模型双向提示优化

Sunny Gupta, Shounak Das, Amit Sethi

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG

AI总结 BiPrompt通过双重视觉语言模型双向提示优化,同时减轻视觉和文本中的非因果特征依赖,提升模型在分布偏移下的鲁棒性和因果推理能力。

Comments Accepted at the AAAI 2026 Workshop AIR-FM, Assessing and Improving Reliability of Foundation Models in the Real World

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24513 2026-01-05 cs.CY 78%

From Static to Dynamic: Evaluating the Perceptual Impact of Dynamic Elements in Urban Scenes via MLLM-Guided Generative Inpainting

从静态到动态:通过MLLM引导的生成修复技术评估城市场景中动态元素的感知影响

Zhiwei Wei, Mengzi Zhang, Boyan Lu, Zhitao Deng, Nai Yang, Hua Liao

专题命中 幻觉与鲁棒性 :MLLM(title,abstract)

AI总结 通过MLLM引导的生成修复技术,研究评估了动态元素在城市场景中的感知影响,发现移除动态元素导致活力显著下降,揭示了光照、人类存在和深度变化对感知变化的关键作用。

Comments 31 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16110 2025-11-21 cs.CR 78%

Multi-Faceted Attack: Exposing Cross-Model Vulnerabilities in Defense-Equipped Vision-Language Models

多面攻击:揭示配备防御机制的视觉语言模型中的跨模型漏洞

Yijun Yang, Lichao Wang, Jianping Zhang, Chi Harold Liu, Lanqing Hong, Qiang Xu

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 多面攻击揭示了配备防御机制的视觉语言模型中的跨模型安全漏洞,通过注意力转移攻击和轻量级转移增强算法,实现了58.5%的成功率。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03367 2025-11-06 cs.CV cs.AI cs.LG 78%

Decoupling Augmentation Bias in Prompt Learning for Vision-Language Models

Gahyeon Kim, Sohee Kim, Seokju Lee

机构 * Korea Institute of Energy Technology (KENTECH)(韩国能源技术研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG

Comments Accepted in Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20856 2025-10-27 cs.CR 78%

FPT-Noise: Dynamic Scene-Aware Counterattack for Test-Time Adversarial Defense in Vision-Language Models

Jia Deng, Jin Li, Zhenhua Zhao, Shaowei Wang

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

Comments 11pages,4figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21400 2025-09-29 cs.CR 78%

SafeSteer: Adaptive Subspace Steering for Efficient Jailbreak Defense in Vision-Language Models

Xiyu Zeng, Siyuan Liang, Liming Lu, Haotian Zhu, Enguang Liu, Jisheng Dang, Yongbin Zhou, Shuchao Pang

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18053 2025-09-29 cs.CR cs.CL 78%

Resource Consumption Red-Teaming for Large Vision-Language Models

Haoran Gao, Yuanhe Zhang, Zhenhong Zhou, Lei Jiang, Fanyu Meng, Yujia Xiao, Li Sun, Kun Wang, Yang Liu, Junlan Feng

机构 * China Mobile Research Institute(中国移动研究院) Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) North China Electric Power University(华北电力大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏