arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2257 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2257 篇

2604.18867 2026-04-22 cs.CV cs.AI cs.LG 82%

Hierarchically Robust Zero-shot Vision-language Models

层次化鲁棒零样本视觉-语言模型

Junhao Dong, Yifei Zhang, Hao Zhu, Yew-Soon Ong, Piotr Koniusz

机构 * Nanyang Technological University(南洋理工大学) CFAR, IHPC, A*STAR(CFAR、IHPC、A*STAR) Northwest Polytechnical University(西北工业大学) Data61 CSIRO University of New South Wales(新南威尔士大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出基于层次嵌入的鲁棒微调框架,提升视觉-语言模型对对抗攻击的鲁棒性,通过多级对抗对齐和层次嵌入深度控制,增强模型泛化能力与语义多样性。

Comments This paper is accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18123 2026-04-03 cs.CV cs.AI cs.CL cs.LG 82%

Bias Is a Subspace, Not a Coordinate: A Geometric Rethinking of Post-hoc Debiasing in Vision-Language Models

偏差是子空间,而非坐标:视觉-语言模型中事后去偏的几何重思

Dachuan Zhao, Weiyue Li, Zhenda Shen, Yushu Qiu, Bowen Xu, Haoyu Chen, Yongchao Chen

机构 * Harvard University(哈佛大学) MIT(麻省理工学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出SPD框架,通过几何方法识别并去除线性可解码的偏子空间,提升视觉-语言模型的公平性与任务性能。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29410 2026-04-01 cs.CV cs.AI cs.LG 82%

AGFT: Alignment-Guided Fine-Tuning for Zero-Shot Adversarial Robustness of Vision-Language Models

AGFT:基于对齐的微调以提升视觉-语言模型的零样本对抗鲁棒性

Yubo Cui, Xianchao Guan, Zijun Xiong, Zheng Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute, Shenzhen, China(深圳市环域研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出AGFT框架,通过概率预测进行文本引导对抗训练,提升视觉-语言模型的零样本对抗鲁棒性,同时保持跨模态语义结构。

Comments Accepted by CVPR 2026; Code is available at \url{https://github.com/YuboCui/AGFT}

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10655 2026-03-31 cs.SE cs.RO 82%

Assessing Vision-Language Models for Perception in Autonomous Underwater Robotic Software

评估用于自主水下机器人软件中的视觉-语言模型感知能力

Muhammad Yousaf, Aitor Arrieta, Shaukat Ali, Paolo Arcaini, Shuai Wang

机构 * Simula Research Laboratory(Simula研究实验室) Oslo Metropolitan University(奥斯陆城市大学) Mondragon University(蒙德拉贡大学) National Institute of Informatics(国立信息学研究所) Det norske Veritas (DNV)(挪威船级社(DNV))

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract)

AI总结 本文评估了视觉-语言模型在自主水下机器人软件中的感知性能,通过计算性能和不确定性来指导软件工程师选择合适的模型。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20827 2026-03-24 cs.RO 82%

Swim2Real: VLM-Guided System Identification for Sim-to-Real Transfer

Swim2Real: 基于视觉-语言模型的系统辨识用于仿真到现实迁移

Kevin Qiu, Kyle Walker, Mike Y. Michelis, Marek Cygan, Josie Hughes

机构 * University of Warsaw(华沙大学) IDEAS NCBR EPFL(瑞士联邦理工学院) ETH Zurich(苏黎世联邦理工学院) Nomagic

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract)

AI总结 本文提出Swim2Real系统,利用视觉-语言模型反馈校准水下仿真实验室,无需手动设计搜索阶段。通过同时校准16个参数,显著提升仿真到现实的迁移效果,实现零样本强化学习迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19092 2026-03-20 cs.CV cs.AI cs.CL cs.LG 82%

SAVeS: Steering Safety Judgments in Vision-Language Models via Semantic Cues

SAVeS: 通过语义线索引导视觉-语言模型中的安全判断

Carlos Hinojosa, Clemens Grange, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学科学与技术学院) Technical University of Munich(慕尼黑技术大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究通过语义线索引导视觉-语言模型的安全判断,提出SAVeS基准和评估协议,验证安全决策对语义线索的敏感性,揭示模型对视觉-语言关联的依赖及潜在安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19028 2026-03-20 cs.CV cs.AI cs.LG 82%

SEM: Sparse Embedding Modulation for Post-Hoc Debiasing of Vision-Language Models

SEM:用于视觉-语言模型后验去偏的稀疏嵌入调制

Quentin Guimard, Federico Bartsch, Simone Caldarella, Rahaf Aljundi, Elisa Ricci, Massimiliano Mancini

机构 * University of Trento(特伦托大学) Toyota Motor Europe(丰田欧洲公司) Fondazione Bruno Kessler(布鲁诺·凯瑟尔基金会)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出SEM框架,通过稀疏自编码器空间调制嵌入,实现视觉-语言模型的后验去偏,提升检索和零样本分类的公平性。

Comments CVPR Findings 2026. Project website: https://sparse-embedding-modulation.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21441 2026-02-26 cs.LG cs.AI cs.CV 82%

Causal Decoding for Hallucination-Resistant Multimodal Large Language Models

因果解码用于抗幻觉的多模态大语言模型

Shiwei Tan, Hengyi Wang, Weiyi Qin, Qi Xu, Zhigang Hua, Hao Wang

机构 * Rutgers University(新泽西罗格斯大学) Meta Ranking AI(Meta 排名人工智能)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出因果解码框架,通过针对性干预减少多模态大语言模型中的物体幻觉,提升响应的准确性和忠实度。

Comments Published in Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07984 2026-02-26 cs.CL 82%

Cross-Cultural Expert-Level Art Critique Evaluation with Vision-Language Models

跨文化专家级艺术批评评估与视觉-语言模型

Haorui Yu, Xuehang Wen, Fengrui Zhang, Qiufeng Yi

机构 * DJCAD, University of Dundee, United Kingdom(邓迪大学DJCAD研究中心,英国) Hebei Academy of Fine Art, China(河北美术院,中国) Computer Science, Nanjing University, China(南京大学计算机科学系,中国) Department of Mechanical Engineering, School of Engineering, University of Birmingham(伯明翰大学工程学院机械工程系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract)

AI总结 本文提出了一种跨文化评估框架,用于评估视觉-语言模型在艺术批评中的文化理解能力,揭示了自动化指标与专家评分的差异及文化敏感性问题。

Comments 16 pages, 7 figures, submitted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01025 2026-02-03 cs.LG cs.AI cs.CV 82%

Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models

迈向通用且可迁移的视觉-语言模型劫持攻击

Kaiyuan Cui, Yige Li, Yutao Wu, Xingjun Ma, Sarah Erfani, Christopher Leckie, Hanxun Huang

机构 * School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系) School of Computing and Information Systems, Singapore Management University, Singapore(新加坡管理大学计算机与信息系) School of Information Technology, Deakin University, Australia(德肯大学信息科技系) Institute of Trustworthy Embodied AI, Fudan University, China(复旦大学可信具身人工智能研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出UltraBreak,一种通用且可迁移的视觉-语言模型劫持攻击框架,通过视觉正则化和语义引导的文本监督,有效提升攻击的泛化能力和转移性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17082 2026-01-27 cs.CY cs.AI cs.CL cs.CV cs.LG 82%

Do VLMs Have a Moral Backbone? A Study on the Fragile Morality of Vision-Language Models

视觉-语言模型是否具有道德基础?对视觉语言模型脆弱道德的研究

Zhining Liu, Tianyi Wang, Xiao Lin, Penghao Ouyang, Gaotang Li, Ze Yang, Hui Liu, Sumit Keswani, Vishwa Pardeshi, Huijun Zhao, Wei Fan, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊) Fidelity Investments(富达投资)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究发现视觉语言模型在面对文本和视觉扰动时道德判断易变,需通过轻量干预提升道德鲁棒性以确保负责任的部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06474 2025-12-30 cs.CV cs.AI cs.LG 82%

Enhancing Vision-Language Model Reliability with Uncertainty-Guided Dropout Decoding

通过不确定性引导的丢弃解码增强视觉-语言模型的可靠性

Yixiong Fang, Ziran Yang, Zhaorun Chen, Zhuokai Zhao, Jiawei Zhou

机构 * Carnegie Mellon University(卡内基梅隆大学) Princeton University(普林斯顿大学) University of Chicago(芝加哥大学) Stony Brook University(石溪大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 通过不确定性引导的丢弃解码方法,有效减少视觉-语言模型的幻觉问题,提升输出的可靠性和质量。

Comments Accepted to 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08233 2025-12-10 cs.RO 82%

Semantic-Metric Bayesian Risk Fields: Learning Robot Safety from Human Videos with a VLM Prior

语义-度量贝叶斯风险场:从人类视频中学习机器人安全性的方法

Timothy Chen, Marcus Dominguez-Kuhne, Aiden Swann, Xu Liu, Mac Schwager

机构 * Stanford University(斯坦福大学) California Institute of Technology(加州理工学院)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract)

AI总结 本文提出基于贝叶斯框架的语义-度量风险场,通过人类视频学习机器人安全风险模型,实现类人风险评估与规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16402 2025-12-08 cs.AI cs.CL cs.CV cs.LG cs.RO 82%

IS-Bench: Evaluating Interactive Safety of VLM-Driven Embodied Agents in Daily Household Tasks

IS-Bench:评估由视觉语言模型驱动的具身智能体在日常家务任务中的交互安全性

Xiaoya Lu, Zeren Chen, Xuhao Hu, Yijin Zhou, Weichen Zhang, Dongrui Liu, Lu Sheng, Jing Shao

机构 * Xiaoya Lu 1, 2(某大学) Zeren Chen 2, 3(某大学) Xuhao Hu 2, 4(某大学) Yijin Zhou 2(某大学) Weichen Zhang 2(某大学) Dongrui Liu 2(某大学) Lu Sheng 3(某研究所) Jing Shao 2(某研究所)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 IS-Bench通过多模态基准评估视觉语言模型驱动的具身智能体在日常家务任务中的交互安全性,揭示现有智能体缺乏安全意识的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20494 2025-12-02 cs.CL 82%

Adversarial Confusion Attack: Disrupting Multimodal Large Language Models

对抗混淆攻击:破坏多模态大语言模型

Jakub Hoscilowicz, Artur Janicki

机构 * Warsaw University of Technology(华沙技术大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract)

AI总结 本文提出对抗混淆攻击,通过生成扰动破坏多模态大语言模型的可靠性,展示其在不同模型上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11690 2025-11-18 cs.LG cs.AI cs.CV 82%

Doubly Debiased Test-Time Prompt Tuning for Vision-Language Models

Fei Song, Yi Li, Rui Wang, Jiahuan Zhou, Changwen Zheng, Jiangmeng Li

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19017 2025-10-09 cs.CL 82%

Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models

Bin Zhu, Yinxuan Gui, Huiyan Qi, Jingjing Chen, Chong-Wah Ngo, Ee-Peng Lim

机构 * Singapore Management University(新加坡管理大学) Fudan University(复旦大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);LLaVA(abstract)

Comments Project website: https://yxg1005.github.io/GaslightingNegationAttacks/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21059 2025-09-23 cs.CV cs.AI cs.CR cs.LG 82%

FC-Attack: Jailbreaking Multimodal Large Language Models via Auto-Generated Flowcharts

Ziyi Zhang, Zhen Sun, Zongmin Zhang, Jihui Guo, Xinlei He

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14435 2025-09-16 cs.CV cs.AI cs.CY cs.LG 82%

Social Perception of Faces in a Vision-Language Model

Carina I. Hausladen, Manuel Knott, Colin F. Camerer, Pietro Perona

机构 * California Institute of Technology(加州理工学院) ETH Zurich(苏黎世联邦理工学院) Computational Social Science(计算社会科学) Swiss Data Science Center(瑞士数据科学中心) Empa(瑞士联邦材料科学与技术研究院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Journal ref Published in the Proceedings of the 2025 ACM Conference on Fairness, Accountability, and Transparency (FAccT 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20227 2025-08-29 cs.CV cs.AI cs.CL cs.LG 82%

A Novel Framework for Automated Explain Vision Model Using Vision-Language Models

Phu-Vinh Nguyen, Tan-Hanh Pham, Chris Ngo, Truong Son Hy

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13761 2025-07-21 cs.CL 82%

Innocence in the Crossfire: Roles of Skip Connections in Jailbreaking Visual Language Models

Palash Nandi, Maithili Joshi, Tanmoy Chakraborty

机构 * Department of Electrical Engineering(电气工程系) Indian Institute of Technology Delhi(印度理工学院德里)

专题命中 幻觉与鲁棒性 :visual language model(title,abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23114 2025-07-18 cs.CV cs.AI cs.CL cs.LG 82%

Unified Triplet-Level Hallucination Evaluation for Large Vision-Language Models

Junjie Wu, Tsz Ting Chung, Kai Chen, Dit-Yan Yeung

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by TMLR 2025. Project Page: https://kaichen1998.github.io/projects/tri-he/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03628 2025-07-02 cs.CV cs.AI cs.LG 82%

The Hidden Life of Tokens: Reducing Hallucination of Large Vision-Language Models via Visual Information Steering

Zhuowei Li, Haizhou Shi, Yunhe Gao, Di Liu, Zhenting Wang, Yuxiao Chen, Ting Liu, Long Zhao, Hao Wang, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23224 2025-06-30 cs.CL 82%

MMBoundary: Advancing MLLM Knowledge Boundary Awareness through Reasoning Step Confidence Calibration

Zhitao He, Sandeep Polisetty, Zhiyuan Fan, Yuchen Huang, Shujin Wu, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学) UMass Amherst(马萨诸塞大学阿姆赫斯特分校) University of Southern California(南加州大学)

专题命中 幻觉与鲁棒性 :MLLM(title,abstract);multimodal large language model(abstract)

Comments 18 pages, ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08680 2025-06-13 cs.LG cs.AI cs.CL cs.CV 82%

Mitigating Object Hallucination in Large Vision-Language Models via Image-Grounded Guidance

Linxi Zhao, Yihe Deng, Weitong Zhang, Quanquan Gu

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments 25 pages, 13 figures, 25 tables

Journal ref In Proceedings of the 42nd International Conference on Machine Learning, Vancouver, Canada. PMLR 267, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05113 2025-06-09 cs.CV cs.AI cs.LG 82%

LlavaGuard: An Open VLM-based Framework for Safeguarding Vision Datasets and Models

Lukas Helff, Felix Friedrich, Manuel Brack, Kristian Kersting, Patrick Schramowski

专题命中 幻觉与鲁棒性 :VLM(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments In Proceedings of the 42st International Conference on Machine Learning (ICML 2025), Project page at https://ml-research.github.io/human-centered-genai/projects/llavaguard/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03189 2025-06-05 cs.CV cs.AI cs.LG 82%

Continual Learning in Vision-Language Models via Aligned Model Merging

Ghada Sokar, Gintare Karolina Dziugaite, Anurag Arnab, Ahmet Iscen, Pablo Samuel Castro, Cordelia Schmid

机构 * Google DeepMind(谷歌DeepMind)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12562 2025-06-04 cs.CL cs.CR cs.MM 82%

SEA: Low-Resource Safety Alignment for Multimodal Large Language Models via Synthetic Embeddings

Weikai Lu, Hao Peng, Huiping Zhuang, Cen Chen, Ziqian Zeng

机构 * South China University of Technology, China(华南理工大学) Beihang University, China(北航) Pazhou Laboratory, China(琶洲实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract)

Comments Accepted in ACL 2025 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20569 2025-05-30 cs.CV cs.AI cs.LG 82%

Retrieval Visual Contrastive Decoding to Mitigate Object Hallucinations in Large Vision-Language Models

Jihoon Lee, Min Song

机构 * Yonsei University(延世大学) Onoma AI

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments ACL 2025 Findings camera-ready version. Code is released at https://github.com/JiHoonLee9898/RVCD

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08755 2025-04-09 cs.CV cs.AI cs.CR cs.LG 82%

Proactive Adversarial Defense: Harnessing Prompt Tuning in Vision-Language Models to Detect Unseen Backdoored Images

Kyle Stein, Andrew Arash Mahyari, Guillermo Francia, Eman El-Sheikh

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏