arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2260 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2260 篇

2602.04672 2026-06-02 cs.CV cs.GR cs.RO 77%

AGILE: Hand-Object Interaction Reconstruction from Video via Agentic Generation

AGILE: 通过代理生成从视频重建手-物体交互

Jin-Chuan Shi, Binhong Ye, Tao Liu, Junzhe He, Yangjinhui Xu, Xiaoyang Liu, Zeju Li, Hao Chen, Chunhua Shen

机构 * State Key Lab of CAD & CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Zhejiang University of Technology(浙江工业大学)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出AGILE框架,利用视觉语言模型引导生成完整物体网格,结合锚定-跟踪策略和接触感知优化,从单目视频鲁棒重建手-物体交互,生成可直接用于仿真的资产。

Comments 16 pages, SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08617 2026-05-28 cs.CV 77%

SoC: Semantic Orthogonal Calibration for Test-Time Prompt Tuning

SoC: 测试时提示调优的语义正交校准

Leo Fillioux, Omprakash Chakraborty, Ismail Ben Ayed, Paul-Henry Cournède, Stergios Christodoulidis, Maria Vakalopoulou, Jose Dolz

机构 * MICS, CentraleSupélec, Université Paris-Saclay(MICS,CentraleSupélec,巴黎萨克雷大学) LIVIA, ILLS, ÉTS Montréal(LIVIA,ILLs,蒙特利尔ÉTS)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 针对视觉语言模型测试时提示调优中校准被忽视的问题,提出基于Huber的正则化方法SoC,在保持语义邻近性的同时实现平滑的原型分离,从而改善校准性能并保持判别能力。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12506 2026-05-22 cs.LG 77%

On Robustness and Chain-of-Thought Consistency of RL-Finetuned VLMs

关于RL微调VLMs的鲁棒性和链式思维一致性

Rosie Zhao, Anshul Shah, Xiaoyu Zhu, Xinke Deng, Zhongyu Jiang, Yang Yang, Joerg Liebelt, Arnab Mondal

机构 * Apple(苹果公司) OpenAI

专题命中 幻觉与鲁棒性 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.LG

AI总结 本文研究了RL微调VLMs在视觉推理任务中的鲁棒性和链式思维一致性,发现文本扰动和CoT不一致会显著降低模型的鲁棒性和信心,而闭源模型在保持鲁棒性和推理一致性方面表现更佳,指出这一差距源于当前开源RL微调的不足而非任务本身的限制。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21662 2026-05-21 cs.LG 77%

Epistemic Uncertainty Quantification for Pre-trained VLMs via Riemannian Flow Matching

通过黎曼流匹配对预训练视觉语言模型进行知识不确定性量化

Li Ju, Mayank Nautiyal, Andreas Hellander, Ekta Vats, Prashant Singh

机构 * Department of Information Technology, Uppsala University, Uppsala, Sweden(瑞典乌普萨拉大学信息科技系) Science for Life Laboratory, Uppsala University, Uppsala, Sweden(瑞典乌普萨拉大学生命科学实验室)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.LG

AI总结 本文提出REPVLM方法,通过黎曼流匹配在视觉语言模型嵌入的超球面流形上计算概率密度,以量化模型的知识不确定性,并在分类和异常检测中取得显著效果。

Journal ref Forty-Third International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17658 2026-05-19 cs.LG 77%

When a Zero-Shooter Cheats: Improving Age Estimation via Activation Steering

当零样本射手作弊时:通过激活引导提升年龄估计

Erik Imgrund, Pia Hanfeld, Klim Kireev, Konrad Rieck

机构 * BIFOLD & TU Berlin(BIFOLD与柏林技术大学)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.LG

AI总结 本文研究了基于视觉语言模型的零样本年龄估计中出现的'身份捷径'现象,提出激活引导方法以提高年龄估计的准确性,减少均方误差达25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16999 2026-05-19 cs.LG 77%

Ranking-Aware Calibration for Reliable Multimodal Reinforcement Learning

基于排名的校准:可靠多模态强化学习

Peng Cui, Boyao Yang, Jun Zhu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, BNRist Center, Tsinghua-Bosch Joint ML Center, THBI Lab, Tsinghua University, Beijing(计算机科学与技术系,人工智能研究院,BNRist中心,清华大学-博世联合机器学习中心,THBI实验室,清华大学,北京) Dept. of Automation, Tsinghua University, Beijing(自动化系,清华大学,北京)

专题命中 幻觉与鲁棒性 :InternVL(abstract,abstract_cn);vision-language model(abstract);分类 cs.LG

AI总结 本文提出Ranking-Aware Calibration方法,通过利用组内强化学习自然产生的比较信号,提升多模态强化学习的校准能力,从而提高任务准确性和校准效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22474 2026-05-14 cs.RO cs.LG 77%

When to Act, Ask, or Learn: Uncertainty-Aware Policy Steering

何时行动、提问或学习:不确定性感知的策略引导

Jessie Yuan, Yilin Wu, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.LG

AI总结 本文提出不确定性感知策略引导框架,通过联合推理任务语义不确定性和低层动作可行性,选择执行高置信度动作、通过自然语言查询澄清任务歧义或请求动作干预修正低层策略,提升机器人部署性能。

Comments To appear in Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11218 2026-05-13 cs.AI 77%

Don't Look at the Numbers: Visual Anchoring Bias and Layer-wise Representation in VLMs

不要看数字:视觉锚定偏差与视觉语言模型中的分层表示

M. Shalankin

机构 * M. Shalankin

专题命中 幻觉与鲁棒性 :VLM(summary_cn);vision-language model(abstract);分类 cs.AI

AI总结 研究揭示视觉锚定对VLM性能评估的系统性偏差,通过分层分析发现不同层的表示差异及架构依赖的融合机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10386 2026-05-12 cs.AI 77%

GuardAD: Safeguarding Autonomous Driving MLLMs via Markovian Safety Logic

GuardAD: 通过马尔可夫安全逻辑保障自动驾驶MLLMs

Tianyuan Zhang, Peng Yue, Zihao Peng, Jiangfan Liu, Zonghao Ying, Jiakai Wang, Tianlin Li, Jian Yang, Yaodong Yang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航大学) Zhongguancun Laboratory(中关村实验室) Peking University(北京大学)

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 GuardAD通过马尔可夫逻辑形式化提升自动驾驶MLLMs的安全性,减少事故率并提升任务性能,经实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00326 2026-05-04 cs.CL cs.CV 77%

Prompt-Induced Score Variance in Zero-Shot Binary Vision-Language Safety Classification

零样本二元视觉语言安全分类中的提示诱导分数方差

Charles Weng, Dingwen Li, Alexander Martin

机构 * Johns Hopkins University(约翰霍普金斯大学) Independent(独立)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 研究发现零样本视觉语言模型安全分类器的单提示首词概率在语义等价提示改写下不可靠,提出训练自由的均值集成方法提升模型性能,推荐提示家族评估与均值聚合作为标准无标签可靠性基准。

Comments Preprint. 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14399 2026-04-17 cs.RO cs.AI cs.SY eess.SY 77%

SpaceMind: A Modular and Self-Evolving Embodied Vision-Language Agent Framework for Autonomous On-orbit Servicing

SpaceMind:一种模块化且自我进化的具身视觉-语言代理框架,用于自主在轨服务

Aodi Wu, Haodong Han, Xubo Luo, Ruisuo Wang, Shan He, Xue Wan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 本文提出SpaceMind框架,通过模块化和自我进化机制,实现自主在轨服务中的视觉感知、三维空间推理和多阶段任务执行,验证了其在不同环境下的鲁棒性和适应性。

Comments 23 pages, 6 figures, 7 tables. Code available at https://github.com/wuaodi/SpaceMind

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13788 2026-04-16 cs.RO cs.CV 77%

Failure Identification in Imitation Learning Via Statistical and Semantic Filtering

通过统计和语义过滤进行模仿学习中的故障识别

Quentin Rolland, Fabrice Mayran de Chamisso, Jean-Baptiste Mouret

机构 * Université Paris-Saclay, CEA, List(巴黎-萨克雷大学,CEA,List) Inria, CNRS, Université de Lorraine, LORIA(Inria,CNRS,洛林大学,LORIA) Bleu Robotics(Bleu机器人)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出FIDeL模块,结合统计和语义过滤技术,提升机器人模仿学习中的故障检测性能,通过多模态数据集BotFails验证其有效性。

Comments 8 pages, Appendix coming soon, accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05210 2026-04-08 cs.CV 77%

Integration of Object Detection and Small VLMs for Construction Safety Hazard Identification

对象检测与小型视觉语言模型的整合用于建筑安全危险识别

Muhammad Adil, Mehmood Ahmed, Muhammad Aqib, Vicente A. Gonzalez, Gaang Lee, Qipei Mei

机构 * Infrastructure Human Tech (IHT) Lab, Department of Civil and Environmental Engineering, University of Alberta, Edmonton, Alberta, Canada(基础设施人类技术(IHT)实验室,土木与环境工程系,阿尔伯塔大学,埃德蒙顿,阿尔伯塔,加拿大)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);InternVL(abstract);分类 cs.CV

AI总结 本文提出了一种结合对象检测与多模态推理的轻量级框架,以提高建筑工地安全危险识别的准确性和效率,实验表明该方法在多个小型视觉语言模型上均提升了检测性能和解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27898 2026-03-31 cs.CV 77%

SAGE: Sink-Aware Grounded Decoding for Multimodal Hallucination Mitigation

SAGE:面向sink的 grounded 解码用于多模态幻觉缓解

Tripti Shukla, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 SAGE通过动态调节自注意力机制,实时监控 grounding 可靠性,有效缓解多模态幻觉问题,实验显示在MSCOCO和AMBER基准上取得显著提升。

Comments 25 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15613 2026-03-30 cs.CV cs.CL 77%

When to Think and When to Look: Uncertainty-Guided Lookback

何时思考,何时回顾:不确定性引导的回顾

Jing Bi, Filippos Bellos, Junjia Guo, Yayuan Li, Chao Huang, Yolo Y. Tang, Luchuan Song, Susan Liang, Zhongfei Mark Zhang, Jason J. Corso, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Michigan(密歇根大学) Binghamton University(宾汉姆顿大学)

专题命中 幻觉与鲁棒性 :vision language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV

AI总结 本文探讨了在大视觉语言模型中思考与回顾的平衡,提出不确定性引导的回顾策略,通过大规模对比实验提升MMMU性能,并在多个基准上取得新突破。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03245 2025-04-07 cs.AI cs.RO 77%

Seeing is Believing: Belief-Space Planning with Foundation Models as Uncertainty Estimators

Linfeng Zhao, Willie McClinton, Aidan Curtis, Nishanth Kumar, Tom Silver, Leslie Pack Kaelbling, Lawson L. S. Wong

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09572 2024-10-16 cs.CV 77%

Eyes Closed, Safety On: Protecting Multimodal LLMs via Image-to-Text Transformation

Yunhao Gou, Kai Chen, Zhili Liu, Lanqing Hong, Hang Xu, Zhenguo Li, Dit-Yan Yeung, James T. Kwok, Yu Zhang

专题命中 幻觉与鲁棒性 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments ECCV2024 (Project Page: https://gyhdog99.github.io/projects/ecso/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.00236 2024-09-19 cs.LG cs.CL cs.CR 77%

Image Hijacks: Adversarial Images can Control Generative Models at Runtime

Luke Bailey, Euan Ong, Stuart Russell, Scott Emmons

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);LLaVA(abstract);分类 cs.LG

Comments Project page at https://image-hijacks.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18094 2026-08-18 cs.CV cs.AI cs.DB 版本更新 76%

OODBench: Out-of-Distribution Benchmark for Large Vision-Language Models

OODBench: 用于大型视觉-语言模型的分布外基准

Ling Lin, Yang Bai, Heng Su, Congcong Zhu, Yaoxing Wang, Yang Zhou, Huazhu Fu, Jingrun Chen

机构 * University of Science and Technology of China Suzhou Institute for Advanced Research, USTC Key Laboratory of the Ministry of Education for Mathematical Foundations Unmanned System Research Institute, Northwestern Polytechnical University

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV、cs.AI

AI总结 OODBench提出了一种自动化方法,用于构建评估大型视觉-语言模型处理分布外数据能力的基准,并展示了当前模型在面对此类数据时的性能下降。

Comments 54 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19869 2026-05-20 cs.CV cs.AI 76%

Passive Construction Site Safety Monitoring via Persona-Scaffolded Adversarial Chain-of-Thought VLM Verification

通过基于人设的对抗性链式思考视觉语言模型验证实现被动施工现场安全监控

Ananth Sriram, Neel Mokaria, Rajveer Singh

机构 * Department of Computer Science, University of Maryland, College Park, MD, USA(大学马里兰学院计算机科学系,马里兰州科利尔帕克,MD,美国)

专题命中 幻觉与鲁棒性 :VLM(title);分类 cs.CV、cs.AI

AI总结 本文提出了一种被动的施工现场安全监控方法,通过三阶段架构处理视频数据,结合细调的YOLO11、SAM 3和Qwen3-VL-8B-Instruct模型,利用基于人设的对抗性链式思考协议提高合规性验证和幻觉控制,主要贡献是第三阶段提示设计,提升了12%的精度。

Comments 10 pages, 4 figures. First place, Ironsite.ai Spatial Intelligence Hackathon, University of Maryland, February 2026. Code available at https://github.com/ananthsriram1/ironsite-hackathon-project-safety_assistant

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07250 2026-05-11 cs.CV cs.AI 76%

Hard to Read, Easy to Jailbreak: How Visual Degradation Bypasses MLLM Safety Alignment

难以阅读,却容易被破解:视觉退化如何绕过大语言模型的安全对齐

Zhixue Song, Boyan Han, Yiwei Wang, Chi Zhang

机构 * AGI Lab, Westlake University, China(西lake大学AGI实验室,中国) University of California, Merced, USA(加州大学默塞德分校,美国)

专题命中 幻觉与鲁棒性 :MLLM(title);分类 cs.CV、cs.AI

AI总结 研究发现视觉退化会削弱大语言模型的安全防御,提出结构化认知卸载策略以缓解风险。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05587 2026-04-28 cs.CL cs.AI cs.LG 76%

Quantifying and Improving the Robustness of Retrieval-Augmented Language Models Against Spurious Features in Grounding Data

量化并提升检索增强语言模型对基础数据中虚假特征的鲁棒性

Shiping Yang, Jie Wu, Wenbiao Ding, Ning Wu, Shining Liang, Ming Gong, Hongzhi Li, Hengyuan Zhang, Angel X. Chang, Dongmei Zhang

机构 * Simon Fraser University(西蒙弗雷泽大学) Microsoft(微软) Atlassian Tongji University(同济大学) The University of Hong Kong(香港大学) Canada-CIFAR AI Chair, Amii(加拿大-CIFAR人工智能主席,Amii)

专题命中 幻觉与鲁棒性 :grounding(title);分类 cs.AI、cs.LG

AI总结 本文研究检索增强语言模型对基础数据中虚假特征的鲁棒性问题,提出SURE框架用于量化和提升鲁棒性,分析虚假特征在RAG领域的广泛性与挑战性。

Comments ACL 2026 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18770 2026-01-06 cs.CV cs.AI cs.IR 76%

Multimodal Adversarial Defense for Vision-Language Models by Leveraging One-To-Many Relationships

通过利用一对一关系进行多模态对抗防御以提升视觉语言模型

Futa Waseda, Antonio Tejero-de-Pablos, Isao Echizen

机构 * The University of Tokyo(东京大学) CyberAgent National Institute of Informatics(信息处理研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV、cs.AI

AI总结 本文提出多模态对抗训练方法,通过利用图像与文本之间的一对多关系提升视觉语言模型的对抗鲁棒性。

Comments WACV 2026 Accepted. Code available at https://github.com/CyberAgentAILab/multimodal-adversarial-training

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14571 2025-09-19 cs.HC cs.AI cs.LG 76%

VisMoDAl: Visual Analytics for Evaluating and Improving Corruption Robustness of Vision-Language Models

Huanchen Wang, Wencheng Zhang, Zhiqiang Wang, Zhicong Lu, Yuxin Ma

机构 * Southern University of Science and Technology(南方科技大学) City University of Hong Kong(香港城市大学) George Mason University(乔治·马歇尔大学)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.AI、cs.LG

Comments 11 pages, 7 figures, 1 table, accepted to IEEE VIS 2025 (IEEE Transactions on Visualization and Computer Graphics)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07847 2025-04-09 cs.CV cs.LG 76%

Confidence-calibrated covariate shift correction for few-shot classification in Vision-Language Models

Behraj Khan, Rizwan Qureshi, Nouman Muhammad Durrani, Tahir Syed

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05566 2025-01-13 cs.CV cs.AI cs.CY 76%

Vision-Language Models for Autonomous Driving: CLIP-Based Dynamic Scene Understanding

Mohammed Elhenawy, Huthaifa I. Ashqar, Andry Rakotonirainy, Taqwa I. Alhadidi, Ahmed Jaber, Mohammad Abu Tami

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14774 2024-10-24 cs.CV cs.CL cs.CR cs.LG 76%

Few-Shot Adversarial Prompt Learning on Vision-Language Models

Yiwei Zhou, Xiaobo Xia, Zhiwei Lin, Bo Han, Tongliang Liu

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV、cs.LG

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04231 2023-12-08 cs.CV cs.AI 76%

Adventures of Trustworthy Vision-Language Models: A Survey

Mayank Vatsa, Anubhooti Jain, Richa Singh

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV、cs.AI

Comments Accepted in AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.01893 2023-01-06 cs.CV cs.AI cs.CL 76%

GIVL: Improving Geographical Inclusivity of Vision-Language Models with Pre-Training Methods

Da Yin, Feng Gao, Govind Thattai, Michael Johnston, Kai-Wei Chang

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.04412 2022-12-09 cs.CV cs.LG 76%

Task Bias in Vision-Language Models

Sachit Menon, Ishaan Preetam Chandratreya, Carl Vondrick

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV、cs.LG

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏