arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-12 至 2026-02-12 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 4 篇

2505.23798 2026-02-12 cs.CL cs.AI cs.CV 81%

Unveiling the "Fairness Seesaw": Discovering and Mitigating Gender and Race Bias in Vision-Language Models

揭示'公平性之锯':在视觉-语言模型中发现并缓解性别和种族偏见

Jian Lan, Udo Schlegel, Tanveer Hannan, Gengyuan Zhang, Haokun Chen, Thomas Seidl

机构 * LMU Munich(慕尼黑莱布尼茨大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出RES-FAIR框架,通过调整隐藏状态缓解视觉-语言模型中的性别和种族偏见,提升响应公平性和置信度校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10771 2026-02-12 cs.CV cs.RO 57%

From Steering to Pedalling: Do Autonomous Driving VLMs Generalize to Cyclist-Assistive Spatial Perception and Planning?

从转向到踩踏:自动驾驶VLMs是否能泛化到骑行辅助的空间感知与规划?

Krishna Kanth Nakka, Vedasri Nakka

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CyclingVQA基准,评估自动驾驶VLMs在骑行辅助场景中的感知与推理能力,发现现有模型在骑行特定交通提示理解上存在不足,需进一步改进。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10425 2026-02-12 cs.CV 57%

HII-DPO: Eliminate Hallucination via Accurate Hallucination-Inducing Counterfactual Images

HII-DPO: 通过准确的 hallucination-Inducing Counterfactual Images 消除幻觉

Yilin Yang, Zhenghui Guo, Yuke Wang, Omprakash Gnawali, Sheng Di, Chengming Zhang

机构 * University of Houston(休斯顿大学) Rice University(里士满大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 HII-DPO通过生成准确的幻觉诱导图像,有效缓解了VLMs在语言偏见下的幻觉问题,提升了模型的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19844 2026-02-12 cs.CV 57%

ProAPO: Progressively Automatic Prompt Optimization for Visual Classification

ProAPO:逐步自动提示优化用于视觉分类

Xiangyan Qu, Gaopeng Gou, Jiamin Zhuang, Jing Yu, Kun Song, Qihao Wang, Yili Li, Gang Xiong

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Information Engineering, Minzu University of China(民族大学信息工程学院) University of Science and Technology Beijing(北京科技大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 ProAPO通过逐步自动优化提示,提升视觉分类性能,优于现有方法并在多个数据集上取得显著改进。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏