arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-23 至 2025-12-23 共收录 7 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 7 篇

2512.18264 2025-12-23 cs.CV cs.AI cs.CR 84%

Who Can See Through You? Adversarial Shielding Against VLM-Based Attribute Inference Attacks

谁能穿透你?基于VLM的属性推断攻击的对抗防护

Yucheng Fan, Jiawei Chen, Yu Tian, Zhaoxia Yin

机构 * East China Normal University(东华大学) Zhongguancun Academy(中关村学院) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于视觉一致性约束的隐私保护方法,通过VPI-COCO基准验证,有效降低隐私泄露风险并保持视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18411 2025-12-23 cs.CV cs.AI 81%

AmPLe: Supporting Vision-Language Models via Adaptive-Debiased Ensemble Multi-Prompt Learning

AmPLe: 通过自适应去偏集成多提示学习支持视觉-语言模型

Fei Song, Yi Li, Jiangmeng Li, Rui Wang, Changwen Zheng, Fanjiang Xu, Hui Xiong

机构 * National Key Laboratory of Space Integrated Information System, Institute of Software, Chinese Academy of Sciences(中国科学院空间信息集成系统国家重点实验室,软件研究所) University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 AmPLe通过自适应去偏集成多提示学习方法,解决模型-提示匹配偏差和样本-提示匹配偏差,提升视觉-语言模型在下游任务中的性能。

Comments Accepted by IJCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19317 2025-12-23 cs.AI 79%

SafeMed-R1: Adversarial Reinforcement Learning for Generalizable and Robust Medical Reasoning in Vision-Language Models

SafeMed-R1: 为视觉-语言模型中的通用性和鲁棒性医疗推理设计的对抗强化学习

A. A. Gde Yogi Pramana, Jason Ray, Anthony Jaya, Michael Wijaya

机构 * National University of Singapore(新加坡国立大学)

专题命中 幻觉与鲁棒性 :vision-language model(title);visual question answering(abstract);分类 cs.AI

AI总结 SafeMed-R1通过对抗训练与组相对策略优化提升视觉-语言模型在医疗推理中的鲁棒性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19070 2025-12-23 cs.CV cs.CL 79%

Watch Closely: Mitigating Object Hallucinations in Large Vision-Language Models with Disentangled Decoding

Watch Closely: 通过解耦解码缓解大视觉-语言模型中的物体幻觉

Ruiqi Ma, Yu Yan, Chunhong Zhang, Minghao Yin, XinChao Liu, Zhihong Jin, Zheng Hu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) The University of Hong Kong(香港大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 通过解耦解码方法,无需训练即可缓解大视觉-语言模型中的物体幻觉问题,提升模型的视觉性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18231 2025-12-23 cs.CV cs.CL 79%

Investigating Spatial Attention Bias in Vision-Language Models

探究视觉-语言模型中的空间注意力偏差

Aryan Chaudhary, Sanchit Goyal, Pratik Narang, Dhruv Kumar

机构 * Birla Institute of Technology and Science, Pilani, India(比拉理工学院和科学研究院,帕利尼,印度)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文研究了视觉-语言模型在处理水平拼接图像时存在的系统性空间注意力偏差,发现模型倾向于优先描述左位置内容,且该偏差在不同架构和语言训练下均存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18623 2025-12-23 cs.CL cs.AI 57%

LLM-CAS: Dynamic Neuron Perturbation for Real-Time Hallucination Correction

LLM-CAS: 动态神经元扰动用于实时幻觉修正

Jensen Zhang, Ningyuan Liu, Yijia Fan, Zihao Huang, Qinglin Zeng, Kaitong Cai, Jian Wang, Keze Wang

机构 * Sun Yat-sen University(中山大学) Snap Inc(Snap公司)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 LLM-CAS通过动态神经元扰动实现实时幻觉修正,提升大型语言模型的事实准确性。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11712 2025-12-23 cs.AI 57%

Mitigating Hallucination Through Theory-Consistent Symmetric Multimodal Preference Optimization

通过理论一致的对称多模态偏好优化缓解幻觉

Wenqi Liu, Xuemeng Song, Jiaxi Li, Yinwei Wei, Na Zheng, Jianhua Yin, Liqiang Nie

机构 * Shandong University(山东大学) Southern University of Science and Technology(南方科技大学) University of Georgia(佐治亚大学) National University of Singapore(新加坡国立大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 SymMPO通过理论一致的对称多模态偏好优化方法,有效缓解多模态大语言模型中的幻觉问题。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏