arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-14 至 2025-10-14 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 9 篇

2507.09279 2025-10-14 cs.CV cs.AI cs.CL 86%

Prompt4Trust: A Reinforcement Learning Prompt Augmentation Framework for Clinically-Aligned Confidence Calibration in Multimodal Large Language Models

Anita Kriz, Elizabeth Laura Janes, Xing Shen, Tal Arbel

机构 * McGill University(麦吉尔大学) Mila – Quebec AI Institute(魁北克AI研究所)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted to ICCV 2025 Workshop CVAMD

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.24000 2025-10-14 cs.LG cs.CV 84%

The Illusion of Progress? A Critical Look at Test-Time Adaptation for Vision-Language Models

Lijun Sheng, Jian Liang, Ran He, Zilei Wang, Tieniu Tan

机构 * University of Science and Technology of China(中国科学技术大学) NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,comments);分类 cs.CV、cs.LG

Comments NeurIPS 2025 Datasets and Benchmarks Track. Github link: https://github.com/TomSheng21/tta-vlm

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03123 2025-10-14 cs.CV cs.CL cs.LG 81%

Investigating VLM Hallucination from a Cognitive Psychology Perspective: A First Step Toward Interpretation with Intriguing Observations

Xiangrui Liu, Man Luo, Agneet Chatterjee, Hua Wei, Chitta Baral, Yezhou Yang

机构 * Arizona State University(亚利桑那州立大学) Intel Lab(英特尔实验室)

专题命中 幻觉与鲁棒性 :VLM(title);vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10965 2025-10-14 cs.CL cs.AI 79%

Judge Before Answer: Can MLLM Discern the False Premise in Question?

Jidong Li, Lingyong Fang, Haodong Zhao, Sufeng Duan, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Inner Mongolia Research Institute, Shanghai Jiao Tong University(上海交通大学内蒙古研究院)

专题命中 幻觉与鲁棒性 :MLLM(title);multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09849 2025-10-14 cs.CL cs.CV 79%

Text Prompt Injection of Vision Language Models

Ruizhe Zhu

机构 * Ruizhe Zhu(独立研究者)

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10466 2025-10-14 cs.CV 70%

When Images Speak Louder: Mitigating Language Bias-induced Hallucinations in VLMs through Cross-Modal Guidance

Jinjin Cao, Zhiyang Chen, Zijun Wang, Liyuan Ma, Weijian Luo, Guojun Qi

机构 * MAPLE Lab, Westlake University(西溪大学MAPLE实验室)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14670 2025-10-14 cs.HC cs.AI 70%

StreetLens: Enabling Human-Centered AI Agents for Neighborhood Assessment from Street View Imagery

Jina Kim, Leeje Jang, Yao-Yi Chiang, Guanyu Wang, Michelle C. Pasco

机构 * University of Minnesota(明尼苏达大学)

专题命中 幻觉与鲁棒性 :vision language model(abstract);VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10290 2025-10-14 cs.SE cs.LG 57%

Grounded AI for Code Review: Resource-Efficient Large-Model Serving in Enterprise Pipelines

Sayan Mandal, Hua Jiang

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

Comments Submitted to MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16012 2025-10-14 cs.RO 50%

DualTHOR: A Dual-Arm Humanoid Simulation Platform for Contingency-Aware Planning

Boyu Li, Siyuan He, Hang Xu, Haoqi Yuan, Yu Zang, Liwei Hu, Junpeng Yue, Zhenxiong Jiang, Pengbo Hu, Börje F. Karlsson, Yehui Tang, Zongqing Lu

专题命中 幻觉与鲁棒性 :vision language model(abstract)

Comments The experiments in the paper need to be further supplemented, and more methods should be considered for expansion

详情

展开后加载摘要…

URL PDF HTML 收藏