arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-07 至 2025-11-07 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 4 篇

2410.04514 2025-11-07 cs.CL cs.CV 70%

DAMRO: Dive into the Attention Mechanism of LVLM to Reduce Object Hallucination

Xuan Gong, Tianshi Ming, Xinpeng Wang, Zhihua Wei

机构 * Department of Computer Science and Technology, Tongji University(计算机科学与技术系,同济大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

Comments Accepted by EMNLP2024 (Main Conference), add GitHub link

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15482 2025-11-07 cs.CV cs.AI 62%

Comparing Computational Pathology Foundation Models using Representational Similarity Analysis

Vaibhav Mishra, William Lotter

机构 * Dana-Farber Cancer Institute(达纳-法伯癌症研究所) Brigham and Women’s Hospital & Harvard Medical School(布里奇沃特医院及哈佛医学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Proceedings of the 5th Machine Learning for Health (ML4H) Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04655 2025-11-07 cs.CV 61%

Benchmark Designers Should "Train on the Test Set" to Expose Exploitable Non-Visual Shortcuts

Ellis Brown, Jihan Yang, Shusheng Yang, Rob Fergus, Saining Xie

机构 * New York University(纽约大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV;MLLM(comments)

Comments Project page: https://cambrian-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03900 2025-11-07 cs.CL cs.LG 57%

GRAD: Graph-Retrieved Adaptive Decoding for Hallucination Mitigation

Manh Nguyen, Sunil Gupta, Dai Do, Hung Le

机构 * Applied Artificial Intelligence Initiative(应用人工智能计划) Deakin University(德金大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏