arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-21 至 2025-10-21 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 5 篇

2504.13169 2025-10-21 cs.CV 84%

Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective Resampling

Tsung-Han Wu, Heekyung Lee, Jiaxin Ge, Joseph E. Gonzalez, Trevor Darrell, David M. Chan

机构 * UC Berkeley(加州大学伯克利分校) POSTECH

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,comments);分类 cs.CV

Comments Accepted to NeurIPS 2025; Project Page: https://reverse-vlm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14697 2025-10-21 cs.CR cs.RO 67%

AGENTSAFE: Benchmarking the Safety of Embodied Agents on Hazardous Instructions

Zonghao Ying, Le Wang, Yisong Xiao, Jiakai Wang, Yuqing Ma, Jinyang Guo, Zhenfei Yin, Mingchuan Zhang, Aishan Liu, Xianglong Liu

机构 * SKLCCSE, Beihang University(北京航空航天大学智能科学与技术研究中心) Zhongguancun Laboratory(中关村实验室) The University of Sydney(悉尼大学) Henan University of Science(河南科技大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02456 2025-10-21 cs.LG cs.AI cs.NA math.NA 62%

Market-Driven Subset Selection for Budgeted Training

Ashish Jha, Valentin Leplat, AH Phan

机构 * Skolkovo Institute of Science and Technology(斯克洛夫诺科学与技术研究所) Innopolis University(因诺波利斯大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

Comments Retitled major revision of the same work (formerly "Market-Based Data Subset Selection -- Principled Aggregation of Multi-Criteria Example Utility"). Abstract and exposition revised; ablations added; theory clarified. Core results unchanged. Supersedes v1; please process as a replacement

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15948 2025-10-21 cs.AI cs.CR 57%

VisuoAlign: Safety Alignment of LVLMs with Multimodal Tree Search

MingSheng Li, Guangze Zhao, Sichen Liu

机构 * Independent Researcher(独立研究者) Harbin Institute of Technology(哈尔滨工业大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16198 2025-10-21 cs.CL 50%

EgMM-Corpus: A Multimodal Vision-Language Dataset for Egyptian Culture

Mohamed Gamil, Abdelrahman Elsayed, Abdelrahman Lila, Ahmed Gad, Hesham Abdelgawad, Mohamed Aref, Ahmed Fares

机构 * Department of Electrical Engineering, Faculty of Engineering at Shoubra, Benha University, Cairo 11629, Egypt(电气工程系,谢布拉工程学院,本海大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏