On Epistemic Uncertainty of Visual Tokens for Object Hallucinations in Large Vision-Language Models
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI
专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted in NeurIPS 2025
机构 * Snap Research ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.CV
Comments NeurIPS 2025 Spotlight. Project page: https://snap-research.github.io/DenseDPO/
机构 * School of Computer Science, The University of Manchester, Manchester, UK(曼彻斯特大学计算机科学学院)
专题命中 VLM训练与架构 :vision language model(title);VLM(abstract,comments);分类 cs.CV
Comments VLM/LLM Learning Notes
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; New York University(纽约大学) ; Chung-Ang University(Chung-Ang 大学) ; Korea University(韩国大学) ; ETH Zürich(苏黎世联邦理工学院)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV
Comments Project Page: https://cvlab-kaist.github.io/VIRAL/
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted by NeurIPS 2025 main
机构 * Northeastern University(东北大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments This paper has been accepted to EMNLP 2025
机构 * Zhejiang University(浙江大学) ; Shanghai Innovation Institute(上海创新研究院) ; Westlake University(西湖大学) ; Salesforce AI Research(Salesforce AI研究院) ; Columbia University(哥伦比亚大学) ; Rice University(Rice大学)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV
Comments code link: https://github.com/cokeshao/HoliTom
专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV
Comments Accepted to NeurIPS 2025
机构 * POSTECH ; Huawei London Research Center(华为伦敦研究中心) ; KAIST(韩国科学技术院) ; Imperial College London(伦敦帝国理工学院)
专题命中 其他VLM :vision language model(title);分类 cs.CV
机构 * CSSE Department, Auburn University(计算机科学与工程系,阿伯丁大学)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments Accepted to ICCV 2025. 17 pages, 6 figures, 3 tables
机构 * Max Planck Institute for Informatics(马克斯·普朗克研究所信息学研究所) ; EPFL(瑞士联邦理工学院)
专题命中 其他VLM :vision language model(abstract);分类 cs.LG
Comments SIGGRAPH Asia 2024 Courses. arXiv admin note: text overlap with arXiv:2208.11970 by other authors
Journal ref SIGGRAPH Asia 2024 Courses, Article No.: 8, Pages 1 - 27