arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-13 至 2025-10-13 共收录 42 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 3 篇

2510.09008 2025-10-13 cs.CV cs.AI cs.CL 81%

On Epistemic Uncertainty of Visual Tokens for Object Hallucinations in Large Vision-Language Models

Hoigi Seo, Dong Un Kang, Hyunjin Cho, Joohoon Lee, Se Young Chun

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03355 2025-10-13 cs.LG cs.AI cs.CV 67%

Robustness in Both Domains: CLIP Needs a Robust Text Encoder

Elias Abad Rocamora, Christian Schlarmann, Naman Deep Singh, Yongtao Wu, Matthias Hein, Volkan Cevher

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03517 2025-10-13 cs.CV 57%

DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models

Ziyi Wu, Anil Kag, Ivan Skorokhodov, Willi Menapace, Ashkan Mirzaei, Igor Gilitschenski, Sergey Tulyakov, Aliaksandr Siarohin

机构 * Snap Research University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.CV

Comments NeurIPS 2025 Spotlight. Project page: https://snap-research.github.io/DenseDPO/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. VLM训练与架构 6 篇

2510.09586 2025-10-13 cs.CV 80%

Vision Language Models: A Survey of 26K Papers

Fengming Lin

机构 * School of Computer Science, The University of Manchester, Manchester, UK(曼彻斯特大学计算机科学学院)

专题命中 VLM训练与架构 :vision language model(title);VLM(abstract,comments);分类 cs.CV

Comments VLM/LLM Learning Notes

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07979 2025-10-13 cs.CV 79%

Visual Representation Alignment for Multimodal Large Language Models

Heeji Yoon, Jaewoo Jung, Junwan Kim, Hyungyu Choi, Heeseong Shin, Sangbeom Lim, Honggyu An, Chaehyun Kim, Jisang Han, Donghyun Kim, Chanho Eom, Sunghwan Hong, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) New York University(纽约大学) Chung-Ang University(Chung-Ang 大学) Korea University(韩国大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

Comments Project Page: https://cvlab-kaist.github.io/VIRAL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02912 2025-10-13 cs.CV 70%

Don't Just Chase "Highlighted Tokens" in MLLMs: Revisiting Visual Holistic Context Retention

Xin Zou, Di Lu, Yizhou Wang, Yibo Yan, Yuanhuiyi Lyu, Xu Zheng, Linfeng Zhang, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08818 2025-10-13 cs.CV cs.AI 62%

D-CoDe: Scaling Image-Pretrained VLMs to Video via Dynamic Compression and Question Decomposition

Yiyang Huang, Yizhou Wang, Yun Fu

机构 * Northeastern University(东北大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments This paper has been accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21334 2025-10-13 cs.CV 57%

HoliTom: Holistic Token Merging for Fast Video Large Language Models

Kele Shao, Keda Tao, Can Qin, Haoxuan You, Yang Sui, Huan Wang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Salesforce AI Research(Salesforce AI研究院) Columbia University(哥伦比亚大学) Rice University(Rice大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments code link: https://github.com/cokeshao/HoliTom

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18369 2025-10-13 cs.CV 57%

RePIC: Reinforced Post-Training for Personalizing Multi-Modal Language Models

Yeongtak Oh, Dohyun Chung, Juhyeon Shin, Sangha Park, Johan Barthelemy, Jisoo Mok, Sungroh Yoon

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他VLM 3 篇

2510.08054 2025-10-13 cs.CV 74%

RetouchLLM: Training-free Code-based Image Retouching with Vision Language Models

Moon Ye-Bin, Roy Miles, Tae-Hyun Oh, Ismail Elezi, Jiankang Deng

机构 * POSTECH Huawei London Research Center(华为伦敦研究中心) KAIST(韩国科学技术院) Imperial College London(伦敦帝国理工学院)

专题命中 其他VLM :vision language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03948 2025-10-13 cs.CV 57%

ProbRes: Probabilistic Jump Diffusion for Open-World Egocentric Activity Recognition

Sanjoy Kundu, Shanmukha Vellamcheti, Sathyanarayanan N. Aakur

机构 * CSSE Department, Auburn University(计算机科学与工程系,阿伯丁大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted to ICCV 2025. 17 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09078 2025-10-13 cs.GR cs.LG 57%

MCMC: Bridging Rendering, Optimization and Generative AI

Gurprit Singh, Wenzel Jakob

机构 * Max Planck Institute for Informatics(马克斯·普朗克研究所信息学研究所) EPFL(瑞士联邦理工学院)

专题命中 其他VLM :vision language model(abstract);分类 cs.LG

Comments SIGGRAPH Asia 2024 Courses. arXiv admin note: text overlap with arXiv:2208.11970 by other authors

Journal ref SIGGRAPH Asia 2024 Courses, Article No.: 8, Pages 1 - 27

详情

展开后加载摘要…

URL PDF HTML 收藏