arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1583 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1583 篇

2503.14911 2025-04-15 cs.CV 57%

Derm1M: A Million-scale Vision-Language Dataset Aligned with Clinical Ontology Knowledge for Dermatology

Siyuan Yan, Ming Hu, Yiwen Jiang, Xieji Li, Hao Fei, Philipp Tschandl, Harald Kittler, Zongyuan Ge

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Our dataset and code will be publicly available at https://github.com/SiyuanYan1/Derm1M

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13878 2025-04-15 cs.HC cs.CV 57%

Eye Gaze as a Signal for Conveying User Attention in Contextual AI Systems

Ethan Wilson, Naveen Sendhilnathan, Charlie S. Burlingham, Yusuf Mansour, Robert Cavin, Sai Deep Tetali, Ajoy Savio Fernandes, Michael J. Proulx

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

Comments To appear in ETRA '25: Proceedings of the 2025 Symposium on Eye Tracking Research and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00672 2025-04-15 cs.CV 57%

ExpertAF: Expert Actionable Feedback from Video

Kumar Ashutosh, Tushar Nagarajan, Georgios Pavlakos, Kris Kitani, Kristen Grauman

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07954 2025-04-11 cs.CV cs.CL 57%

Perception-R1: Pioneering Perception Policy with Reinforcement Learning

En Yu, Kangheng Lin, Liang Zhao, Jisheng Yin, Yana Wei, Yuang Peng, Haoran Wei, Jianjian Sun, Chunrui Han, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Jingyu Wang, Wenbing Tao

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

Comments Github page: https://github.com/linkangheng/PR1

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07643 2025-04-11 cs.IR cs.CL cs.CV 57%

CollEX -- A Multimodal Agentic RAG System Enabling Interactive Exploration of Scientific Collections

Florian Schneider, Narges Baba Ahmadi, Niloufar Baba Ahmadi, Iris Vogel, Martin Semmann, Chris Biemann

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06272 2025-04-10 cs.IR cs.AI 57%

RAVEN: An Agentic Framework for Multimodal Entity Discovery from Large-Scale Video Collections

Kevin Dela Rosa

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

Comments Presented at AI Agent for Information Retrieval: Generating and Ranking (Agent4IR) @ AAAI 2025 [https://sites.google.com/view/ai4ir/aaai-2025]

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04221 2025-04-08 cs.CV 57%

Evaluating Graphical Perception with Multimodal LLMs

Rami Huu Nguyen, Kenichi Maeda, Mahsa Geshvadi, Daniel Haehn

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments 6 pages, 5 figures, 1 teaser, IEEE Pacific Visualization 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03153 2025-04-07 cs.LG 57%

MORAL: A Multimodal Reinforcement Learning Framework for Decision Making in Autonomous Laboratories

Natalie Tirabassi, Sathish A. P. Kumar, Sumit Jha, Arvind Ramanathan

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

Comments 9 pages, 14 figures and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01662 2025-04-03 eess.IV cs.CV 57%

BioAtt: Anatomical Prior Driven Low-Dose CT Denoising

Namhun Kim, UiHyun Cho

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18499 2025-04-01 cs.CV 57%

OpenING: A Comprehensive Benchmark for Judging Open-ended Interleaved Image-Text Generation

Pengfei Zhou, Xiaopeng Peng, Jiajun Song, Chuanhao Li, Zhaopan Xu, Yue Yang, Ziyao Guo, Hao Zhang, Yuqi Lin, Yefei He, Lirui Zhao, Shuo Liu, Tianhua Li, Yuxuan Xie, Xiaojun Chang, Yu Qiao, Wenqi Shao, Kaipeng Zhang

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments 53 pages, 19 figures, accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07622 2025-04-01 cs.CV 57%

Pretrain like Your Inference: Masked Tuning Improves Zero-Shot Composed Image Retrieval

Junyang Chen, Hanjiang Lai

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments accepted by ICME 2025, this is the full version of paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00493 2025-03-28 cs.CV cs.CL 57%

Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding

Duo Zheng, Shijia Huang, Liwei Wang

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21130 2025-03-28 cs.HC cs.CV 57%

VideoMix: Aggregating How-To Videos for Task-Oriented Learning

Saelyne Yang, Anh Truong, Juho Kim, Dingzeyu Li

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments In Proceedings of the 30th International Conference on Intelligent User Interfaces (IUI '25) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20680 2025-03-27 cs.CV cs.CL 57%

Vision as LoRA

Han Wang, Yongjie Ye, Bingru Li, Yuxiang Nie, Jinghui Lu, Jingqun Tang, Yanjie Wang, Can Huang

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05186 2025-03-27 cs.CV 57%

Narrating the Video: Boosting Text-Video Retrieval via Comprehensive Utilization of Frame-Level Captions

Chan Hur, Jeong-hun Hong, Dong-hun Lee, Dabin Kang, Semin Myeong, Sang-hyo Park, Hyeyoung Park

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19910 2025-03-26 cs.CV cs.IR 57%

CoLLM: A Large Language Model for Composed Image Retrieval

Chuong Huynh, Jinyu Yang, Ashish Tawari, Mubarak Shah, Son Tran, Raffay Hamid, Trishul Chilimbi, Abhinav Shrivastava

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments CVPR 2025. Project page: https://collm-cvpr25.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15973 2025-03-26 cs.CV 57%

STOP: Integrated Spatial-Temporal Dynamic Prompting for Video Understanding

Zichen Liu, Kunlun Xu, Bing Su, Xu Zou, Yuxin Peng, Jiahuan Zhou

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18483 2025-03-25 cs.CV 57%

Explaining Domain Shifts in Language: Concept erasing for Interpretable Image Classification

Zequn Zeng, Yudi Su, Jianqiao Sun, Tiansheng Wen, Hao Zhang, Zhengjue Wang, Bo Chen, Hongwei Liu, Jiawei Ma

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18461 2025-03-25 cs.CV 57%

MuMA: 3D PBR Texturing via Multi-Channel Multi-View Generation and Agentic Post-Processing

Lingting Zhu, Jingrui Ye, Runze Zhang, Zeyu Hu, Yingda Yin, Lanjiong Li, Jinnan Chen, Shengju Qian, Xin Wang, Qingmin Liao, Lequan Yu

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments 17 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16413 2025-03-21 cs.CV cs.RO 57%

M3: 3D-Spatial MultiModal Memory

Xueyan Zou, Yuchen Song, Ri-Zhao Qiu, Xuanbin Peng, Jianglong Ye, Sifei Liu, Xiaolong Wang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments ICLR2025 homepage: https://m3-spatial-memory.github.io code: https://github.com/MaureenZOU/m3-spatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13145 2025-03-19 cs.CV 57%

Multimodal Mamba: Decoder-only Multimodal State Space Model via Quadratic to Linear Distillation

Bencheng Liao, Hongyuan Tao, Qian Zhang, Tianheng Cheng, Yingyue Li, Haoran Yin, Wenyu Liu, Xinggang Wang

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Code and model are available at https://github.com/hustvl/mmMamba

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09962 2025-03-14 cs.CV 57%

Modeling Thousands of Human Annotators for Generalizable Text-to-Image Person Re-identification

Jiayu Jiang, Changxing Ding, Wentao Tan, Junhong Wang, Jin Tao, Xiangmin Xu

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

Comments CVPR 2025. Project website: https://github.com/sssaury/HAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14282 2025-03-12 cs.CV 57%

Image Super-Resolution with Text Prompt Diffusion

Zheng Chen, Yulun Zhang, Jinjin Gu, Xin Yuan, Linghe Kong, Guihai Chen, Xiaokang Yang

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

Comments Code is available at https://github.com/zhengchen1999/PromptSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07125 2025-03-11 cs.CV 57%

Learning A Zero-shot Occupancy Network from Vision Foundation Models via Self-supervised Adaptation

Sihao Lin, Daqi Liu, Ruochong Fu, Dongrui Liu, Andy Song, Hongwei Xie, Zhihui Li, Bing Wang, Xiaojun Chang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05962 2025-03-11 cs.HC cs.CV 57%

OSCAR: Object Status and Contextual Awareness for Recipes to Support Non-Visual Cooking

Franklin Mingzhe Li, Kaitlyn Ng, Bin Zhu, Patrick Carrington

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments CHI 2025 Late Breaking Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04506 2025-03-07 cs.SE cs.AI 57%

Multi-modal Summarization in Model-Based Engineering: Automotive Software Development Case Study

Nenad Petrovic, Yurui Zhang, Moaad Maaroufi, Kuo-Yi Chao, Lukasz Mazur, Fengjunjie Pan, Vahid Zolfaghari, Alois Knoll

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

Comments Conference paper accepted for IntelliSys2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02206 2025-03-05 cs.CV 57%

Language-Guided Visual Perception Disentanglement for Image Quality Assessment and Conditional Image Generation

Zhichao Yang, Leida Li, Pengfei Chen, Jinjian Wu, Giuseppe Valenzise

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00908 2025-03-04 eess.IV cs.CV 57%

Patient-Level Anatomy Meets Scanning-Level Physics: Personalized Federated Low-Dose CT Denoising Empowered by Large Language Model

Ziyuan Yang, Yingyu Chen, Zhiwen Wang, Hongming Shan, Yang Chen, Yi Zhang

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20480 2025-03-03 cs.CV cs.HC 57%

VideoA11y: Method and Dataset for Accessible Video Description

Chaoyu Li, Sid Padmanabhuni, Maryam Cheema, Hasti Seifi, Pooyan Fazli

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments ACM CHI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19293 2025-02-28 cs.CV 57%

Pathology Report Generation and Multimodal Representation Learning for Cutaneous Melanocytic Lesions

Ruben T. Lucassen, Sander P. J. Moonemans, Tijn van de Luijtgaarden, Gerben E. Breimer, Willeke A. M. Blokx, Mitko Veta

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments 11 pages, 2 figures. arXiv admin note: text overlap with arXiv:2502.19285

详情

展开后加载摘要…

URL PDF HTML 收藏