arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1578 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1578 篇

2504.05651 2025-04-09 cs.LG cs.CV 62%

Measuring Déjà vu Memorization Efficiently

Narine Kokhlikyan, Bargav Jayaraman, Florian Bordes, Chuan Guo, Kamalika Chaudhuri

专题命中 其他VLM :vision language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23125 2025-04-01 cs.CV cs.AI 62%

Evaluating Compositional Scene Understanding in Multimodal Generative Models

Shuhao Fu, Andrew Jun Lee, Anna Wang, Ida Momennejad, Trevor Bihl, Hongjing Lu, Taylor W. Webb

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22941 2025-04-01 cs.AI cs.LG cs.MM 62%

Identifying Multi-modal Knowledge Neurons in Pretrained Transformers via Two-stage Filtering

Yugen Sato, Tomohiro Takagi

专题命中 其他VLM :MLLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22610 2025-03-31 cs.HC cs.AI cs.CL cs.CY cs.LG 62%

Evaluating Multimodal Language Models as Visual Assistants for Visually Impaired Users

Antonia Karamolegkou, Malvina Nikandrou, Georgios Pantazopoulos, Danae Sanchez Villegas, Phillip Rust, Ruchira Dhar, Daniel Hershcovich, Anders Søgaard

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22263 2025-03-31 cs.LG cs.CV 62%

FLIP: Towards Comprehensive and Reliable Evaluation of Federated Prompt Learning

Dongping Liao, Xitong Gao, Yabo Xu, Chengzhong Xu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

Comments https://github.com/0-ml/flip

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08317 2025-03-24 cs.CL cs.AI cs.CV 62%

Mitigating Hallucinations in Multimodal Spatial Relations through Constraint-Aware Prompting

Jiarui Wu, Zhuo Liu, Hangfeng He

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09091 2025-03-21 cs.CV cs.AI 62%

Multi-Modal Foundation Models for Computational Pathology: A Survey

Dong Li, Guihong Wan, Xintao Wu, Xinyu Wu, Xiaohui Chen, Yi He, Christine G. Lian, Peter K. Sorger, Yevgeniy R. Semenov, Chen Zhao

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14935 2025-03-20 cs.CV cs.AI 62%

FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding

Chongjun Tu, Lin Zhang, Pengtao Chen, Peng Ye, Xianfang Zeng, Wei Cheng, Gang Yu, Tao Chen

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments FAVOR-Bench project page: https://favor-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14895 2025-03-20 cs.CV cs.AI cs.CL 62%

Mitigating Object Hallucinations in MLLMs via Multi-Frequency Perturbations

Shuo Li, Jiajun Sun, Guodong Zheng, Xiaoran Fan, Yujiong Shen, Yi Lu, Zhiheng Xi, Yuming Yang, Wenming Tan, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13108 2025-03-18 cs.CV cs.AI 62%

Lifting the Veil on Visual Information Flow in MLLMs: Unlocking Pathways to Faster Inference

Hao Yin, Guangzong Si, Zilei Wang

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12834 2025-03-18 cs.CV cs.AI 62%

PASTA: Part-Aware Sketch-to-3D Shape Generation with Text-Aligned Prior

Seunggwan Lee, Hwanhee Jung, Byoungsoo Koh, Qixing Huang, Sangho Yoon, Sangpil Kim

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 19 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12326 2025-03-18 cs.CV cond-mat.mtrl-sci cs.AI 62%

Leveraging Vision Capabilities of Multimodal LLMs for Automated Data Extraction from Plots

Maciej P. Polak, Dane Morgan

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12281 2025-03-18 cs.CV cs.LG 62%

Exploration of VLMs for Driver Monitoring Systems Applications

Paola Natalia Cañas, Marcos Nieto, Oihana Otaegui, Igor Rodríguez

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Accepted in 16th ITS European Congress, Seville, Spain, 19-21 May 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02155 2025-03-11 cs.AI cs.CL cs.CV 62%

From Pixels to Tokens: Byte-Pair Encoding on Quantized Visual Modalities

Wanpeng Zhang, Zilong Xie, Yicheng Feng, Yijiang Li, Xingrun Xing, Sipeng Zheng, Zongqing Lu

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19527 2025-03-10 cs.AI cs.CV cs.CY 62%

BuildingView: Constructing Urban Building Exteriors Databases with Street View Imagery and Multimodal Large Language Mode

Zongrong Li, Yunlei Su, Hongrong Wang, Wufan Zhao

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00726 2025-03-04 cs.GR cs.AI cs.CV 62%

Enhancing Monocular 3D Scene Completion with Diffusion Model

Changlin Song, Jiaqi Wang, Liyun Zhu, He Weng

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments All authors had equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17516 2025-02-26 cs.LG cs.AI 62%

A Survey on Mechanistic Interpretability for Multi-Modal Foundation Models

Zihao Lin, Samyadeep Basu, Mohammad Beigi, Varun Manjunatha, Ryan A. Rossi, Zichao Wang, Yufan Zhou, Sriram Balasubramanian, Arman Zarei, Keivan Rezaei, Ying Shen, Barry Menglong Yao, Zhiyang Xu, Qin Liu, Yuxiang Zhang, Yan Sun, Shilong Liu, Li Shen, Hongxuan Li, Soheil Feizi, Lifu Huang

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI、cs.LG

Comments 30 pages, 4 Figures, 10 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06875 2025-02-12 cs.CV cs.AI cs.CL 62%

Beyond Vision: How Large Language Models Interpret Facial Expressions from Valence-Arousal Values

Vaibhav Mehra, Guy Laban, Hatice Gunes

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04923 2025-02-10 cs.CV cs.AI 62%

Cached Multi-Lora Composition for Multi-Concept Image Generation

Xiandong Zou, Mingzhu Shen, Christos-Savvas Bouganis, Yiren Zhao

专题命中 其他VLM :MLLM(abstract);分类 cs.CV、cs.AI

Comments The Thirteenth International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04353 2025-02-10 cs.CL cs.AI cs.CV 62%

CognArtive: Large Language Models for Automating Art Analysis and Decoding Aesthetic Elements

Afshin Khadangi, Amir Sartipi, Igor Tchappi, Gilbert Fridgen

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17586 2025-01-31 cs.CV cs.LG 62%

Boosting Weak Positives for Text Based Person Search

Akshay Modi, Ashhar Aziz, Nilanjana Chatterjee, A V Subramanyam

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16404 2025-01-29 cs.LG cs.AI cs.CL 62%

DynaPrompt: Dynamic Test-Time Prompt Tuning

Zehao Xiao, Shilin Yan, Jack Hong, Jiayin Cai, Xiaolong Jiang, Yao Hu, Jiayi Shen, Qi Wang, Cees G. M. Snoek

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI、cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14189 2025-01-27 cs.AI cs.LG cs.MA 62%

Distributed Multi-Agent Coordination Using Multi-Modal Foundation Models

Saaduddin Mahmud, Dorian Benhamou Goldfajn, Shlomo Zilberstein

专题命中 其他VLM :vision language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01432 2025-01-17 cs.CV cs.LG 62%

VLG-CBM: Training Concept Bottleneck Models with Vision-Language Guidance

Divyansh Srivastava, Ge Yan, Tsui-Wei Weng

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Appeared at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04695 2025-01-09 cs.LG cs.CV cs.IR cs.IT math.IT 62%

Re-ranking the Context for Multimodal Retrieval Augmented Generation

Matin Mortaheb, Mohammad A. Amir Khojastepour, Srimat T. Chakradhar, Sennur Ulukus

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00546 2025-01-08 cs.AI cs.LG 62%

AllSpark: A Multimodal Spatio-Temporal General Intelligence Model with Ten Modalities via Language as a Reference Framework

Run Shao, Cheng Yang, Qiujun Li, Qing Zhu, Yongjun Zhang, YanSheng Li, Yu Liu, Yong Tang, Dapeng Liu, Shizhong Yang, Haifeng Li

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI、cs.LG

Comments 19 pages, 19 tables, 3 figures

Journal ref IEEE Transactions on Geoscience and Remote Sensing. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02922 2025-01-07 cs.CV cs.AI 62%

Label-free Concept Based Multiple Instance Learning for Gigapixel Histopathology

Susu Sun, Leslie Tessier, Frédérique Meeuwsen, Clément Grisi, Dominique van Midden, Geert Litjens, Christian F. Baumgartner

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00340 2025-01-06 cs.CV cs.LG 62%

Dynamic Prompt Adjustment for Multi-Label Class-Incremental Learning

Haifeng Zhao, Yuguang Jin, Leilei Ma

专题命中 其他VLM :visual language model(abstract);分类 cs.CV、cs.LG

Comments published to BICS2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17251 2024-12-24 cs.CV cs.LG eess.IV 62%

GCS-M3VLT: Guided Context Self-Attention based Multi-modal Medical Vision Language Transformer for Retinal Image Captioning

Teja Krishna Cherukuri, Nagur Shareef Shaik, Jyostna Devi Bodapati, Dong Hye Ye

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

Comments This paper has been accepted for presentation at the IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03556 2024-12-23 cs.CL cs.AI cs.LG 62%

Best-of-N Jailbreaking

John Hughes, Sara Price, Aengus Lynch, Rylan Schaeffer, Fazl Barez, Sanmi Koyejo, Henry Sleight, Erik Jones, Ethan Perez, Mrinank Sharma

专题命中 其他VLM :vision language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏