arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5067 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5067 篇

2505.08818 2025-05-15 cs.CY cs.AI cs.LG 84%

Position: Restructuring of Categories and Implementation of Guidelines Essential for VLM Adoption in Healthcare

Amara Tariq, Rimita Lahiri, Charles Kahn, Imon Banerjee

机构 * Amara Tariq, Ph.D(博士) Rimita Lahiri, Ph.D(博士) Charles Kahn, M.D(医学博士) Imon Banerjee, Ph.D(博士)

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract);分类 cs.AI、cs.LG

Comments 15 pages, 2, tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05318 2025-05-09 cs.CV cs.AI cs.CY cs.HC cs.RO 84%

Mapping User Trust in Vision Language Models: Research Landscape, Challenges, and Prospects

Agnese Chiatti, Sara Bernardini, Lara Shibelski Godoy Piccolo, Viola Schiaffonati, Matteo Matteucci

机构 * Politecnico di Milano, Italy(米兰理工学院,意大利) University of Oxford, UK(牛津大学,英国) CODE University of Applied Sciences, Germany(德国应用科学大学)

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22330 2025-05-08 cs.CV cs.CL cs.LG 84%

Vision-Language Models Create Cross-Modal Task Representations

Grace Luo, Trevor Darrell, Amir Bar

机构 * University of California, Berkeley, USA(加州大学伯克利分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18271 2025-05-08 cs.LG cs.AI 84%

Vision-Language Model Selection and Reuse for Downstream Adaptation

Hao-Zhe Tan, Zhi Zhou, Yu-Feng Li, Lan-Zhe Guo

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03242 2025-05-07 cs.CV cs.AI 84%

Seeing the Abstract: Translating the Abstract Language for Vision Language Models

Davide Talon, Federico Girella, Ziyue Liu, Marco Cristani, Yiming Wang

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments Accepted to CVPR25. Project page: https://davidetalon.github.io/fashionact-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18027 2025-04-28 cs.CV cs.AI cs.RO 84%

A Large Vision-Language Model based Environment Perception System for Visually Impaired People

Zezhou Chen, Zhaoxiang Liu, Kai Wang, Kohou Wang, Shiguo Lian

机构 * AI Innovation Center, China Unicom(中国unicom人工智能创新中心) Unicom Digital Technology, China Unicom(中国unicom数字技术)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI

Comments Accepted by IROS2024(9 pages, 8 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17826 2025-04-28 cs.CV cs.AI 84%

FashionM3: Multimodal, Multitask, and Multiround Fashion Assistant based on Unified Vision-Language Model

Kaicheng Pang, Xingxing Zou, Waikeung Wong

机构 * Laboratory for Artificial Intelligence in Design(人工智能设计实验室) School of Fashion and Textiles(时尚与纺织学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09620 2025-04-15 cs.CL cs.AI cs.CV cs.MA 84%

Metropolis-Hastings Captioning Game: Knowledge Fusion of Vision Language Models via Decentralized Bayesian Inference

Yuta Matsui, Ryosuke Yamaki, Ryo Ueda, Seitaro Shinagawa, Tadahiro Taniguchi

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05141 2025-04-10 cs.CV cs.AI 84%

EffOWT: Transfer Visual Language Models to Open-World Tracking Efficiently and Effectively

Bingyang Wang, Kaer Huang, Bin Li, Yiqiang Yan, Lihe Zhang, Huchuan Lu, You He

专题命中 VLM训练与架构 :visual language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02862 2025-04-08 cs.CV cs.LG 84%

Towards Understanding How Knowledge Evolves in Large Vision-Language Models

Sudong Wang, Yunjian Zhang, Yao Zhu, Jianing Li, Zizhe Wang, Yanwei Liu, Xiangyang Ji

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10114 2025-04-02 cs.LG cs.CL cs.CV 84%

Mixture of Experts Made Personalized: Federated Prompt Learning for Vision-Language Models

Jun Luo, Chen Chen, Shandong Wu

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16761 2025-04-01 cs.CV cs.AI 84%

Is 'Right' Right? Enhancing Object Orientation Understanding in Multimodal Large Language Models through Egocentric Instruction Tuning

Ji Hyeok Jung, Eun Tae Kim, Seoyeon Kim, Joo Ho Lee, Bumsoo Kim, Buru Chang

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments CVPR2025 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20662 2025-03-27 cs.CV cs.LG eess.IV 84%

AutoRad-Lung: A Radiomic-Guided Prompting Autoregressive Vision-Language Model for Lung Nodule Malignancy Prediction

Sadaf Khademi, Mehran Shabanpour, Reza Taleei, Anastasia Oikonomou, Arash Mohammadi

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08497 2025-03-27 cs.LG cs.CV 84%

MMRL: Multi-Modal Representation Learning for Vision-Language Models

Yuncheng Guo, Xiaodong Gu

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19508 2025-03-26 cs.CV cs.LG 84%

Improved Alignment of Modalities in Large Vision Language Models

Kartik Jangra, Aman Kumar Singh, Yashwani Mann, Geetanjali Rathee

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06993 2025-03-11 cs.LG cs.CV 84%

CAPT: Class-Aware Prompt Tuning for Federated Long-Tailed Learning with Vision-Language Model

Shihao Hou, Xinyi Shang, Shreyank N Gowda, Yang Lu, Chao Wu, Yan Yan, Hanzi Wang

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04229 2025-03-07 cs.CV cs.LG 84%

Synthetic Data is an Elegant GIFT for Continual Vision-Language Models

Bin Wu, Wuxuan Shi, Jinqiao Wang, Mang Ye

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments This work is accepted by CVPR 2025. Modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01887 2025-03-05 cs.LG cs.AI 84%

When Continue Learning Meets Multimodal Large Language Model: A Survey

Yukang Huo, Hao Tang

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI、cs.LG

Comments 42 pages, 6 figures, 37 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19617 2025-03-04 cs.LG cs.CV 84%

Leveraging Vision Language Models for Specialized Agricultural Tasks

Muhammad Arbab Arshad, Talukder Zaki Jubery, Tirtho Roy, Rim Nassiri, Asheesh K. Singh, Arti Singh, Chinmay Hegde, Baskar Ganapathysubramanian, Aditya Balu, Adarsh Krishnamurthy, Soumik Sarkar

专题命中 VLM训练与架构 :vision language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.LG

Comments Published at WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07146 2025-02-26 cs.CV cs.AI 84%

Argus: Benchmarking and Enhancing Vision-Language Models for 3D Radiology Report Generation

Che Liu, Zhongwei Wan, Yuqi Wang, Hui Shen, Haozhe Wang, Kangyu Zheng, Mi Zhang, Rossella Arcucci

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17425 2025-02-25 cs.CV cs.LG 84%

Introducing Visual Perception Token into Multimodal Large Language Model

Runpeng Yu, Xinyin Ma, Xinchao Wang

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12980 2025-02-25 cs.CV cs.AI 84%

LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement

Siwen Jiao, Yangyi Fang, Baoyun Peng, Wangqun Chen, Bharadwaj Veeravalli

专题命中 VLM训练与架构 :VLM(title);visual language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14412 2025-02-21 cs.CV cs.CR cs.LG 84%

Evaluating Precise Geolocation Inference Capabilities of Vision Language Models

Neel Jay, Hieu Minh Nguyen, Trung Dung Hoang, Jacob Haimes

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments AAAI 2025 Workshop DATASAFE

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10419 2025-02-19 cs.NE cs.AI cs.LG 84%

A Hybrid Swarm Intelligence Approach for Optimizing Multimodal Large Language Models Deployment in Edge-Cloud-based Federated Learning Environments

Gaith Rjouba, Hanae Elmekki, Saidul Islam, Jamal Bentahar, Rachida Dssouli

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07838 2025-02-19 cs.CV cs.AI 84%

NanoVLMs: How small can we go and still make coherent Vision Language Models?

Mukund Agarwalla, Himanshu Kumar, Raj Dandekar, Rajat Dandekar, Sreedath Panat

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19651 2025-02-18 cs.CV cs.LG cs.MM 84%

Bridging Compressed Image Latents and Multimodal Large Language Models

Chia-Hao Kao, Cheng Chien, Yu-Jen Tseng, Yi-Hsin Chen, Alessandro Gnutti, Shao-Yuan Lo, Wen-Hsiao Peng, Riccardo Leonardi

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.LG

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09051 2025-02-14 cs.CV cs.AI cs.MA 84%

AIDE: Agentically Improve Visual Language Model with Domain Experts

Ming-Chang Chiu, Fuxiao Liu, Karan Sapra, Andrew Tao, Yaser Jacoob, Xuezhe Ma, Zhiding Yu, Guilin Liu

专题命中 VLM训练与架构 :visual language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 6 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07422 2025-02-14 cs.CV cs.AI 84%

LLMI3D: MLLM-based 3D Perception from a Single 2D Image

Fan Yang, Sicheng Zhao, Yanhao Zhang, Hui Chen, Haonan Lu, Jungong Han, Guiguang Ding

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14755 2025-02-14 cs.MM cs.AI cs.CV cs.HC 84%

SkinGEN: an Explainable Dermatology Diagnosis-to-Generation Framework with Interactive Vision-Language Models

Bo Lin, Yingjing Xu, Xuanwen Bao, Zhou Zhao, Zhouyang Wang, Jianwei Yin

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.19270 2025-02-13 cs.CV cs.LG 84%

Learning without Forgetting for Vision-Language Models

Da-Wei Zhou, Yuanhan Zhang, Yan Wang, Jingyi Ning, Han-Jia Ye, De-Chuan Zhan, Ziwei Liu

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Accepted to TPAMI. Code is available at https://github.com/zhoudw-zdw/PROOF

详情

展开后加载摘要…

URL PDF HTML 收藏