arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5067 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5067 篇

2505.07164 2025-05-13 cs.MM 82%

EmoVLM-KD: Fusing Distilled Expertise with Vision-Language Models for Visual Emotion Analysis

SangEun Lee, Yubeen Lee, Eunil Park

专题命中 VLM训练与架构 :vision-language model(title,abstract);vision language model(abstract)

Comments Accepted at Workshop and Competition on Affective & Behavior Analysis in-the-wild (ABAW), CVPR 2025, 10 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13624 2025-04-21 eess.SP 82%

PV-VLM: A Multimodal Vision-Language Approach Incorporating Sky Images for Intra-Hour Photovoltaic Power Forecasting

Huapeng Lin, Miao Yu

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13119 2025-04-18 cs.HC 82%

Object-Driven Narrative in AR: A Scenario-Metaphor Framework with VLM Integration

Yusi Sun, Haoyan Guan, leith Kin Yep Chan, Yong Hong Kuo

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02765 2025-04-04 cs.RO 82%

Robot-Led Vision Language Model Wellbeing Assessment of Children

Nida Itrat Abbasi, Fethiye Irmak Dogan, Guy Laban, Joanna Anderson, Tamsin Ford, Peter B. Jones, Hatice Gunes

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02816 2025-03-05 cs.HC 82%

"What If Smart Homes Could See Our Homes?": Exploring DIY Smart Home Building Experiences with VLM-Based Camera Sensors

Sojeong Yun, Youn-kyung Lim

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract)

Journal ref CHI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02748 2025-03-05 cs.RO 82%

Bridging VLM and KMP: Enabling Fine-grained robotic manipulation via Semantic Keypoints Representation

Junjie Zhu, Huayu Liu, Jin Wang, Bangrong Wen, Kaixiang Huang, Xiaofei Li, Haiyun Zhan, Guodong Lu

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15973 2025-02-11 cs.CV cs.AI cs.CL cs.LG 82%

Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement

Xiyao Wang, Jiuhai Chen, Zhaoyang Wang, Yuhang Zhou, Yiyang Zhou, Huaxiu Yao, Tianyi Zhou, Tom Goldstein, Parminder Bhatia, Furong Huang, Cao Xiao

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments NAACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15021 2025-01-28 cs.CL 82%

AKVQ-VL: Attention-Aware KV Cache Adaptive 2-Bit Quantization for Vision-Language Models

Zunhai Su, Wang Shen, Linge Li, Zhe Chen, Hanyu Wei, Huangqi Yu, Kehong Yuan

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08771 2024-12-13 cs.CV cs.AI cs.LG 82%

LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information

Ke Wang, Hong Xuan

专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02760 2024-12-05 cs.AI cs.CL cs.CV cs.LG 82%

Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek

Ahmed Zeer, Eren Dogan, Yusuf Erdem, Elif Ince, Osama Shbib, M. Egemen Uzun, Atahan Uz, M. Kaan Yuce, H. Toprak Kesgin, M. Fatih Amasyali

专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments in Turkish language, 2024 8th International Artificial Intelligence and Data Processing Symposium (IDAP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16718 2024-11-20 cs.CV cs.AI cs.CL cs.LG cs.RO 82%

Vision-Language Model Fine-Tuning via Simple Parameter-Efficient Modification

Ming Li, Jike Zhong, Chenxin Li, Liuzhuozheng Li, Nie Lin, Masashi Sugiyama

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments EMNLP 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03827 2024-11-07 cs.HC 82%

DesignMinds: Enhancing Video-Based Design Ideation with Vision-Language Model and Context-Injected Large Language Model

Tianhao He, Andrija Stankovic, Evangelos Niforatos, Gerd Kortuem

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22736 2024-10-31 cs.CL 82%

Constructing Multimodal Datasets from Scratch for Rapid Development of a Japanese Visual Language Model

Keito Sasagawa, Koki Maeda, Issa Sugiura, Shuhei Kurita, Naoaki Okazaki, Daisuke Kawahara

专题命中 VLM训练与架构 :visual language model(title,abstract);VLM(abstract)

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04821 2024-10-04 cs.RO 82%

VLM-MPC: Vision Language Foundation Model (VLM)-Guided Model Predictive Controller (MPC) for Autonomous Driving

Keke Long, Haotian Shi, Jiaxi Liu, Xiaopeng Li

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05885 2024-10-03 cs.RO 82%

VLM-Auto: VLM-based Autonomous Driving Assistant with Human-like Behavior and Understanding for Complex Road Scenes

Ziang Guo, Zakhar Yagudin, Artem Lykov, Mikhail Konenkov, Dzmitry Tsetserukou

专题命中 VLM训练与架构 :VLM(title,abstract);visual language model(abstract)

Comments The paper is accepted by the IEEE conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09276 2024-09-17 cs.RO 82%

Visuo-Tactile Zero-Shot Object Recognition with Vision-Language Model

Shiori Ueda, Atsushi Hashimoto, Masashi Hamaya, Kazutoshi Tanaka, Hideo Saito

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract)

Comments 9 pages, 9 figures, accepted to IROS2024, project page: https://omron-sinicx.github.io/visuo-tactile-recognition/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02958 2024-09-06 cs.CV cs.AI cs.LG 82%

Multi-Modal Adapter for Vision-Language Models

Dominykas Seputis, Serghei Mihailov, Soham Chatterjee, Zehao Xiao

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03735 2024-08-08 cs.CV cs.AI cs.LG 82%

Advancing Multimodal Large Language Models with Quantization-Aware Scale Learning for Efficient Adaptation

Jingjing Xie, Yuxin Zhang, Mingbao Lin, Liujuan Cao, Rongrong Ji

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by ACMMM2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10870 2024-07-16 cs.CV cs.AI cs.HC cs.LG 82%

GPT Sonograpy: Hand Gesture Decoding from Forearm Ultrasound Images via VLM

Keshav Bimbraw, Ye Wang, Jing Liu, Toshiaki Koike-Akino

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19578 2024-07-01 cs.CV cs.AI cs.CL cs.LG 82%

PathAlign: A vision-language model for whole slide images in histopathology

Faruk Ahmed, Andrew Sellergren, Lin Yang, Shawn Xu, Boris Babenko, Abbi Ward, Niels Olson, Arash Mohtashamian, Yossi Matias, Greg S. Corrado, Quang Duong, Dale R. Webster, Shravya Shetty, Daniel Golden, Yun Liu, David F. Steiner, Ellery Wulczyn

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments 9 main pages and 19 pages of supplemental material; 3 main tables, 3 main figures and 11 supplemental tables, 7 supplemental figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10502 2024-06-18 cs.LG cs.AI cs.CV 82%

Candidate Pseudolabel Learning: Enhancing Vision-Language Models by Prompt Tuning with Unlabeled Data

Jiahan Zhang, Qi Wei, Feng Liu, Lei Feng

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by ICML2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05130 2024-06-10 cs.CL 82%

An Empirical Study on Parameter-Efficient Fine-Tuning for MultiModal Large Language Models

Xiongtao Zhou, Jie He, Yuhua Ke, Guangyao Zhu, Víctor Gutiérrez-Basulto, Jeff Z. Pan

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract)

Comments ACL finding 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04050 2024-06-04 cs.LG cs.AI cs.CV 82%

Connecting the Dots: Collaborative Fine-tuning for Black-Box Vision-Language Models

Zhengbo Wang, Jian Liang, Ran He, Zilei Wang, Tieniu Tan

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11207 2024-04-18 cs.CV cs.AI cs.LG 82%

Exploring the Transferability of Visual Prompting for Multimodal Large Language Models

Yichi Zhang, Yinpeng Dong, Siyuan Zhang, Tianzan Min, Hang Su, Jun Zhu

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted in CVPR 2024 as Poster (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11046 2024-04-18 cs.AI cs.CV cs.LG 82%

Lightweight Unsupervised Federated Learning with Pretrained Vision Language Model

Hao Yan, Yuhong Guo

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19837 2024-04-12 cs.LG cs.AI cs.CL cs.CV cs.LO 82%

Concept-based Analysis of Neural Networks via Vision-Language Models

Ravi Mangal, Nina Narodytska, Divya Gopinath, Boyue Caroline Hu, Anirban Roy, Susmit Jha, Corina Pasareanu

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04394 2024-04-04 cs.MM cs.SD eess.AS 82%

SonicVisionLM: Playing Sound with Vision Language Models

Zhifeng Xie, Shengye Yu, Qile He, Mengtian Li

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract)

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09454 2024-01-19 cs.CV cs.AI cs.CL cs.LG 82%

Voila-A: Aligning Vision-Language Models with User's Gaze Attention

Kun Yan, Lei Ji, Zeyu Wang, Yuntao Wang, Nan Duan, Shuai Ma

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06591 2024-01-15 cs.CL 82%

Prometheus-Vision: Vision-Language Model as a Judge for Fine-Grained Evaluation

Seongyun Lee, Seungone Kim, Sue Hyun Park, Geewook Kim, Minjoon Seo

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract)

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01564 2023-12-05 cs.LG cs.AI cs.CL cs.CV 82%

APoLLo: Unified Adapter and Prompt Learning for Vision Language Models

Sanjoy Chowdhury, Sayan Nag, Dinesh Manocha

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at EMNLP 2023 (Main track)

详情

展开后加载摘要…

URL PDF HTML 收藏