arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1583 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1583 篇

2502.18180 2025-02-28 cs.AI cs.MA 57%

ChatMotion: A Multimodal Multi-Agent for Human Motion Analysis

Lei Li, Sen Jia, Jianhao Wang, Zhaochong An, Jiaang Li, Jenq-Neng Hwang, Serge Belongie

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20635 2025-02-26 cs.RO cs.AI 57%

Autonomous Improvement of Instruction Following Skills via Foundation Models

Zhiyuan Zhou, Pranav Atreya, Abraham Lee, Homer Walke, Oier Mees, Sergey Levine

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

Comments 2024 Conference on Robot Learning (CoRL)

Journal ref Conference on Robot Learning 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09052 2025-02-25 eess.IV cs.LG 57%

Continual Test-Time Adaptation for Single Image Defocus Deblurring via Causal Siamese Networks

Shuang Cui, Yi Li, Jiangmeng Li, Xiongxin Tang, Bing Su, Fanjiang Xu, Hui Xiong

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

Journal ref International Journal of Computer Vision 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15457 2025-02-24 cs.CV 57%

Memory Helps, but Confabulation Misleads: Understanding Streaming Events in Videos with MLLMs

Gengyuan Zhang, Mingcong Ding, Tong Liu, Yao Zhang, Volker Tresp

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Short paper (5 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10575 2025-02-24 cs.CV 57%

MUSE: Mamba is Efficient Multi-scale Learner for Text-video Retrieval

Haoran Tang, Meng Cao, Jinfa Huang, Ruyang Liu, Peng Jin, Ge Li, Xiaodan Liang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13983 2025-02-21 eess.AS cs.AI 57%

Gesture-Aware Zero-Shot Speech Recognition for Patients with Language Disorders

Seungbae Kim, Daeun Lee, Brielle Stark, Jinyoung Han

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12081 2025-02-18 cs.CV cs.CL 57%

Unhackable Temporal Rewarding for Scalable Video MLLMs

En Yu, Kangheng Lin, Liang Zhao, Yana Wei, Zining Zhu, Haoran Wei, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Jingyu Wang, Wenbing Tao

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

Comments Accepted by ICLR2025. Project Page: https://ahnsun.github.io/UTR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03635 2025-02-14 cs.CV 57%

SSP-IR: Semantic and Structure Priors for Diffusion-based Realistic Image Restoration

Yuhong Zhang, Hengsheng Zhang, Zhengxue Cheng, Rong Xie, Li Song, Wenjun Zhang

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments To be published in IEEE TCSVT

Journal ref Y. Zhang, H. Zhang, Z. Cheng, R. Xie, L. Song and W. Zhang, "SSP-IR: Semantic and Structure Priors for Diffusion-based Realistic Image Restoration," in IEEE Transactions on Circuits and Systems for Video Technology, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11619 2025-02-11 cs.CV cs.CL 57%

MultiVENT 2.0: A Massive Multilingual Benchmark for Event-Centric Video Retrieval

Reno Kriz, Kate Sanders, David Etter, Kenton Murray, Cameron Carpenter, Kelly Van Ochten, Hannah Recknor, Jimena Guallar-Blasco, Alexander Martin, Ronald Colaianni, Nolan King, Eugene Yang, Benjamin Van Durme

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00426 2025-02-11 cs.CV 57%

TEST-V: TEst-time Support-set Tuning for Zero-shot Video Classification

Rui Yan, Jin Wang, Hongyu Qu, Xiaoyu Du, Dong Zhang, Jinhui Tang, Tieniu Tan

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13257 2025-02-06 cs.CV 57%

MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?

Yi-Fan Zhang, Huanyu Zhang, Haochen Tian, Chaoyou Fu, Shuangqing Zhang, Junfei Wu, Feng Li, Kun Wang, Qingsong Wen, Zhang Zhang, Liang Wang, Rong Jin, Tieniu Tan

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Project Page: https://mme-realworld.github.io/; accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11449 2025-02-04 cs.AI 57%

Enabling Small Models for Zero-Shot Selection and Reuse through Model Label Learning

Jia Zhang, Zhi Zhou, Lan-Zhe Guo, Yu-Feng Li

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16153 2025-01-28 cs.CL cs.CV 57%

Pangea: A Fully Open Multilingual Multimodal LLM for 39 Languages

Xiang Yue, Yueqi Song, Akari Asai, Seungone Kim, Jean de Dieu Nyandwi, Simran Khanuja, Anjali Kantharuban, Lintang Sutawika, Sathyanarayanan Ramamoorthy, Graham Neubig

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments 54 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05728 2025-01-17 cs.CV 57%

Super-class guided Transformer for Zero-Shot Attribute Classification

Sehyung Kim, Chanhyeong Yang, Jihwan Park, Taehoon Song, Hyunwoo J. Kim

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments AAAI25

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07898 2025-01-16 cs.CV 57%

A Foundation Language-Image Model of the Retina (FLAIR): Encoding Expert Knowledge in Text Supervision

Julio Silva-Rodríguez, Hadi Chakor, Riadh Kobbi, Jose Dolz, Ismail Ben Ayed

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted in Medical Image Analysis. The pre-trained model is available at: https://github.com/jusiro/FLAIR

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05884 2025-01-13 cs.CV 57%

Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs

Dabing Cheng, Haosen Zhan, Xingchen Zhao, Guisheng Liu, Zemin Li, Jinghui Xie, Zhao Song, Weiguo Feng, Bingyue Peng

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments 16pages conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19106 2025-01-09 cs.CV 57%

Detailed Object Description with Controllable Dimensions

Xinran Wang, Haiwen Zhang, Baoteng Li, Kongming Liang, Hao Sun, Zhongjiang He, Zhanyu Ma, Jun Guo

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00117 2025-01-09 cs.RO cs.LG 57%

Goal Representations for Instruction Following: A Semi-Supervised Language Interface to Control

Vivek Myers, Andre He, Kuan Fang, Homer Walke, Philippe Hansen-Estruch, Ching-An Cheng, Mihai Jalobeanu, Andrey Kolobov, Anca Dragan, Sergey Levine

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

Comments 15 pages, 5 figures

Journal ref Conference on Robot Learning (CoRL), 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02751 2025-01-07 eess.IV cs.CV cs.MM 57%

Ultrasound-QBench: Can LLMs Aid in Quality Assessment of Ultrasound Imaging?

Hongyi Miao, Jun Jia, Yankun Cao, Yingjie Zhou, Yanwei Jiang, Zhi Liu, Guangtao Zhai

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20916 2024-12-31 cs.CV 57%

Low-Light Image Enhancement via Generative Perceptual Priors

Han Zhou, Wei Dong, Xiaohong Liu, Yulun Zhang, Guangtao Zhai, Jun Chen

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18604 2024-12-25 cs.CV 57%

Explaining in Diffusion: Explaining a Classifier Through Hierarchical Semantics with Text-to-Image Diffusion Models

Tahira Kazimi, Ritika Allada, Pinar Yanardag

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11892 2024-12-18 cs.CV 57%

From 2D CAD Drawings to 3D Parametric Models: A Vision-Language Approach

Xilin Wang, Jia Zheng, Yuanchao Hu, Hao Zhu, Qian Yu, Zihan Zhou

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments To Appear in AAAI 2025. The project page is at https://manycore-research.github.io/CAD2Program

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12087 2024-12-17 cs.CV 57%

Instruction-based Image Manipulation by Watching How Things Move

Mingdeng Cao, Xuaner Zhang, Yinqiang Zheng, Zhihao Xia

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Project page: https://ljzycmd.github.io/projects/InstructMove/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10958 2024-12-17 cs.MM cs.CR cs.CV eess.IV 57%

Towards Effective User Attribution for Latent Diffusion Models via Watermark-Informed Blending

Yongyang Pan, Xiaohong Liu, Siqi Luo, Yi Xin, Xiao Guo, Xiaoming Liu, Xiongkuo Min, Guangtao Zhai

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09501 2024-12-13 cs.CV cs.MM 57%

Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition

Zhisheng Zhong, Chengyao Wang, Yuqi Liu, Senqiao Yang, Longxiang Tang, Yuechen Zhang, Jingyao Li, Tianyuan Qu, Yanwei Li, Yukang Chen, Shaozuo Yu, Sitong Wu, Eric Lo, Shu Liu, Jiaya Jia

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08388 2024-12-12 cs.CV 57%

LOMA: Language-assisted Semantic Occupancy Network via Triplane Mamba

Yubo Cui, Zhiheng Li, Jiaqiang Wang, Zheng Fang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by AAAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06184 2024-12-10 cs.CV 57%

Evaluating Model Perception of Color Illusions in Photorealistic Scenes

Lingjun Mao, Zineng Tang, Alane Suhr

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14229 2024-12-10 cs.RO cs.AI 57%

Words2Contact: Identifying Support Contacts from Verbal Instructions Using Foundation Models

Dionis Totsila, Quentin Rouxel, Jean-Baptiste Mouret, Serena Ivaldi

专题命中 其他VLM :vision language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05840 2024-12-10 cs.CV 57%

LVP-CLIP:Revisiting CLIP for Continual Learning with Label Vector Pool

Yue Ma, Huantao Ren, Boyu Wang, Jingang Jin, Senem Velipasalar, Qinru Qiu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments submitted to CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05756 2024-12-10 cs.CV 57%

Compositional Image Retrieval via Instruction-Aware Contrastive Learning

Wenliang Zhong, Weizhi An, Feng Jiang, Hehuan Ma, Yuzhi Guo, Junzhou Huang

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏