arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1583 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1583 篇

2403.12037 2024-03-20 cs.CV 57%

MineDreamer: Learning to Follow Instructions via Chain-of-Imagination for Simulated-World Control

Enshen Zhou, Yiran Qin, Zhenfei Yin, Yuzhou Huang, Ruimao Zhang, Lu Sheng, Yu Qiao, Jing Shao

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Project page: https://sites.google.com/view/minedreamer/main

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16640 2024-03-19 cs.CV cs.HC 57%

EmoCLIP: A Vision-Language Method for Zero-Shot Video Facial Expression Recognition

Niki Maria Foteinopoulou, Ioannis Patras

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted at FG'2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10245 2024-03-18 cs.CV 57%

CoLeCLIP: Open-Domain Continual Learning via Joint Task Prompt and Vocabulary Learning

Yukun Li, Guansong Pang, Wei Suo, Chenchen Jing, Yuling Xi, Lingqiao Liu, Hao Chen, Guoqiang Liang, Peng Wang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06946 2024-03-12 cs.CV 57%

Split to Merge: Unifying Separated Modalities for Unsupervised Domain Adaptation

Xinyao Li, Yuke Li, Zhekai Du, Fengling Li, Ke Lu, Jingjing Li

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments CVPR 2024 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06453 2024-03-12 cs.CV cs.GR 57%

FontCLIP: A Semantic Typography Visual-Language Model for Multilingual Font Applications

Yuki Tatsukawa, I-Chao Shen, Anran Qi, Yuki Koyama, Takeo Igarashi, Ariel Shamir

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments 11 pages. Eurographics 2024. https://yukistavailable.github.io/fontclip.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06295 2024-03-12 cs.CV 57%

A streamlined Approach to Multimodal Few-Shot Class Incremental Learning for Fine-Grained Datasets

Thang Doan, Sima Behpour, Xin Li, Wenbin He, Liang Gou, Liu Ren

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05124 2024-03-11 cs.CV 57%

CLIP-Gaze: Towards General Gaze Estimation via Visual-Linguistic Model

Pengwei Yin, Guanzhong Zeng, Jingjing Wang, Di Xie

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted to AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03715 2024-03-07 cs.CV 57%

MeaCap: Memory-Augmented Zero-shot Image Captioning

Zequn Zeng, Yan Xie, Hao Zhang, Chiyu Chen, Zhengjue Wang, Bo Chen

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02899 2024-03-06 cs.AI 57%

Domain-Agnostic Mutual Prompting for Unsupervised Domain Adaptation

Zhekai Du, Xinyao Li, Fengling Li, Ke Lu, Lei Zhu, Jingjing Li

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02714 2024-03-06 cs.CV 57%

DomainVerse: A Benchmark Towards Real-World Distribution Shifts For Tuning-Free Adaptive Domain Generalization

Feng Hou, Jin Yuan, Ying Yang, Yang Liu, Yang Zhang, Cheng Zhong, Zhongchao Shi, Jianping Fan, Yong Rui, Zhiqiang He

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Currently in review for ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00967 2024-02-21 cs.RO cs.AI cs.CL 57%

Vision-Language Interpreter for Robot Task Planning

Keisuke Shirai, Cristian C. Beltran-Hernandez, Masashi Hamaya, Atsushi Hashimoto, Shohei Tanaka, Kento Kawaharazuka, Kazutoshi Tanaka, Yoshitaka Ushiku, Shinsuke Mori

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

Comments ICRA 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15072 2024-02-20 cs.CV cs.MM 57%

PathAsst: A Generative Foundation AI Assistant Towards Artificial General Intelligence of Pathology

Yuxuan Sun, Chenglu Zhu, Sunyi Zheng, Kai Zhang, Lin Sun, Zhongyi Shui, Yunlong Zhang, Honglin Li, Lin Yang

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06015 2024-02-16 cs.CL cs.CV 57%

Exploring Visual Culture Awareness in GPT-4V: A Comprehensive Probing

Yong Cao, Wenyan Li, Jiaang Li, Yifei Yuan, Antonia Karamolegkou, Daniel Hershcovich

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments work in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02814 2024-02-02 cs.RO cs.CV 57%

Object-Centric Instruction Augmentation for Robotic Manipulation

Junjie Wen, Yichen Zhu, Minjie Zhu, Jinming Li, Zhiyuan Xu, Zhengping Che, Chaomin Shen, Yaxin Peng, Dong Liu, Feifei Feng, Jian Tang

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

Comments accepted to ICRA2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17881 2024-02-01 cs.CV 57%

PVLR: Prompt-driven Visual-Linguistic Representation Learning for Multi-Label Image Recognition

Hao Tan, Zichang Tan, Jun Li, Jun Wan, Zhen Lei

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17217 2024-02-01 cs.HC cs.CV 57%

GazeGPT: Augmenting Human Capabilities using Gaze-contingent Contextual AI for Smart Eyewear

Robert Konrad, Nitish Padmanaban, J. Gabriel Buckmaster, Kevin C. Boyle, Gordon Wetzstein

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Project video: https://youtu.be/AuDFHHTK_m8

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16420 2024-01-30 cs.CV cs.CL 57%

InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model

Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Bin Wang, Linke Ouyang, Xilin Wei, Songyang Zhang, Haodong Duan, Maosong Cao, Wenwei Zhang, Yining Li, Hang Yan, Yang Gao, Xinyue Zhang, Wei Li, Jingwen Li, Kai Chen, Conghui He, Xingcheng Zhang, Yu Qiao, Dahua Lin, Jiaqi Wang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Code and models are available at https://github.com/InternLM/InternLM-XComposer

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17891 2024-01-30 cs.CV 57%

The Rise of AI Language Pathologists: Exploring Two-level Prompt Learning for Few-shot Weakly-supervised Whole Slide Image Classification

Linhao Qu, Xiaoyuan Luo, Kexue Fu, Manning Wang, Zhijian Song

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10475 2024-01-26 cs.CV cs.MM 57%

CBVS: A Large-Scale Chinese Image-Text Benchmark for Real-World Short Video Search Scenarios

Xiangshuo Qiao, Xianxin Li, Xiaozhe Qu, Jie Zhang, Yang Liu, Yu Luo, Cihang Jin, Jin Ma

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06890 2024-01-17 cs.LG 57%

An Axiomatic Approach to Model-Agnostic Concept Explanations

Zhili Feng, Michal Moshkovitz, Dotan Di Castro, J. Zico Kolter

专题命中 其他VLM :vision language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00917 2024-01-15 cs.CV 57%

Vocabulary-free Image Classification

Alessandro Conti, Enrico Fini, Massimiliano Mancini, Paolo Rota, Yiming Wang, Elisa Ricci

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted at NeurIPS2023, 19 pages, 8 figures, code is available at https://github.com/altndrr/vic

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03641 2024-01-09 cs.RO cs.CV 57%

DME-Driver: Integrating Human Decision Logic and 3D Scene Perception in Autonomous Driving

Wencheng Han, Dongqian Guo, Cheng-Zhong Xu, Jianbing Shen

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02147 2024-01-05 cs.CL cs.CV 57%

Exploring Boundary of GPT-4V on Marine Analysis: A Preliminary Case Study

Ziqiang Zheng, Yiwei Chen, Jipeng Zhang, Tuan-Anh Vu, Huimin Zeng, Yue Him Wong Tim, Sai-Kit Yeung

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

Comments 51 pages, 36 figures, Repository: https://github.com/hkust-vgd/Marine_GPT-4V_Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07009 2023-12-18 cs.CV 57%

Vision-language Assisted Attribute Learning

Kongming Liang, Xinran Wang, Rui Wang, Donghui Gao, Ling Jin, Weidong Liu, Xiatian Zhu, Zhanyu Ma, Jun Guo

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by IEEE IC-NIDC 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07730 2023-12-13 cs.CV eess.IV 57%

Domain-Controlled Prompt Learning

Qinglong Cao, Zhengqin Xu, Yuntian Chen, Chao Ma, Xiaokang Yang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04679 2023-12-11 eess.IV cs.CV 57%

ConVRT: Consistent Video Restoration Through Turbulence with Test-time Optimization of Neural Video Representations

Haoming Cai, Jingxi Chen, Brandon Y. Feng, Weiyun Jiang, Mingyang Xie, Kevin Zhang, Ashok Veeraraghavan, Christopher Metzler

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments https://convrt-2024.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04655 2023-12-11 cs.CV 57%

ECLIPSE: A Resource-Efficient Text-to-Image Prior for Image Generations

Maitreya Patel, Changhoon Kim, Sheng Cheng, Chitta Baral, Yezhou Yang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Project Page: https://eclipse-t2i.vercel.app/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17737 2023-11-30 cs.CV cs.GR 57%

GenZI: Zero-Shot 3D Human-Scene Interaction Generation

Lei Li, Angela Dai

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Project page: https://craigleili.github.io/projects/genzi/ Video: https://youtu.be/ozfs6E0JIMY

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11695 2023-11-21 cs.CV 57%

Clarity ChatGPT: An Interactive and Adaptive Processing System for Image Restoration and Enhancement

Yanyan Wei, Zhao Zhang, Jiahuan Ren, Xiaogang Xu, Richang Hong, Yi Yang, Shuicheng Yan, Meng Wang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05729 2023-11-13 cs.CV 57%

GIPCOL: Graph-Injected Soft Prompting for Compositional Zero-Shot Learning

Guangyue Xu, Joyce Chai, Parisa Kordjamshidi

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments WACV24

详情

展开后加载摘要…

URL PDF HTML 收藏