arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1583 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1583 篇

2407.05795 2024-07-10 cs.CV 57%

HyCIR: Boosting Zero-Shot Composed Image Retrieval with Synthetic Labels

Yingying Jiang, Hanchao Jia, Xiaobing Wang, Peng Hao

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19092 2024-07-09 cs.CV 57%

Benchmarking and Improving Detail Image Caption

Hongyuan Dong, Jiawen Li, Bohong Wu, Jiacong Wang, Yuan Zhang, Haoyuan Guo

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03636 2024-07-08 cs.CV 57%

Diff-Restorer: Unleashing Visual Prompts for Diffusion-based Universal Image Restoration

Yuhong Zhang, Hengsheng Zhang, Xinning Chai, Zhengxue Cheng, Rong Xie, Li Song, Wenjun Zhang

专题命中 其他VLM :visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01842 2024-07-03 cs.CV 57%

CLIP the Divergence: Language-guided Unsupervised Domain Adaptation

Jinjing Zhu, Yucheng Chen, Lin Wang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01155 2024-07-02 cs.LG 57%

CPT: Consistent Proxy Tuning for Black-box Optimization

Yuanyang He, Zitong Huang, Xinxing Xu, Rick Siow Mong Goh, Salman Khan, Wangmeng Zuo, Yong Liu, Chun-Mei Feng

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

Comments 10 pages,2 figures plus supplementary materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14676 2024-07-02 cs.CV cs.GR 57%

DreamPBR: Text-driven Generation of High-resolution SVBRDF with Multi-modal Guidance

Linxuan Xin, Zheng Zhang, Jinfu Wei, Wei Gao, Duan Gao

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments 16 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16476 2024-06-25 cs.CV 57%

ResMaster: Mastering High-Resolution Image Generation via Structural and Fine-Grained Guidance

Shuwei Shi, Wenbo Li, Yuechen Zhang, Jingwen He, Biao Gong, Yinqiang Zheng

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05760 2024-06-25 cs.CV cs.CL 57%

Similarity Guided Multimodal Fusion Transformer for Semantic Location Prediction in Social Media

Zhizhen Zhang, Ning Wang, Haojie Li, Zhihui Wang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02415 2024-06-18 cs.AI 57%

Biologically-Motivated Learning Model for Instructed Visual Processing

Roy Abel, Shimon Ullman

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08572 2024-06-14 cs.CV 57%

LLM-assisted Concept Discovery: Automatically Identifying and Explaining Neuron Functions

Nhat Hoang-Xuan, Minh Vu, My T. Thai

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07236 2024-06-12 cs.LG 57%

Let Go of Your Labels with Unsupervised Transfer

Artyom Gadetsky, Yulun Jiang, Maria Brbic

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

Comments ICML 2024 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01449 2024-06-04 cs.CV 57%

SLANT: Spurious Logo ANalysis Toolkit

Maan Qraitem, Piotr Teterwak, Kate Saenko, Bryan A. Plummer

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03161 2024-06-04 cs.CV cs.CL 57%

Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization

Yang Jin, Zhicheng Sun, Kun Xu, Kun Xu, Liwei Chen, Hao Jiang, Quzhe Huang, Chengru Song, Yuliang Liu, Di Zhang, Yang Song, Kun Gai, Yadong Mu

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19267 2024-05-24 cs.CL cs.AI 57%

MineLand: Simulating Large-Scale Multi-Agent Interactions with Limited Multimodal Senses and Physical Needs

Xianhao Yu, Jiaqi Fu, Renjia Deng, Wenjuan Han

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

Comments Project website: https://github.com/cocacola-lab/MineLand

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10140 2024-05-17 cs.CV 57%

Libra: Building Decoupled Vision System on Large Language Models

Yifan Xu, Xiaoshan Yang, Yaguang Song, Changsheng Xu

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

Comments ICML2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02234 2024-05-08 cs.CV 57%

3DTopia: Large Text-to-3D Generation Model with Hybrid Diffusion Priors

Fangzhou Hong, Jiaxiang Tang, Ziang Cao, Min Shi, Tong Wu, Zhaoxi Chen, Shuai Yang, Tengfei Wang, Liang Pan, Dahua Lin, Ziwei Liu

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

Comments Code available at https://github.com/3DTopia/3DTopia

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01926 2024-05-06 cs.CV 57%

Auto-Encoding Morph-Tokens for Multimodal LLM

Kaihang Pan, Siliang Tang, Juncheng Li, Zhaoyu Fan, Wei Chow, Shuicheng Yan, Tat-Seng Chua, Yueting Zhuang, Hanwang Zhang

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

Comments Accepted by ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19644 2024-05-01 cs.CV 57%

MetaCoCo: A New Few-Shot Classification Benchmark with Spurious Correlation

Min Zhang, Haoxuan Li, Fei Wu, Kun Kuang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments ICLR 24

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.16794 2024-04-15 cs.CV 57%

ZONE: Zero-Shot Instruction-Guided Local Editing

Shanglin Li, Bohan Zeng, Yutang Feng, Sicheng Gao, Xuhui Liu, Jiaming Liu, Li Lin, Xu Tang, Yao Hu, Jianzhuang Liu, Baochang Zhang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted at CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07177 2024-04-11 cs.LG 57%

Scaling Laws for Data Filtering -- Data Curation cannot be Compute Agnostic

Sachin Goyal, Pratyush Maini, Zachary C. Lipton, Aditi Raghunathan, J. Zico Kolter

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

Comments Published at CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07853 2024-04-09 cs.CL cs.LG 57%

Learning Mutually Informed Representations for Characters and Subwords

Yilin Wang, Xinyi Hu, Matthew R. Gormley

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.19326 2024-04-08 cs.CV 57%

Generalizable Whole Slide Image Classification with Fine-Grained Visual-Semantic Interaction

Hao Li, Ying Chen, Yifei Chen, Wenxian Yang, Bowen Ding, Yuchen Han, Liansheng Wang, Rongshan Yu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08046 2024-04-08 cs.CV 57%

Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding

Peng Jin, Ryuichi Takanobu, Wancai Zhang, Xiaochun Cao, Li Yuan

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by CVPR 2024 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03413 2024-04-05 cs.CV 57%

MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens

Kirolos Ataallah, Xiaoqian Shen, Eslam Abdelrahman, Essam Sleiman, Deyao Zhu, Jian Ding, Mohamed Elhoseiny

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments 6 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03042 2024-04-05 cs.CV 57%

AWOL: Analysis WithOut synthesis using Language

Silvia Zuffi, Michael J. Black

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02460 2024-04-05 cs.CV 57%

Improved Zero-Shot Classification by Adapting VLMs with Text Descriptions

Oindrila Saha, Grant Van Horn, Subhransu Maji

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.04936 2024-04-04 cs.CV 57%

EarthNets: Empowering AI in Earth Observation

Zhitong Xiong, Fahong Zhang, Yi Wang, Yilei Shi, Xiao Xiang Zhu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00710 2024-04-02 cs.CV 57%

Unknown Prompt, the only Lacuna: Unveiling CLIP's Potential for Open Domain Generalization

Mainak Singha, Ankit Jha, Shirsha Bose, Ashwin Nair, Moloud Abdar, Biplab Banerjee

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted in CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13600 2024-03-21 cs.CV 57%

VL-Mamba: Exploring State Space Models for Multimodal Learning

Yanyuan Qiao, Zheng Yu, Longteng Guo, Sihan Chen, Zijia Zhao, Mingzhen Sun, Qi Wu, Jing Liu

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13343 2024-03-21 cs.CV 57%

TiBiX: Leveraging Temporal Information for Bidirectional X-ray and Report Generation

Santosh Sanjeev, Fadillah Adamsyah Maani, Arsen Abzhanov, Vijay Ram Papineni, Ibrahim Almakky, Bartłomiej W. Papież, Mohammad Yaqub

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏