arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4672 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4672 篇

2410.09382 2024-10-15 cs.CV 57%

CLIP-SCGI: Synthesized Caption-Guided Inversion for Person Re-Identification

Qianru Han, Xinwei He, Zhi Liu, Sannyuya Liu, Ying Zhang, Jinhai Xiang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09779 2024-10-15 cs.CV 57%

EAVL: Explicitly Align Vision and Language for Referring Image Segmentation

Yichen Yan, Xingjian He, Wenxuan Wang, Sihan Chen, Jing Liu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments 10 pages, 4 figures. arXiv admin note: text overlap with arXiv:2305.14969

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08895 2024-10-14 cs.CV 57%

Calibrated Cache Model for Few-Shot Vision-Language Model Adaptation

Kun Ding, Qiang Yu, Haojian Zhang, Gaofeng Meng, Shiming Xiang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments submitted to IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06626 2024-10-10 cs.CV 57%

Open-RGBT: Open-vocabulary RGB-T Zero-shot Semantic Segmentation in Open-world Environments

Meng Yu, Luojie Yang, Xunjie He, Yi Yang, Yufeng Yue

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06194 2024-10-10 cs.CV 57%

Prompting DirectSAM for Semantic Contour Extraction in Remote Sensing Images

Shiyu Miao, Delong Chen, Fan Liu, Chuanyi Zhang, Yanhui Gu, Shengjie Guo, Jun Zhou

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14206 2024-10-10 cs.CV 57%

LG-VQ: Language-Guided Codebook Learning

Guotao Liang, Baoquan Zhang, Yaowei Wang, Xutao Li, Yunming Ye, Huaibin Wang, Chuyao Luo, Kola Ye, linfeng Luo

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024

Journal ref NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04603 2024-10-08 cs.CV 57%

AWT: Transferring Vision-Language Models via Augmentation, Weighting, and Transportation

Yuhan Zhu, Yuyang Ji, Zhiyu Zhao, Gangshan Wu, Limin Wang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01407 2024-10-03 cs.CV 57%

AgriCLIP: Adapting CLIP for Agriculture and Livestock via Domain-Specialized Cross-Model Alignment

Umair Nawaz, Muhammad Awais, Hanan Gani, Muzammal Naseer, Fahad Khan, Salman Khan, Rao Muhammad Anwer

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01445 2024-10-03 cs.LG cs.CV 57%

FastCLIP: A Suite of Optimization Techniques to Accelerate CLIP Training with Limited Resources

Xiyuan Wei, Fanjiang Ye, Ori Yonay, Xingyu Chen, Baixi Sun, Dingwen Tao, Tianbao Yang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19389 2024-10-02 cs.CV 57%

OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding

Tao Zhang, Xiangtai Li, Hao Fei, Haobo Yuan, Shengqiong Wu, Shunping Ji, Chen Change Loy, Shuicheng Yan

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments NeurIPS-2024. Project page: https://lxtgh.github.io/project/omg_llava/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17663 2024-10-02 cs.LG cs.CV 57%

Finding Shared Decodable Concepts and their Negations in the Brain

Cory Efird, Alex Murphy, Joel Zylberberg, Alona Fyshe

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19899 2024-10-01 cs.CV 57%

OpenKD: Opening Prompt Diversity for Zero- and Few-shot Keypoint Detection

Changsheng Lu, Zheyuan Liu, Piotr Koniusz

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19696 2024-10-01 cs.LG cs.CV 57%

Vision-Language Models are Strong Noisy Label Detectors

Tong Wei, Hao-Tian Li, Chun-Shu Li, Jiang-Xin Shi, Yu-Feng Li, Min-Ling Zhang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19232 2024-10-01 cs.CV 57%

TrojVLM: Backdoor Attack Against Vision Language Models

Weimin Lyu, Lu Pang, Tengfei Ma, Haibin Ling, Chao Chen

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08787 2024-09-27 cs.CV 57%

Data Adaptive Traceback for Vision-Language Foundation Models in Image Classification

Wenshuo Peng, Kaipeng Zhang, Yue Yang, Hao Zhang, Yu Qiao

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 9 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15968 2024-09-25 cs.CV 57%

Adversarial Backdoor Defense in CLIP

Junhao Kuang, Siyuan Liang, Jiawei Liang, Kuanrong Liu, Xiaochun Cao

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06973 2024-09-24 cs.CV 57%

RWKV-CLIP: A Robust Vision-Language Representation Learner

Tiancheng Gu, Kaicheng Yang, Xiang An, Ziyong Feng, Dongnan Liu, Weidong Cai, Jiankang Deng

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 14 pages, 10 figures, EMNLP2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14083 2024-09-24 cs.CV 57%

SURf: Teaching Large Vision-Language Models to Selectively Utilize Retrieved Information

Jiashuo Sun, Jihai Zhang, Yucheng Zhou, Zhaochen Su, Xiaoye Qu, Yu Cheng

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 19 pages, 9 tables, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13540 2024-09-23 cs.CV 57%

FullAnno: A Data Engine for Enhancing Image Comprehension of MLLMs

Jing Hao, Yuxiang Zhao, Song Chen, Yanpeng Sun, Qiang Chen, Gang Zhang, Kun Yao, Errui Ding, Jingdong Wang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 7 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12612 2024-09-20 cs.CV 57%

Enhancing Perception of Key Changes in Remote Sensing Image Change Captioning

Cong Yang, Zuchao Li, Hongzan Jiao, Zhi Gao, Lefei Zhang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12580 2024-09-20 cs.CV 57%

LLMs Can Check Their Own Results to Mitigate Hallucinations in Traffic Understanding Tasks

Malsha Ashani Mahawatta Dona, Beatriz Cabrero-Daniel, Yinan Yu, Christian Berger

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments ICTSS 2024, 36th International Conference on Testing Software and Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.19150 2024-09-20 cs.CV 57%

Unveiling Typographic Deceptions: Insights of the Typographic Vulnerability in Large Vision-Language Model

Hao Cheng, Erjia Xiao, Jindong Gu, Le Yang, Jinhao Duan, Jize Zhang, Jiahang Cao, Kaidi Xu, Renjing Xu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments This paper is accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07048 2024-09-12 cs.CV 57%

Pushing the Limits of Vision-Language Models in Remote Sensing without Human Annotations

Keumgang Cha, Donggeun Yu, Junghoon Seo

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments This study was primarily conducted during the latter half of 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05772 2024-09-10 cs.MM 57%

A CLIP-based siamese approach for meme classification

Javier Huertas-Tato, Christos Koutlis, Symeon Papadopoulos, David Camacho, Ioannis Kompatsiaris

专题命中 图文多模态 :cross-modal(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04693 2024-09-10 cs.AI 57%

MuAP: Multi-step Adaptive Prompt Learning for Vision-Language Model with Missing Modality

Ruiting Dai, Yuqiao Tan, Lisi Mo, Tao He, Ke Qin, Shuang Liang

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03868 2024-09-09 cs.CV 57%

Few-shot Adaptation of Medical Vision-Language Models

Fereshteh Shakeri, Yunshi Huang, Julio Silva-Rodríguez, Houda Bahig, An Tang, Jose Dolz, Ismail Ben Ayed

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments MICCAI 2024 (Spotlight) - Code is available at https://github.com/FereshteShakeri/few-shot-MedVLMs.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14401 2024-09-04 cs.CV 57%

Pensieve: Retrospect-then-Compare Mitigates Visual Hallucination

Dingchen Yang, Bowen Cao, Guang Chen, Changjun Jiang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16986 2024-09-02 cs.CV 57%

AdaptVision: Dynamic Input Scaling in MLLMs for Versatile Scene Understanding

Yonghui Wang, Wengang Zhou, Hao Feng, Houqiang Li

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16827 2024-09-02 cs.CV 57%

Fluent and Accurate Image Captioning with a Self-Trained Reward Model

Nicholas Moratelli, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments ICPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16769 2024-08-30 cs.CV cs.CR 57%

PromptSmooth: Certifying Robustness of Medical Vision-Language Models via Prompt Learning

Noor Hussein, Fahad Shamshad, Muzammal Naseer, Karthik Nandakumar

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted to MICCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏