arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2402.19150 2024-09-20 cs.CV 57%

Unveiling Typographic Deceptions: Insights of the Typographic Vulnerability in Large Vision-Language Model

Hao Cheng, Erjia Xiao, Jindong Gu, Le Yang, Jinhao Duan, Jize Zhang, Jiahang Cao, Kaidi Xu, Renjing Xu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments This paper is accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07048 2024-09-12 cs.CV 57%

Pushing the Limits of Vision-Language Models in Remote Sensing without Human Annotations

Keumgang Cha, Donggeun Yu, Junghoon Seo

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments This study was primarily conducted during the latter half of 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05772 2024-09-10 cs.MM 57%

A CLIP-based siamese approach for meme classification

Javier Huertas-Tato, Christos Koutlis, Symeon Papadopoulos, David Camacho, Ioannis Kompatsiaris

专题命中 图文多模态 :cross-modal(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04693 2024-09-10 cs.AI 57%

MuAP: Multi-step Adaptive Prompt Learning for Vision-Language Model with Missing Modality

Ruiting Dai, Yuqiao Tan, Lisi Mo, Tao He, Ke Qin, Shuang Liang

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03868 2024-09-09 cs.CV 57%

Few-shot Adaptation of Medical Vision-Language Models

Fereshteh Shakeri, Yunshi Huang, Julio Silva-Rodríguez, Houda Bahig, An Tang, Jose Dolz, Ismail Ben Ayed

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments MICCAI 2024 (Spotlight) - Code is available at https://github.com/FereshteShakeri/few-shot-MedVLMs.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14401 2024-09-04 cs.CV 57%

Pensieve: Retrospect-then-Compare Mitigates Visual Hallucination

Dingchen Yang, Bowen Cao, Guang Chen, Changjun Jiang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16986 2024-09-02 cs.CV 57%

AdaptVision: Dynamic Input Scaling in MLLMs for Versatile Scene Understanding

Yonghui Wang, Wengang Zhou, Hao Feng, Houqiang Li

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16827 2024-09-02 cs.CV 57%

Fluent and Accurate Image Captioning with a Self-Trained Reward Model

Nicholas Moratelli, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments ICPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16769 2024-08-30 cs.CV cs.CR 57%

PromptSmooth: Certifying Robustness of Medical Vision-Language Models via Prompt Learning

Noor Hussein, Fahad Shamshad, Muzammal Naseer, Karthik Nandakumar

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted to MICCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14342 2024-08-30 cs.CV physics.med-ph 57%

Dual-Domain CLIP-Assisted Residual Optimization Perception Model for Metal Artifact Reduction

Xinrui Zhang, Ailong Cai, Shaoyu Wang, Linyuan Wang, Zhizhong Zheng, Lei Li, Bin Yan

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 14 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15566 2024-08-29 cs.CV 57%

TagOOD: A Novel Approach to Out-of-Distribution Detection via Vision-Language Representations and Class Center Learning

Jinglun Li, Xinyu Zhou, Kaixun Jiang, Lingyi Hong, Pinxue Guo, Zhaoyu Chen, Weifeng Ge, Wenqiang Zhang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by ACMMM2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13898 2024-08-27 cs.CV 57%

Evaluating Attribute Comprehension in Large Vision-Language Models

Haiwen Zhang, Zixi Yang, Yuanzhi Liu, Xinran Wang, Zheqi He, Kongming Liang, Zhanyu Ma

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04145 2024-08-22 cs.CV 57%

ComKD-CLIP: Comprehensive Knowledge Distillation for Contrastive Language-Image Pre-traning Model

Yifan Chen, Xiaozhen Qiao, Zhe Sun, Xuelong Li

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments update

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05578 2024-08-22 cs.CV 57%

FALIP: Visual Prompt as Foveal Attention Boosts CLIP Zero-Shot Performance

Jiedong Zhuang, Jiaqi Hu, Lianrui Mu, Rui Hu, Xiaoyu Liang, Jiangnan Ye, Haoji Hu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by ECCV 2024, code released

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10433 2024-08-21 cs.CV 57%

CLIP-DPO: Vision-Language Models as a Source of Preference for Fixing Hallucinations in LVLMs

Yassine Ouali, Adrian Bulat, Brais Martinez, Georgios Tzimiropoulos

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07545 2024-08-21 cs.CV 57%

Vision-Language Dataset Distillation

Xindi Wu, Byron Zhang, Zhiwei Deng, Olga Russakovsky

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 31 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07440 2024-08-16 cs.CV 57%

BAPLe: Backdoor Attacks on Medical Foundational Models using Prompt Learning

Asif Hanif, Fahad Shamshad, Muhammad Awais, Muzammal Naseer, Fahad Shahbaz Khan, Karthik Nandakumar, Salman Khan, Rao Muhammad Anwer

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments MICCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05706 2024-08-13 cs.CV 57%

Decoder Pre-Training with only Text for Scene Text Recognition

Shuai Zhao, Yongkun Du, Zhineng Chen, Yu-Gang Jiang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02980 2024-08-07 cs.CV 57%

Sample-agnostic Adversarial Perturbation for Vision-Language Pre-training Models

Haonan Zheng, Wen Jiang, Xinyang Deng, Wenrui Li

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 13 pages, 8 figures, published in ACMMM2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02231 2024-08-06 cs.CV 57%

REVISION: Rendering Tools Enable Spatial Fidelity in Vision-Language Models

Agneet Chatterjee, Yiran Luo, Tejas Gokhale, Yezhou Yang, Chitta Baral

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted to ECCV 2024. Project Page : https://agneetchatterjee.com/revision/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02210 2024-08-06 cs.CV 57%

ExoViP: Step-by-step Verification and Exploration with Exoskeleton Modules for Compositional Visual Reasoning

Yuxuan Wang, Alan Yuille, Zhuowan Li, Zilong Zheng

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments To Appear at COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02192 2024-08-06 cs.CV 57%

Unsupervised Domain Adaption Harnessing Vision-Language Pre-training

Wenlve Zhou, Zhiheng Zhou

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10571 2024-08-06 cs.LG cs.CV 57%

Reinforcement Learning Friendly Vision-Language Model for Minecraft

Haobin Jiang, Junpeng Yue, Hao Luo, Ziluo Ding, Zongqing Lu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00644 2024-08-02 cs.CV 57%

Towards End-to-End Explainable Facial Action Unit Recognition via Vision-Language Joint Learning

Xuri Ge, Junchen Fu, Fuhai Chen, Shan An, Nicu Sebe, Joemon M. Jose

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 10 pages, 5 figures, 4 tables

Journal ref ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21771 2024-08-01 cs.CV 57%

Paying More Attention to Image: A Training-Free Method for Alleviating Hallucination in LVLMs

Shi Liu, Kecheng Zheng, Wei Chen

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21554 2024-08-01 cs.CV 57%

Conditioned Prompt-Optimization for Continual Deepfake Detection

Francesco Laiti, Benedetta Liberatori, Thomas De Min, Elisa Ricci

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted at ICPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21328 2024-08-01 eess.IV cs.CV 57%

Knowledge-Guided Prompt Learning for Lifespan Brain MR Image Segmentation

Lin Teng, Zihao Zhao, Jiawei Huang, Zehong Cao, Runqi Meng, Feng Shi, Dinggang Shen

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20928 2024-07-31 cs.CV 57%

UniProcessor: A Text-induced Unified Low-level Image Processor

Huiyu Duan, Xiongkuo Min, Sijing Wu, Wei Shen, Guangtao Zhai

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20920 2024-07-31 cs.CV 57%

SSPA: Split-and-Synthesize Prompting with Gated Alignments for Multi-Label Image Recognition

Hao Tan, Zichang Tan, Jun Li, Jun Wan, Zhen Lei, Stan Z. Li

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20228 2024-07-30 cs.CV 57%

FlexAttention for Efficient High-Resolution Vision-Language Models

Junyan Li, Delin Chen, Tianle Cai, Peihao Chen, Yining Hong, Zhenfang Chen, Yikang Shen, Chuang Gan

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏