arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4672 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4672 篇

2408.14342 2024-08-30 cs.CV physics.med-ph 57%

Dual-Domain CLIP-Assisted Residual Optimization Perception Model for Metal Artifact Reduction

Xinrui Zhang, Ailong Cai, Shaoyu Wang, Linyuan Wang, Zhizhong Zheng, Lei Li, Bin Yan

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 14 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15566 2024-08-29 cs.CV 57%

TagOOD: A Novel Approach to Out-of-Distribution Detection via Vision-Language Representations and Class Center Learning

Jinglun Li, Xinyu Zhou, Kaixun Jiang, Lingyi Hong, Pinxue Guo, Zhaoyu Chen, Weifeng Ge, Wenqiang Zhang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by ACMMM2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13898 2024-08-27 cs.CV 57%

Evaluating Attribute Comprehension in Large Vision-Language Models

Haiwen Zhang, Zixi Yang, Yuanzhi Liu, Xinran Wang, Zheqi He, Kongming Liang, Zhanyu Ma

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04145 2024-08-22 cs.CV 57%

ComKD-CLIP: Comprehensive Knowledge Distillation for Contrastive Language-Image Pre-traning Model

Yifan Chen, Xiaozhen Qiao, Zhe Sun, Xuelong Li

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments update

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05578 2024-08-22 cs.CV 57%

FALIP: Visual Prompt as Foveal Attention Boosts CLIP Zero-Shot Performance

Jiedong Zhuang, Jiaqi Hu, Lianrui Mu, Rui Hu, Xiaoyu Liang, Jiangnan Ye, Haoji Hu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by ECCV 2024, code released

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10433 2024-08-21 cs.CV 57%

CLIP-DPO: Vision-Language Models as a Source of Preference for Fixing Hallucinations in LVLMs

Yassine Ouali, Adrian Bulat, Brais Martinez, Georgios Tzimiropoulos

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07545 2024-08-21 cs.CV 57%

Vision-Language Dataset Distillation

Xindi Wu, Byron Zhang, Zhiwei Deng, Olga Russakovsky

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 31 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07440 2024-08-16 cs.CV 57%

BAPLe: Backdoor Attacks on Medical Foundational Models using Prompt Learning

Asif Hanif, Fahad Shamshad, Muhammad Awais, Muzammal Naseer, Fahad Shahbaz Khan, Karthik Nandakumar, Salman Khan, Rao Muhammad Anwer

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments MICCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05706 2024-08-13 cs.CV 57%

Decoder Pre-Training with only Text for Scene Text Recognition

Shuai Zhao, Yongkun Du, Zhineng Chen, Yu-Gang Jiang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02980 2024-08-07 cs.CV 57%

Sample-agnostic Adversarial Perturbation for Vision-Language Pre-training Models

Haonan Zheng, Wen Jiang, Xinyang Deng, Wenrui Li

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 13 pages, 8 figures, published in ACMMM2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02231 2024-08-06 cs.CV 57%

REVISION: Rendering Tools Enable Spatial Fidelity in Vision-Language Models

Agneet Chatterjee, Yiran Luo, Tejas Gokhale, Yezhou Yang, Chitta Baral

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted to ECCV 2024. Project Page : https://agneetchatterjee.com/revision/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02210 2024-08-06 cs.CV 57%

ExoViP: Step-by-step Verification and Exploration with Exoskeleton Modules for Compositional Visual Reasoning

Yuxuan Wang, Alan Yuille, Zhuowan Li, Zilong Zheng

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments To Appear at COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02192 2024-08-06 cs.CV 57%

Unsupervised Domain Adaption Harnessing Vision-Language Pre-training

Wenlve Zhou, Zhiheng Zhou

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10571 2024-08-06 cs.LG cs.CV 57%

Reinforcement Learning Friendly Vision-Language Model for Minecraft

Haobin Jiang, Junpeng Yue, Hao Luo, Ziluo Ding, Zongqing Lu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00644 2024-08-02 cs.CV 57%

Towards End-to-End Explainable Facial Action Unit Recognition via Vision-Language Joint Learning

Xuri Ge, Junchen Fu, Fuhai Chen, Shan An, Nicu Sebe, Joemon M. Jose

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 10 pages, 5 figures, 4 tables

Journal ref ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21771 2024-08-01 cs.CV 57%

Paying More Attention to Image: A Training-Free Method for Alleviating Hallucination in LVLMs

Shi Liu, Kecheng Zheng, Wei Chen

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21554 2024-08-01 cs.CV 57%

Conditioned Prompt-Optimization for Continual Deepfake Detection

Francesco Laiti, Benedetta Liberatori, Thomas De Min, Elisa Ricci

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted at ICPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21328 2024-08-01 eess.IV cs.CV 57%

Knowledge-Guided Prompt Learning for Lifespan Brain MR Image Segmentation

Lin Teng, Zihao Zhao, Jiawei Huang, Zehong Cao, Runqi Meng, Feng Shi, Dinggang Shen

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20928 2024-07-31 cs.CV 57%

UniProcessor: A Text-induced Unified Low-level Image Processor

Huiyu Duan, Xiongkuo Min, Sijing Wu, Wei Shen, Guangtao Zhai

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20920 2024-07-31 cs.CV 57%

SSPA: Split-and-Synthesize Prompting with Gated Alignments for Multi-Label Image Recognition

Hao Tan, Zichang Tan, Jun Li, Jun Wan, Zhen Lei, Stan Z. Li

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20228 2024-07-30 cs.CV 57%

FlexAttention for Efficient High-Resolution Vision-Language Models

Junyan Li, Delin Chen, Tianle Cai, Peihao Chen, Yining Hong, Zhenfang Chen, Yikang Shen, Chuang Gan

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06048 2024-07-30 cs.CV cs.CY cs.LG 57%

How Does Fine-Tuning Impact Out-of-Distribution Detection for Vision-Language Models?

Yifei Ming, Yixuan Li

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted to IJCV 2023

Journal ref International Journal of Computer Vision 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18121 2024-07-26 cs.CV 57%

Efficient Inference of Vision Instruction-Following Models with Elastic Cache

Zuyan Liu, Benlin Liu, Jiahui Wang, Yuhao Dong, Guangyi Chen, Yongming Rao, Ranjay Krishna, Jiwen Lu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13129 2024-07-26 cs.CV cs.RO 57%

Better Call SAL: Towards Learning to Segment Anything in Lidar

Aljoša Ošep, Tim Meinhardt, Francesco Ferroni, Neehar Peri, Deva Ramanan, Laura Leal-Taixé

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14563 2024-07-23 cs.CV 57%

Learning Visual Grounding from Generative Vision and Language Model

Shijie Wang, Dahun Kim, Ali Taalimi, Chen Sun, Weicheng Kuo

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13808 2024-07-22 cs.CV 57%

CoAPT: Context Attribute words for Prompt Tuning

Gun Lee, Subin An, Sungyong Baik, Soochahn Lee

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12442 2024-07-18 cs.CV 57%

ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference

Mengcheng Lan, Chaofeng Chen, Yiping Ke, Xinjiang Wang, Litong Feng, Wayne Zhang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted to ECCV 2024. code available at https://github.com/mc- lan/ClearCLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17507 2024-07-17 cs.CV 57%

HYPE: Hyperbolic Entailment Filtering for Underspecified Images and Texts

Wonjae Kim, Sanghyuk Chun, Taekyung Kim, Dongyoon Han, Sangdoo Yun

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments ECCV 2024; 33pages, 4.5MB

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11001 2024-07-17 cs.CL cs.LG 57%

Generative AI Systems: A Systems-based Perspective on Generative AI

Jakub M. Tomczak

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16497 2024-07-16 cs.CV cs.LG 57%

PathoTune: Adapting Visual Foundation Model to Pathological Specialists

Jiaxuan Lu, Fang Yan, Xiaofan Zhang, Yue Gao, Shaoting Zhang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments MICCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏