arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4672 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4672 篇

2404.08226 2024-04-15 cs.CV 57%

Improving Continuous Sign Language Recognition with Adapted Image Models

Lianyu Hu, Tongkai Shi, Liqing Gao, Zekang Liu, Wei Feng

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06918 2024-04-11 cs.CV 57%

HRVDA: High-Resolution Visual Document Assistant

Chaohu Liu, Kun Yin, Haoyu Cao, Xinghua Jiang, Xin Li, Yinsong Liu, Deqiang Jiang, Xing Sun, Linli Xu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted to CVPR 2024 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06244 2024-04-10 cs.CV 57%

Anchor-based Robust Finetuning of Vision-Language Models

Jinwei Han, Zhiwen Lin, Zhongyisun Sun, Yingguo Gao, Ke Yan, Shouhong Ding, Yuan Gao, Gui-Song Xia

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20330 2024-04-10 cs.CV 57%

Are We on the Right Way for Evaluating Large Vision-Language Models?

Lin Chen, Jinsong Li, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Zehui Chen, Haodong Duan, Jiaqi Wang, Yu Qiao, Dahua Lin, Feng Zhao

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Project page: https://mmstar-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05621 2024-04-09 cs.CV 57%

MULTIFLOW: Shifting Towards Task-Agnostic Vision-Language Pruning

Matteo Farina, Massimiliano Mancini, Elia Cunegatti, Gaowen Liu, Giovanni Iacca, Elisa Ricci

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04627 2024-04-09 cs.CV 57%

Self-Training Large Language Models for Improved Visual Program Synthesis With Visual Reinforcement

Zaid Khan, Vijay Kumar BG, Samuel Schulter, Yun Fu, Manmohan Chandraker

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03539 2024-04-05 cs.CV 57%

Is CLIP the main roadblock for fine-grained open-world perception?

Lorenzo Bianchi, Fabio Carrara, Nicola Messina, Fabrizio Falchi

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02460 2024-04-05 cs.CV 57%

Improved Zero-Shot Classification by Adapting VLMs with Text Descriptions

Oindrila Saha, Grant Van Horn, Subhransu Maji

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02415 2024-04-04 cs.CV 57%

What Are We Measuring When We Evaluate Large Vision-Language Models? An Analysis of Latent Factors and Biases

Anthony Meng Huat Tiong, Junqi Zhao, Boyang Li, Junnan Li, Steven C. H. Hoi, Caiming Xiong

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00909 2024-04-02 cs.CV 57%

Learning by Correction: Efficient Tuning Task for Zero-Shot Generative Vision-Language Reasoning

Rongjie Li, Yu Wu, Xuming He

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.11797 2024-04-02 cs.CV 57%

CAT-Seg: Cost Aggregation for Open-Vocabulary Semantic Segmentation

Seokju Cho, Heeseong Shin, Sunghwan Hong, Anurag Arnab, Paul Hongsuck Seo, Seungryong Kim

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted to CVPR 2024. Project page: https://ku-cvlab.github.io/CAT-Seg/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20078 2024-04-01 cs.CV cs.LG 57%

Negative Label Guided OOD Detection with Pretrained Vision-Language Models

Xue Jiang, Feng Liu, Zhen Fang, Hong Chen, Tongliang Liu, Feng Zheng, Bo Han

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments ICLR 2024 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19193 2024-03-29 cs.CV 57%

Text Data-Centric Image Captioning with Interactive Prompts

Yiyu Wang, Hao Luo, Jungang Xu, Yingfei Sun, Fan Wang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18996 2024-03-29 cs.CV 57%

Envisioning MedCLIP: A Deep Dive into Explainability for Medical Vision-Language Models

Anees Ur Rehman Hashmi, Dwarikanath Mahapatra, Mohammad Yaqub

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18572 2024-03-28 cs.SD eess.AS 57%

ACES: Evaluating Automated Audio Captioning Models on the Semantics of Sounds

Gijs Wijngaard, Elia Formisano, Bruno L. Giordano, Michel Dumontier

专题命中 图文多模态 :multimodal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17315 2024-03-26 cs.CV 57%

Explaining CLIP's performance disparities on data from blind/low vision users

Daniela Massiceti, Camilla Longden, Agnieszka Słowik, Samuel Wills, Martin Grayson, Cecily Morrison

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted at 2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.11100 2024-03-26 cs.CV 57%

Supporting Vision-Language Model Inference with Confounder-pruning Knowledge Prompt

Jiangmeng Li, Wenyi Mo, Wenwen Qiang, Bing Su, Changwen Zheng, Hui Xiong, Ji-Rong Wen

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11170 2024-03-25 cs.CV cs.CR 57%

Inducing High Energy-Latency of Large Vision-Language Models with Verbose Images

Kuofeng Gao, Yang Bai, Jindong Gu, Shu-Tao Xia, Philip Torr, Zhifeng Li, Wei Liu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted by ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11038 2024-03-25 cs.CV cs.LG 57%

UniChest: Conquer-and-Divide Pre-training for Multi-Source Chest X-Ray Classification

Tianjie Dai, Ruipeng Zhang, Feng Hong, Jiangchao Yao, Ya Zhang, Yanfeng Wang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted at IEEE Transactions on Medical Imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12966 2024-03-22 cs.CV 57%

Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models

Zuyan Liu, Yuhao Dong, Yongming Rao, Jie Zhou, Jiwen Lu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Project Page: https://sites.google.com/view/chain-of-spot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12596 2024-03-20 cs.CL 57%

Chart-based Reasoning: Transferring Capabilities from LLMs to VLMs

Victor Carbune, Hassan Mansoor, Fangyu Liu, Rahul Aralikatte, Gilles Baechler, Jindong Chen, Abhanshu Sharma

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

Comments Findings of NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11675 2024-03-19 cs.CV 57%

Better (pseudo-)labels for semi-supervised instance segmentation

François Porcher, Camille Couprie, Marc Szafraniec, Jakob Verbeek

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Appeared at the Practical ML for Low Resource Settings workshop at ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11550 2024-03-19 cs.CV 57%

TARN-VIST: Topic Aware Reinforcement Network for Visual Storytelling

Weiran Chen, Xin Li, Jiaqi Su, Guiqian Zhu, Ying Li, Yi Ji, Chunping Liu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.05657 2024-03-19 cs.CV 57%

Tag2Text: Guiding Vision-Language Model via Image Tagging

Xinyu Huang, Youcai Zhang, Jinyu Ma, Weiwei Tian, Rui Feng, Yuejie Zhang, Yaqian Li, Yandong Guo, Lei Zhang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07901 2024-03-14 cs.CV cs.LG 57%

MIP: CLIP-based Image Reconstruction from PEFT Gradients

Peiheng Zhou, Ming Hu, Xiaofei Xie, Yihao Huang, Kangjie Chen, Mingsong Chen

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07874 2024-03-13 cs.CV 57%

Beyond Text: Frozen Large Language Models in Visual Signal Comprehension

Lei Zhu, Fangyun Wei, Yanye Lu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15637 2024-03-13 cs.CV cs.GR 57%

Neural 3D Strokes: Creating Stylized 3D Scenes with Vectorized 3D Strokes

Hao-Bin Duan, Miao Wang, Yan-Xun Li, Yong-Liang Yang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted to CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17910 2024-03-12 cs.CV 57%

ControlCap: Controllable Region-level Captioning

Yuzhong Zhao, Yue Liu, Zonghao Guo, Weijia Wu, Chen Gong, Fang Wan, Qixiang Ye

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments https://github.com/callsys/ControlCap

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08255 2024-03-12 cs.CV 57%

Leveraging Vision-Language Models for Improving Domain Generalization in Image Classification

Sravanti Addepalli, Ashish Ramayee Asokan, Lakshay Sharma, R. Venkatesh Babu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Project page: http://val.cds.iisc.ac.in/VL2V-ADiP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05381 2024-03-11 cs.CV 57%

Exploring Robust Features for Few-Shot Object Detection in Satellite Imagery

Xavier Bou, Gabriele Facciolo, Rafael Grompone von Gioi, Jean-Michel Morel, Thibaud Ehret

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏