arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4672 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4672 篇

2407.08811 2024-07-15 eess.IV cs.CV 57%

CXR-Agent: Vision-language models for chest X-ray interpretation with uncertainty aware radiology reporting

Naman Sharma

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Supervised by Professor Ben Glocker

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09377 2024-07-15 cs.CV 57%

Introducing Routing Functions to Vision-Language Parameter-Efficient Fine-Tuning with Low-Rank Bottlenecks

Tingyu Qu, Tinne Tuytelaars, Marie-Francine Moens

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08156 2024-07-12 cs.CV 57%

AddressCLIP: Empowering Vision-Language Models for City-wide Image Address Localization

Shixiong Xu, Chenghao Zhang, Lubin Fan, Gaofeng Meng, Shiming Xiang, Jieping Ye

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03623 2024-07-12 cs.CV 57%

Resampled Datasets Are Not Enough: Mitigating Societal Bias Beyond Single Attributes

Yusuke Hirota, Jerone T. A. Andrews, Dora Zhao, Orestis Papakyriakopoulos, Apostolos Modas, Yuta Nakashima, Alice Xiang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00927 2024-07-12 cs.LG cs.AI stat.ML 57%

Understanding Transferable Representation Learning and Zero-shot Transfer in CLIP

Zixiang Chen, Yihe Deng, Yuanzhi Li, Quanquan Gu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI

Comments 31 pages, 7 tables, 6 figures. In ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07360 2024-07-11 cs.CV cs.LG 57%

Towards a text-based quantitative and explainable histopathology image analysis

Anh Tien Nguyen, Trinh Thi Le Vuong, Jin Tae Kwak

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments MICCAI 2024 - Early acceptance (Top 11%)

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.07341 2024-07-10 cs.LG cs.CR cs.CV 57%

Does CLIP Know My Face?

Dominik Hintersdorf, Lukas Struppek, Manuel Brack, Felix Friedrich, Patrick Schramowski, Kristian Kersting

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Published in the Journal of Artificial Intelligence Research (JAIR)

Journal ref Journal of Artificial Intelligence Research (JAIR), Vol. 80 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19092 2024-07-09 cs.CV 57%

Benchmarking and Improving Detail Image Caption

Hongyuan Dong, Jiawen Li, Bohong Wu, Jiacong Wang, Yuan Zhang, Haoyuan Guo

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04212 2024-07-08 cs.AI 57%

Smart Vision-Language Reasoners

Denisa Roberts, Lucas Roberts

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

Comments Accepted in ICML 2024 MATH AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04068 2024-07-08 cs.CV 57%

CLIP-DR: Textual Knowledge-Guided Diabetic Retinopathy Grading with Ranking-aware Prompting

Qinkai Yu, Jianyang Xie, Anh Nguyen, He Zhao, Jiong Zhang, Huazhu Fu, Yitian Zhao, Yalin Zheng, Yanda Meng

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by MICCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03380 2024-07-08 q-bio.QM cs.AI cs.LG 57%

Multi-Peptide: Multimodality Leveraged Language-Graph Learning of Peptide Properties

Srivathsan Badrinarayanan, Chakradhar Guntuboina, Parisa Mollaei, Amir Barati Farimani

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06879 2024-07-08 cs.CV eess.IV 57%

The Solution for the CVPR2023 NICE Image Captioning Challenge

Xiangyu Wu, Yi Gao, Hailiang Zhang, Yang Yang, Weili Guo, Jianfeng Lu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12752 2024-07-03 cs.CV 57%

C3L: Content Correlated Vision-Language Instruction Tuning Data Generation via Contrastive Learning

Ji Ma, Wei Suo, Peng Wang, Yanning Zhang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted by IJCAI-24

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00905 2024-07-02 cs.CV 57%

Learning Robust 3D Representation from CLIP via Dual Denoising

Shuqing Luo, Bowen Qu, Wei Gao

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09233 2024-07-02 cs.CV 57%

Distilling Knowledge from Text-to-Image Generative Models Improves Visio-Linguistic Reasoning in CLIP

Samyadeep Basu, Shell Xu Hu, Maziar Sanjabi, Daniela Massiceti, Soheil Feizi

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Short paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00556 2024-07-02 cs.MM 57%

Revisiting Vision-Language Features Adaptation and Inconsistency for Social Media Popularity Prediction

Chih-Chung Hsu, Chia-Ming Lee, Yu-Fan Lin, Yi-Shiuan Chou, Chih-Yu Jian, Chi-Han Tsai

专题命中 图文多模态 :multi-modal(abstract);分类 cs.MM

Comments Submission of the 7th Social Media Prediction Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00252 2024-07-02 cs.CV cs.ET 57%

Assistive Image Annotation Systems with Deep Learning and Natural Language Capabilities: A Review

Moseli Mots'oehli

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted IEEE ETNCC 2024, 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03118 2024-06-26 cs.CV 57%

LVLM-Interpret: An Interpretability Tool for Large Vision-Language Models

Gabriela Ben Melech Stan, Estelle Aflalo, Raanan Yehezkel Rohekar, Anahita Bhiwandiwalla, Shao-Yen Tseng, Matthew Lyle Olson, Yaniv Gurwicz, Chenfei Wu, Nan Duan, Vasudev Lal

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00789 2024-06-21 cs.CV 57%

Retrieval-Augmented Egocentric Video Captioning

Jilan Xu, Yifei Huang, Junlin Hou, Guo Chen, Yuejie Zhang, Rui Feng, Weidi Xie

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments CVPR 2024. Project page is available at: https://jazzcharles.github.io/Egoinstructor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12668 2024-06-19 cs.CV 57%

Disturbing Image Detection Using LMM-Elicited Emotion Embeddings

Maria Tzelepi, Vasileios Mezaris

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted for publication, LVLM Workshop @ IEEE Int. Conf. on Image Processing (ICIP 2024), Abu Dhabi, United Arab Emirates, Oct. 2024. This is the authors' "accepted version"

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12225 2024-06-19 cs.CV 57%

The Solution for CVPR2024 Foundational Few-Shot Object Detection Challenge

Hongpeng Pan, Shifeng Yi, Shouwei Yang, Lei Qi, Bing Hu, Yi Xu, Yang Yang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments CVPR2024 Foundational Few-Shot Object Detection Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08578 2024-06-18 cs.CV 57%

A Picture is Worth More Than 77 Text Tokens: Evaluating CLIP-Style Models on Dense Captions

Jack Urbanek, Florian Bordes, Pietro Astolfi, Mary Williamson, Vasu Sharma, Adriana Romero-Soriano

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17851 2024-06-18 cs.CV 57%

Leveraging VLM-Based Pipelines to Annotate 3D Objects

Rishabh Kabra, Loic Matthey, Alexander Lerchner, Niloy J. Mitra

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09994 2024-06-17 cs.CL 57%

Precision Empowers, Excess Distracts: Visual Question Answering With Dynamically Infused Knowledge In Language Models

Manas Jhalani, Annervaz K M, Pushpak Bhattacharyya

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09240 2024-06-14 cs.CV 57%

Comparison Visual Instruction Tuning

Wei Lin, Muhammad Jehanzeb Mirza, Sivan Doveh, Rogerio Feris, Raja Giryes, Sepp Hochreiter, Leonid Karlinsky

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Project page: https://wlin-at.github.io/cad_vi ; Huggingface dataset repo: https://huggingface.co/datasets/wlin21at/CaD-Inst

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09198 2024-06-14 cs.CV 57%

CLIP-Driven Cloth-Agnostic Feature Learning for Cloth-Changing Person Re-Identification

Shuang Li, Jiaxu Leng, Guozhang Li, Ji Gan, Haosheng chen, Xinbo Gao

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15734 2024-06-12 cs.CV 57%

LM4LV: A Frozen Large Language Model for Low-level Vision Tasks

Boyang Zheng, Jinjin Gu, Shijun Li, Chao Dong

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.21013 2024-06-05 cs.CV 57%

StrucTexTv3: An Efficient Vision-Language Model for Text-rich Image Perception, Comprehension, and Beyond

Pengyuan Lyu, Yulin Li, Hao Zhou, Weihong Ma, Xingyu Wan, Qunyi Xie, Liang Wu, Chengquan Zhang, Kun Yao, Errui Ding, Jingdong Wang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01987 2024-06-05 cs.CV 57%

Dealing with All-stage Missing Modality: Towards A Universal Model with Robust Reconstruction and Personalization

Yunpeng Zhao, Cheng Chen, Qing You Pang, Quanzheng Li, Carol Tang, Beng-Ti Ang, Yueming Jin

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10896 2024-06-04 cs.CV 57%

PaLM2-VAdapter: Progressively Aligned Language Model Makes a Strong Vision-language Adapter

Junfei Xiao, Zheng Xu, Alan Yuille, Shen Yan, Boyu Wang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Technical report, 15 pages; v2 fix typos, add additional results in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏