arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46237 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4672 篇

2503.08007 2025-03-12 cs.RO cs.AI 70%

MoRE: Unlocking Scalability in Reinforcement Learning for Quadruped Vision-Language-Action Models

Han Zhao, Wenxuan Song, Donglin Wang, Xinyang Tong, Pengxiang Ding, Xuelian Cheng, Zongyuan Ge

专题命中 图文多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.AI

Comments Accepted by ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02199 2025-03-05 cs.CV cs.AI cs.CL cs.LG cs.MM 70%

Words or Vision: Do Vision-Language Models Have Blind Faith in Text?

Ailin Deng, Tri Cao, Zhirui Chen, Bryan Hooi

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08168 2025-03-05 cs.CL 70%

SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation

Zhiming Ma, Xiayang Xiao, Sihao Dong, Peidong Wang, HaiPeng Wang, Qingyun Pan

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01106 2025-03-04 cs.CV 70%

SV-RAG: LoRA-Contextualizing Adaptation of MLLMs for Long Document Understanding

Jian Chen, Ruiyi Zhang, Yufan Zhou, Tong Yu, Franck Dernoncourt, Jiuxiang Gu, Ryan A. Rossi, Changyou Chen, Tong Sun

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20698 2025-03-03 cs.CV 70%

Towards General Visual-Linguistic Face Forgery Detection(V2)

Ke Sun, Shen Chen, Taiping Yao, Ziyin Zhou, Jiayi Ji, Xiaoshuai Sun, Chia-Wen Lin, Rongrong Ji

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments 8 pages, 5 figures, Accpet by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15979 2025-02-25 cs.IR cs.CV 70%

Visual Zero-Shot E-Commerce Product Attribute Value Extraction

Jiaying Gong, Ming Cheng, Hongda Shen, Pierre-Yves Vandenbussche, Janet Jenq, Hoda Eldardiry

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments 10 pages, 4 figures, accepted for publication in NAACL 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16065 2025-02-12 cs.CV 70%

CILP-FGDI: Exploiting Vision-Language Model for Generalizable Person Re-Identification

Huazhong Zhao, Lei Qi, Xin Geng

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

Comments Accepted by IEEE TIFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02589 2025-02-05 cs.CV 70%

COCONut-PanCap: Joint Panoptic Segmentation and Grounded Captions for Fine-Grained Understanding and Generation

Xueqing Deng, Qihang Yu, Ali Athar, Chenglin Yang, Linjie Yang, Xiaojie Jin, Xiaohui Shen, Liang-Chieh Chen

专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV

Comments project website: https://xdeng7.github.io/coconut.github.io/coconut_pancap.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17586 2025-01-31 cs.CV cs.LG 70%

Boosting Weak Positives for Text Based Person Search

Akshay Modi, Ashhar Aziz, Nilanjana Chatterjee, A V Subramanyam

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15558 2025-01-28 cs.CV 70%

Ocean-OCR: Towards General OCR Application via a Vision-Language Model

Song Chen, Xinyu Guo, Yadong Li, Tao Zhang, Mingan Lin, Dongdong Kuang, Youwei Zhang, Lingfeng Ming, Fengyu Zhang, Yuran Wang, Jianhua Xu, Zenan Zhou, Weipeng Chen

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14905 2025-01-28 cs.CV 70%

Measuring and Mitigating Hallucinations in Vision-Language Dataset Generation for Remote Sensing

Madeline Anderson, Miriam Cha, William T. Freeman, J. Taylor Perron, Nathaniel Maidel, Kerri Cahoy

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11231 2025-01-22 cs.CV 70%

KPL: Training-Free Medical Knowledge Mining of Vision-Language Models

Jiaxiang Liu, Tianxiang Hu, Jiawei Du, Ruiyuan Zhang, Joey Tianyi Zhou, Zuozhu Liu

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

Comments AAAI(Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08580 2025-01-16 cs.CV 70%

Densely Connected Parameter-Efficient Tuning for Referring Image Segmentation

Jiaqi Huang, Zunnan Xu, Ting Liu, Yong Liu, Haonan Han, Kehong Yuan, Xiu Li

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

Comments Accepted by AAAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06430 2025-01-14 cs.CV 70%

Open Eyes, Then Reason: Fine-grained Visual Mathematical Understanding in MLLMs

Shan Zhang, Aotian Chen, Yanpeng Sun, Jindong Gu, Yi-Yu Zheng, Piotr Koniusz, Kai Zou, Anton van den Hengel, Yuan Xue

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17851 2025-01-03 cs.CV 70%

Instruction-Guided Scene Text Recognition

Yongkun Du, Zhineng Chen, Yuchen Su, Caiyan Jia, Yu-Gang Jiang

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments Accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17544 2024-12-24 cs.AI 70%

Retention Score: Quantifying Jailbreak Risks for Vision Language Models

Zaitang Li, Pin-Yu Chen, Tsung-Yi Ho

专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.AI

Comments 14 pages, 8 figures, AAAI 2025

Journal ref AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13364 2024-12-19 cs.CV 70%

Bringing Multimodality to Amazon Visual Search System

Xinliang Zhu, Michael Huang, Han Ding, Jinyu Yang, Kelvin Chen, Tao Zhou, Tal Neiman, Ouye Xie, Son Tran, Benjamin Yao, Doug Gray, Anuj Bindal, Arnab Dhua

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

Journal ref Proceedings of the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12492 2024-12-18 cs.CV 70%

DuSSS: Dual Semantic Similarity-Supervised Vision-Language Model for Semi-Supervised Medical Image Segmentation

Qingtao Pan, Wenhao Qiao, Jingjiao Lou, Bing Ji, Shuo Li

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12121 2024-12-17 cs.CL cs.AI cs.CV cs.MM 70%

IRR: Image Review Ranking Framework for Evaluating Vision-Language Models

Kazuki Hayashi, Kazuma Onishi, Toma Suzuki, Yusuke Ide, Seiji Gobara, Shigeki Saito, Yusuke Sakai, Hidetaka Kamigaito, Katsuhiko Hayashi, Taro Watanabe

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 18pages, Accepted at COLING25

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07485 2024-12-12 cs.CV 70%

Zero-Shot Class Unlearning in CLIP with Synthetic Samples

A. Kravets, V. Namboodiri

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

Comments Published in WACV 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06292 2024-12-10 cs.CV 70%

ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models

Bingchen Gong, Diego Gomez, Abdullah Hamdi, Abdelrahman Eldesokey, Ahmed Abdelreheem, Peter Wonka, Maks Ovsjanikov

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments Project website is accessible at https://sites.google.com/view/zerokey

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14607 2024-12-02 cs.CV cs.LG 70%

Patch Ranking: Efficient CLIP by Learning to Rank Local Patches

Cheng-En Wu, Jinhong Lin, Yu Hen Hu, Pedro Morgado

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

Comments Accepted by WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08464 2024-12-02 cs.CV 70%

VLTP: Vision-Language Guided Token Pruning for Task-Oriented Segmentation

Hanning Chen, Yang Ni, Wenjun Huang, Yezi Liu, SungHeon Jeong, Fei Wen, Nathaniel Bastian, Hugo Latapie, Mohsen Imani

专题命中 图文多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted at WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15411 2024-11-26 cs.CV 70%

FINECAPTION: Compositional Image Captioning Focusing on Wherever You Want at Any Granularity

Hang Hua, Qing Liu, Lingzhi Zhang, Jing Shi, Zhifei Zhang, Yilin Wang, Jianming Zhang, Jiebo Luo

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02669 2024-11-06 cs.CV 70%

Semantic-Aligned Adversarial Evolution Triangle for High-Transferability Vision-Language Attack

Xiaojun Jia, Sensen Gao, Qing Guo, Ke Ma, Yihao Huang, Simeng Qin, Yang Liu, Ivor Tsang Fellow, Xiaochun Cao

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23370 2024-11-01 cs.CV 70%

Multilingual Vision-Language Pre-training for the Remote Sensing Domain

João Daniel Silva, Joao Magalhaes, Devis Tuia, Bruno Martins

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

Comments Accepted at ACM SIGSPATIAL 2024 - Research Papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12735 2024-10-31 cs.CV 70%

MetaSegNet: Metadata-collaborative Vision-Language Representation Learning for Semantic Segmentation of Remote Sensing Images

Libo Wang, Sijun Dong, Ying Chen, Xiaoliang Meng, Shenghui Fang, Songlin Fei

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

Comments Accepted by IEEE Transactions on Geoscience and Remote Sensing

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08021 2024-10-28 cs.CV 70%

OneRef: Unified One-tower Expression Grounding and Segmentation with Mask Referring Modeling

Linhui Xiao, Xiaoshan Yang, Fang Peng, Yaowei Wang, Changsheng Xu

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024. The project page: https://github.com/linhuixiao/OneRef

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11639 2024-10-17 cs.CV 70%

Efficient and Effective Universal Adversarial Attack against Vision-Language Pre-training Models

Fan Yang, Yihao Huang, Kailong Wang, Ling Shi, Geguang Pu, Yang Liu, Haoyu Wang

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11255 2024-10-16 cs.CV 70%

CLIP-DFGS: A Hard Sample Mining Method for CLIP in Generalizable Person Re-Identification

Huazhong Zhao, Lei Qi, Xin Geng

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

Comments Accepted by ACM TOMM

详情

展开后加载摘要…

URL PDF HTML 收藏