arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46237 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4672 篇

2506.11493 2025-06-16 cs.CV 70%

Preserving Clusters in Prompt Learning for Unsupervised Domain Adaptation

Tung-Long Vuong, Hoang Phan, Vy Vo, Anh Bui, Thanh-Toan Do, Trung Le, Dinh Phung

机构 * Monash University(墨尔本大学) New York University(纽约大学)

专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19794 2025-06-12 cs.CV 70%

MVTamperBench: Evaluating Robustness of Vision-Language Models

Amit Agarwal, Srikant Panda, Angeline Charles, Bhargava Kumar, Hitesh Patel, Priyaranjan Pattnayak, Taki Hasan Rafi, Tejaswini Kumar, Hansa Meghwani, Karan Gupta, Dong-Kyu Chae

机构 * Liverpool John Moores University(利物浦约翰·穆里斯大学) Birla Institute of Technology(比拉理工学院) Christ University(基督大学) Columbia University(哥伦比亚大学) New York University(纽约大学) University of Washington(华盛顿大学) Hanyang University(翰阳大学)

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08429 2025-06-11 cs.CV 70%

Better Reasoning with Less Data: Enhancing VLMs Through Unified Modality Scoring

Mingjie Xu, Andrew Estornell, Hongzheng Yang, Yuzhi Zhao, Zhaowei Zhu, Qi Xuan, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ByteDance Seed(字节跳动种子) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) BIAI-ZJUT Zhejiang University of Technology(浙江工业大学)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14361 2025-06-11 cs.CV 70%

Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives

Xingxing Weng, Chao Pang, Gui-Song Xia

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

Comments Accepted by IEEE Geoscience and Remote Sensing Magazine

Journal ref IEEE Geoscience and Remote Sensing Magazine, Early Access, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07905 2025-06-10 cs.CV 70%

WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning

Jie Yang, Feipeng Ma, Zitian Wang, Dacheng Yin, Kang Rong, Fengyun Rao, Ruimao Zhang

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05198 2025-06-06 cs.CV cs.LG 70%

Quantifying Cross-Modality Memorization in Vision-Language Models

Yuxin Wen, Yangsibo Huang, Tom Goldstein, Ravi Kumar, Badih Ghazi, Chiyuan Zhang

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00806 2025-06-03 cs.CL 70%

Fast or Slow? Integrating Fast Intuition and Deliberate Thinking for Enhancing Visual Question Answering

Songtao Jiang, Chenyi Zhou, Yan Zhang, Yeying Jin, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Byte Dance(字节跳动) National University of Singapore(新加坡国立大学) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室)

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08174 2025-06-03 cs.LG cs.AI cs.SI 70%

Can Graph Neural Networks Learn Language with Extremely Weak Text Supervision?

Zihao Li, Lecheng Zheng, Bowen Jin, Dongqi Fu, Baoyu Jing, Yikun Ban, Jingrui He, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta AI

专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.AI

Comments ACL 2025 Main Conference, 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00406 2025-06-03 cs.CV 70%

iDPA: Instance Decoupled Prompt Attention for Incremental Medical Object Detection

Huahui Yi, Wei Xu, Ziyuan Qin, Xi Chen, Xiaohu Wu, Kang Li, Qicheng Lao

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

Comments accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24517 2025-06-02 cs.CV 70%

un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP

Yinqi Li, Jiahe Zhao, Hong Chang, Ruibing Hou, Shiguang Shan, Xilin Chen

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03854 2025-06-02 cs.CL 70%

Vision-Language Models Struggle to Align Entities across Modalities

Iñigo Alonso, Gorka Azkune, Ander Salaberria, Jeremy Barnes, Oier Lopez de Lacalle

机构 * School of Informatics, The University of Edinburgh(信息学院,爱丁堡大学) HiTZ Center - Ixa, University of the Basque Country UPV/EHU(巴斯克国家大学HiTZ中心)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL

Comments Accepted Findings ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21317 2025-05-28 cs.LG cs.AI 70%

A Cross Modal Knowledge Distillation & Data Augmentation Recipe for Improving Transcriptomics Representations through Morphological Features

Ihab Bendidi, Yassir El Mesbahi, Alisandra K. Denton, Karush Suri, Kian Kenyon-Dean, Auguste Genovesio, Emmanuel Noutahi

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

Comments ICML 2025 Main Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19406 2025-05-27 cs.AI 70%

Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model

Tianle Li, Jihai Zhang, Yongming Rao, Yu Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent Hunyuan Research(腾讯文言研究院)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12359 2025-05-20 cs.LG cs.CV 70%

STAR: Stage-Wise Attention-Guided Token Reduction for Efficient Large Vision-Language Models Inference

Yichen Guo, Hanze Li, Zonghao Zhang, Jinhao You, Kai Tang, Xiande Huang

机构 * De Artificial Intelligence Lab(人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03153 2025-05-07 cs.CV 70%

Robust Fairness Vision-Language Learning for Medical Image Analysis

Sparsh Bansal, Mingyang Wu, Xin Wang, Shu Hu

机构 * Purdue University(普渡大学) University at Albany, State University of New York(纽约州立大学阿尔巴尼分校)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07577 2025-05-06 cs.CV 70%

3D Vision-Language Gaussian Splatting

Qucheng Peng, Benjamin Planche, Zhongpai Gao, Meng Zheng, Anwesa Choudhuri, Terrence Chen, Chen Chen, Ziyan Wu

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,佛罗里达大学)

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments Accepted at ICLR 2025. Main paper + supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20343 2025-04-30 cs.CV 70%

MicarVLMoE: A Modern Gated Cross-Aligned Vision-Language Mixture of Experts Model for Medical Image Captioning and Report Generation

Amaan Izhar, Nurul Japar, Norisma Idris, Ting Dang

机构 * Faculty of Computer Science and Information Technology, Universiti Malaya(马来亚大学计算机科学与信息学院) School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算机与信息学院)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

Comments Accepted by IJCNN 2025, 8 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16420 2025-04-24 cs.IR cs.AI 70%

A Survey of Foundation Model-Powered Recommender Systems: From Feature-Based, Generative to Agentic Paradigms

Chengkai Huang, Hongtao Huang, Tong Yu, Kaige Xie, Junda Wu, Shuai Zhang, Julian Mcauley, Dietmar Jannach, Lina Yao

机构 * School of Computer Science and Engineering, The University of New South Wales(计算机科学与工程学院,新南威尔士大学) Adobe Research(Adobe研究) School of Computer Science, Georgia Institute of Technology(计算机科学学院,佐治亚理工学院) University of California, San Diego(加州大学圣地亚哥分校) ETH Zurich(苏黎世联邦理工学院) University of Klagenfurt(克雷格弗特大学) The University of New South Wales and CSIRO’s Data61(新南威尔士大学和CSIRO的数据61)

专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10727 2025-04-16 cs.CV 70%

Foundation Models for Remote Sensing: An Analysis of MLLMs for Object Localization

Darryl Hannan, John Cooper, Dylan White, Timothy Doster, Henry Kvinge, Yijing Watkins

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments 26 pages, CVPR MORSE Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10465 2025-04-15 cs.CV 70%

Pixel-SAIL: Single Transformer For Pixel-Grounded Understanding

Tao Zhang, Xiangtai Li, Zilong Huang, Yanwei Li, Weixian Lei, Xueqing Deng, Shihao Chen, Shunping Ji, Jiashi Feng

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14911 2025-04-15 cs.CV 70%

Derm1M: A Million-scale Vision-Language Dataset Aligned with Clinical Ontology Knowledge for Dermatology

Siyuan Yan, Ming Hu, Yiwen Jiang, Xieji Li, Hao Fei, Philipp Tschandl, Harald Kittler, Zongyuan Ge

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

Comments Our dataset and code will be publicly available at https://github.com/SiyuanYan1/Derm1M

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06863 2025-04-10 cs.CV 70%

MovSAM: A Single-image Moving Object Segmentation Framework Based on Deep Thinking

Chang Nie, Yiqing Xu, Guangming Wang, Zhe Liu, Yanzi Miao, Hesheng Wang

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03254 2025-04-07 cs.CV 70%

SARLANG-1M: A Benchmark for Vision-Language Modeling in SAR Image Understanding

Yimin Wei, Aoran Xiao, Yexian Ren, Yuting Zhu, Hongruixuan Chen, Junshi Xia, Naoto Yokoya

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02823 2025-04-04 cs.CV eess.IV 70%

STING-BEE: Towards Vision-Language Model for Real-World X-ray Baggage Security Inspection

Divya Velayudhan, Abdelfatah Ahmed, Mohamad Alansari, Neha Gour, Abderaouf Behouch, Taimur Hassan, Syed Talal Wasim, Nabil Maalej, Muzammal Naseer, Juergen Gall, Mohammed Bennamoun, Ernesto Damiani, Naoufel Werghi

专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20662 2025-03-27 cs.CV cs.LG eess.IV 70%

AutoRad-Lung: A Radiomic-Guided Prompting Autoregressive Vision-Language Model for Lung Nodule Malignancy Prediction

Sadaf Khademi, Mehran Shabanpour, Reza Taleei, Anastasia Oikonomou, Arash Mohammadi

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07353 2025-03-27 cs.CV 70%

CLIP in Medical Imaging: A Survey

Zihao Zhao, Yuxiao Liu, Han Wu, Mei Wang, Yonghao Li, Sheng Wang, Lin Teng, Disheng Liu, Zhiming Cui, Qian Wang, Dinggang Shen

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

Comments Project page available at https://github.com/zhaozh10/Awesome-CLIP-in-Medical-Imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18407 2025-03-26 cs.CV 70%

VTD-CLIP: Video-to-Text Discretization via Prompting CLIP

Wencheng Zhu, Yuexin Wang, Hongxuan Li, Pengfei Zhu, Qinghua Hu

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12769 2025-03-18 cs.CV 70%

ViSpeak: Visual Instruction Feedback in Streaming Videos

Shenghao Fu, Qize Yang, Yuan-Ming Li, Yi-Xing Peng, Kun-Yu Lin, Xihan Wei, Jian-Fang Hu, Xiaohua Xie, Wei-Shi Zheng

专题命中 图文多模态 :multi-modal(abstract);omni-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10779 2025-03-17 cs.CV 70%

The Power of One: A Single Example is All it Takes for Segmentation in VLMs

Mir Rayat Imtiaz Hossain, Mennatullah Siam, Leonid Sigal, James J. Little

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14529 2025-03-14 cs.CV 70%

AnomalyDINO: Boosting Patch-based Few-shot Anomaly Detection with DINOv2

Simon Damm, Mike Laszkiewicz, Johannes Lederer, Asja Fischer

专题命中 图文多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

Comments Accepted at WACV 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏