arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2504.02328 2025-04-04 cs.CV 57%

Refining CLIP's Spatial Awareness: A Visual-Centric Perspective

Congpei Qiu, Yanhao Wu, Wei Ke, Xiuxiu Bai, Tong Zhang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01952 2025-04-03 cs.CV 57%

Image Difference Grounding with Natural Language

Wenxuan Wang, Zijia Zhao, Yisi Zhang, Yepeng Tang, Erdong Hu, Xinlong Wang, Jing Liu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01838 2025-04-03 cs.CV 57%

Prompting Medical Vision-Language Models to Mitigate Diagnosis Bias by Generating Realistic Dermoscopic Images

Nusrat Munia, Abdullah-Al-Zubaer Imran

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Paper accepted at International Symposium on Biomedical Imaging (ISBI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01561 2025-04-03 eess.IV cs.CV 57%

STPNet: Scale-aware Text Prompt Network for Medical Image Segmentation

Dandan Shan, Zihan Li, Yunxiang Li, Qingde Li, Jie Tian, Qingqi Hong

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22727 2025-04-03 cs.CL cs.LG 57%

A Large-Scale Vision-Language Dataset Derived from Open Scientific Literature to Advance Biomedical Generalist AI

Alejandro Lozano, Min Woo Sun, James Burgess, Jeffrey J. Nirschl, Christopher Polzak, Yuhui Zhang, Liangyu Chen, Jeffrey Gu, Ivan Lopez, Josiah Aklilu, Anita Rau, Austin Wolfgang Katzer, Collin Chiu, Orr Zohar, Xiaohan Wang, Alfred Seunghoon Song, Chiang Chia-Chun, Robert Tibshirani, Serena Yeung-Levy

专题命中 图文多模态 :image-text(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00938 2025-04-02 cs.AI cs.LG 57%

AI Judges in Design: Statistical Perspectives on Achieving Human Expert Equivalence With Vision-Language Models

Kristen M. Edwards, Farnaz Tehranchi, Scarlett R. Miller, Faez Ahmed

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

Comments 21 pages, 8 tables, 6 figures, 8 tables in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00848 2025-04-02 cs.CV 57%

Zero-Shot 4D Lidar Panoptic Segmentation

Yushan Zhang, Aljoša Ošep, Laura Leal-Taixé, Tim Meinhardt

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15356 2025-04-02 cs.CV 57%

Alleviating Hallucinations in Large Vision-Language Models through Hallucination-Induced Optimization

Xinyu Lyu, Beitao Chen, Lianli Gao, Jingkuan Song, Heng Tao Shen

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24017 2025-04-01 cs.CV cs.LG 57%

Crossmodal Knowledge Distillation with WordNet-Relaxed Text Embeddings for Robust Image Classification

Chenqi Guo, Mengshuo Rong, Qianli Feng, Rongfan Feng, Yinglong Ma

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12940 2025-04-01 cs.CL 57%

Improving Fine-grained Visual Understanding in VLMs through Text-Only Training

Dasol Choi, Guijin Son, Soo Yong Kim, Gio Paik, Seunghyeok Hong

专题命中 图文多模态 :image-text(abstract);分类 cs.CL

Comments AAAI25 workshop accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22720 2025-04-01 cs.LG cs.AI 57%

Why Representation Engineering Works: A Theoretical and Empirical Study in Vision-Language Models

Bowei Tian, Xuntao Lyu, Meng Liu, Hongyi Wang, Ang Li

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14723 2025-04-01 cs.CV 57%

Effective SAM Combination for Open-Vocabulary Semantic Segmentation

Minhyeok Lee, Suhwan Cho, Jungho Lee, Sunghun Yang, Heeseung Choi, Ig-Jae Kim, Sangyoun Lee

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10034 2025-03-31 cs.CV 57%

TULIP: Token-length Upgraded CLIP

Ivona Najdenkoska, Mohammad Mahdi Derakhshani, Yuki M. Asano, Nanne van Noord, Marcel Worring, Cees G. M. Snoek

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05346 2025-03-31 cs.LG cs.AI 57%

AnyAttack: Towards Large-scale Self-supervised Adversarial Attacks on Vision-language Models

Jiaming Zhang, Junhong Ye, Xingjun Ma, Yige Li, Yunfan Yang, Yunhao Chen, Jitao Sang, Dit-Yan Yeung

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20673 2025-03-28 cs.CV 57%

Mitigating Low-Level Visual Hallucinations Requires Self-Awareness: Database, Model and Training Strategy

Yinan Sun, Xiongkuo Min, Zicheng Zhang, Yixuan Gao, Yuqin Cao, Guangtao Zhai

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19281 2025-03-26 cs.RO cs.AI 57%

CubeRobot: Grounding Language in Rubik's Cube Manipulation via Vision-Language Model

Feiyang Wang, Xiaomin Yu, Wangyu Wu

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13652 2025-03-26 cs.CV 57%

RelationField: Relate Anything in Radiance Fields

Sebastian Koch, Johanna Wald, Mirco Colosi, Narunas Vaskevicius, Pedro Hermosilla, Federico Tombari, Timo Ropinski

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments CVPR 2025. Project page: https://relationfield.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01987 2025-03-26 cs.CV 57%

ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions

Tomáš Souček, Prajwal Gatti, Michael Wray, Ivan Laptev, Dima Damen, Josef Sivic

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18680 2025-03-25 cs.IR cs.CL 57%

ArchSeek: Retrieving Architectural Case Studies Using Vision-Language Models

Danrui Li, Yichao Shi, Yaluo Wang, Ziying Shi, Mubbasir Kapadia

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CL

Comments 15 pages, 8 figures, 3 tables. Accepted by CAAD Futures 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17416 2025-03-25 cs.SE cs.AI cs.LG 57%

Debugging and Runtime Analysis of Neural Networks with VLMs (A Case Study)

Boyue Caroline Hu, Divya Gopinath, Corina S. Pasareanu, Nina Narodytska, Ravi Mangal, Susmit Jha

专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI

Comments CAIN 2025 (4th International Conference on AI Engineering -- Software Engineering for AI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05186 2025-03-25 cs.CV 57%

HiLM-D: Enhancing MLLMs with Multi-Scale High-Resolution Details for Autonomous Driving

Xinpeng Ding, Jianhua Han, Hang Xu, Wei Zhang, Xiaomeng Li

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17080 2025-03-24 cs.CV 57%

Seeing What Matters: Empowering CLIP with Patch Generation-to-Selection

Gensheng Pei, Tao Chen, Yujia Wang, Xinhao Cai, Xiangbo Shu, Tianfei Zhou, Yazhou Yao

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16930 2025-03-24 cs.CV 57%

Vision-Language Gradient Descent-driven All-in-One Deep Unfolding Networks

Haijin Zeng, Xiangming Wang, Yongyong Chen, Jingyong Su, Jie Liu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16566 2025-03-24 cs.CV 57%

REVAL: A Comprehension Evaluation on Reliability and Values of Large Vision-Language Models

Jie Zhang, Zheng Yuan, Zhongqi Wang, Bei Yan, Sibo Wang, Xiangkui Cao, Zonghui Guo, Shiguang Shan, Xilin Chen

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 45 pages, 5 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.02738 2025-03-24 cs.CV 57%

Exploring Part-Informed Visual-Language Learning for Person Re-Identification

Yin Lin, Yehansen Chen, Baocai Yin, Jinshui Hu, Bing Yin, Cong Liu, Zengfu Wang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 6 pages, 4 figures, ICME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16120 2025-03-21 cs.CV 57%

Probabilistic Prompt Distribution Learning for Animal Pose Estimation

Jiyong Rao, Brian Nlong Zhao, Yu Wang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16106 2025-03-21 cs.CV 57%

OSLoPrompt: Bridging Low-Supervision Challenges and Open-Set Domain Generalization in CLIP

Mohamad Hassan N C, Divyam Gupta, Mainak Singha, Sai Bhargav Rongali, Ankit Jha, Muhammad Haris Khan, Biplab Banerjee

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15949 2025-03-21 cs.CV 57%

CausalCLIPSeg: Unlocking CLIP's Potential in Referring Medical Image Segmentation with Causal Intervention

Yaxiong Chen, Minghong Wei, Zixuan Zheng, Jingliang Hu, Yilei Shi, Shengwu Xiong, Xiao Xiang Zhu, Lichao Mou

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments MICCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15892 2025-03-21 cs.CV 57%

UMIT: Unifying Medical Imaging Tasks via Vision-Language Models

Haiyang Yu, Siyang Yi, Ke Niu, Minghan Zhuo, Bin Li

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01754 2025-03-21 cs.CV 57%

SDRT: Enhance Vision-Language Models by Self-Distillation with Diverse Reasoning Traces

Guande Wu, Huan Song, Yawei Wang, Qiaojing Yan, Yijun Tian, Lin Lee Cheong, Panpan Xu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏