arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2503.15369 2025-03-20 cs.CV 57%

EfficientLLaVA:Generalizable Auto-Pruning for Large Vision-language Models

Yinan Liang, Ziwei Wang, Xiuwei Xu, Jie Zhou, Jiwen Lu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14674 2025-03-20 cs.CV 57%

Elevating Visual Question Answering through Implicitly Learned Reasoning Pathways in LVLMs

Liu Jing, Amirul Rahman

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20642 2025-03-19 cs.CV 57%

Effectively Leveraging CLIP for Generating Situational Summaries of Images and Videos

Dhruv Verma, Debaditya Roy, Basura Fernando

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 38 pages, 12 figures. arXiv admin note: text overlap with arXiv:2307.00586

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11265 2025-03-17 cs.CV 57%

DynRsl-VLM: Enhancing Autonomous Driving Perception with Dynamic Resolution Vision-Language Models

Xirui Zhou, Lianlei Shan, Xiaolin Gui

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09968 2025-03-14 cs.CV 57%

Style Evolving along Chain-of-Thought for Unknown-Domain Object Detection

Zihao Zhang, Aming Wu, Yahong Han

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19314 2025-03-14 cs.CY cs.CL 57%

Revealing and Reducing Gender Biases in Vision and Language Assistants (VLAs)

Leander Girrbach, Stephan Alaniz, Yiran Huang, Trevor Darrell, Zeynep Akata

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

Comments Accepted at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03346 2025-03-14 cs.CV 57%

Enhancing Vision-Language Pre-training with Rich Supervisions

Yuan Gao, Kunyu Shi, Pengkai Zhu, Edouard Belval, Oren Nuriel, Srikar Appalaraju, Shabnam Ghadar, Vijay Mahadevan, Zhuowen Tu, Stefano Soatto

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted to CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08625 2025-03-12 cs.CV 57%

SegAgent: Exploring Pixel Understanding Capabilities in MLLMs by Imitating Human Annotator Trajectories

Muzhi Zhu, Yuzhuo Tian, Hao Chen, Chunluan Zhou, Qingpei Guo, Yang Liu, Ming Yang, Chunhua Shen

专题命中 图文多模态 :MLLM(abstract);分类 cs.CV

Comments CVPR2025;Code will be released at \url{https://github.com/aim-uofa/SegAgent}

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01428 2025-03-12 cs.CV 57%

GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models

Zhangyang Qi, Zhixiong Zhang, Ye Fang, Jiaqi Wang, Hengshuang Zhao

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Project page: https://gpt4scene.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07608 2025-03-11 cs.CV cs.RO 57%

AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning

Bo Jiang, Shaoyu Chen, Qian Zhang, Wenyu Liu, Xinggang Wang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Project Page: https://github.com/hustvl/AlphaDrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07603 2025-03-11 cs.CV 57%

Should VLMs be Pre-trained with Image Data?

Sedrick Keh, Jean Mercat, Samir Yitzhak Gadre, Kushal Arora, Igor Vasiljevic, Benjamin Burchfiel, Shuran Song, Russ Tedrake, Thomas Kollar, Ludwig Schmidt, Achal Dave

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07065 2025-03-11 cs.CV 57%

Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning

Huilin Deng, Ding Zou, Rui Ma, Hongchen Luo, Yang Cao, Yu Kang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06621 2025-03-11 cs.CV 57%

Dynamic Updates for Language Adaptation in Visual-Language Tracking

Xiaohai Li, Bineng Zhong, Qihua Liang, Zhiyi Mo, Jian Nong, Shuxiang Song

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.20076 2025-03-11 cs.CV 57%

EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model

Yuxuan Zhang, Tianheng Cheng, Lianghui Zhu, Rui Hu, Lei Liu, Heng Liu, Longjin Ran, Xiaoxin Chen, Wenyu Liu, Xinggang Wang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Preprint. Update: (1) better performance and (2) versatile segmentation. Code and models are available at: https://github.com/hustvl/EVF-SAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07093 2025-03-11 cs.CV 57%

LaMP: Language-Motion Pretraining for Motion Generation, Retrieval, and Captioning

Zhe Li, Weihao Yuan, Yisheng He, Lingteng Qiu, Shenhao Zhu, Xiaodong Gu, Weichao Shen, Yuan Dong, Zilong Dong, Laurence T. Yang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04592 2025-03-07 cs.CV 57%

A Benchmark for Multi-Lingual Vision-Language Learning in Remote Sensing Image Captioning

Qing Zhou, Tao Yang, Junyu Gao, Weiping Ni, Junzheng Wu, Qi Wang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04229 2025-03-07 cs.CV cs.LG 57%

Synthetic Data is an Elegant GIFT for Continual Vision-Language Models

Bin Wu, Wuxuan Shi, Jinqiao Wang, Mang Ye

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments This work is accepted by CVPR 2025. Modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16981 2025-03-07 cs.CV 57%

Modulating CNN Features with Pre-Trained ViT Representations for Open-Vocabulary Object Detection

Xiangyu Gao, Yu Dai, Benliu Qiu, Lanxiao Wang, Heqian Qiu, Hongliang Li

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03613 2025-03-06 cs.CV 57%

CLIP is Strong Enough to Fight Back: Test-time Counterattacks towards Zero-shot Adversarial Robustness of CLIP

Songlong Xing, Zhengyu Zhao, Nicu Sebe

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02865 2025-03-06 cs.CL 57%

FairSense-AI: Responsible AI Meets Sustainability

Shaina Raza, Mukund Sayeeganesh Chettiar, Matin Yousefabadi, Tahniat Khan, Marcelo Lotif

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12915 2025-03-05 cs.CV 57%

VILA-M3: Enhancing Vision-Language Models with Medical Expert Knowledge

Vishwesh Nath, Wenqi Li, Dong Yang, Andriy Myronenko, Mingxin Zheng, Yao Lu, Zhijian Liu, Hongxu Yin, Yucheng Tang, Pengfei Guo, Can Zhao, Ziyue Xu, Yufan He, Greg Heinrich, Yee Man Law, Benjamin Simon, Stephanie Harmon, Stephen Aylward, Marc Edgar, Michael Zephyr, Song Han, Pavlo Molchanov, Baris Turkbey, Holger Roth, Daguang Xu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01184 2025-03-04 cs.LG cs.CV 57%

Language-Assisted Feature Transformation for Anomaly Detection

EungGu Yun, Heonjin Ha, Yeongwoo Nam, Bryan Dongik Lee

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00936 2025-03-04 cs.CV 57%

IteRPrimE: Zero-shot Referring Image Segmentation with Iterative Grad-CAM Refinement and Primary Word Emphasis

Yuji Wang, Jingchen Ni, Yong Liu, Chun Yuan, Yansong Tang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08079 2025-03-04 cs.CV 57%

MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models

Peng-Fei Zhang, Guangdong Bai, Zi Huang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00376 2025-03-04 cs.CV 57%

Few-shot crack image classification using clip based on bayesian optimization

Yingchao Zhang, Cheng Liu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 5 pages, 5 figures, 3 tables, submit to the 1st International Workshop on Bayesian Approach in Civil Engineering (IWOBA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19842 2025-03-04 cs.CV 57%

CLIP Under the Microscope: A Fine-Grained Analysis of Multi-Object Representation

Reza Abbasi, Ali Nazari, Aminreza Sefid, Mohammadali Banayeeanzade, Mohammad Hossein Rohban, Mahdieh Soleymani Baghshah

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11965 2025-03-04 eess.SP cs.AI 57%

A MIMO Wireless Channel Foundation Model via CIR-CSI Consistency

Jun Jiang, Wenjun Yu, Yunfan Li, Yuan Gao, Shugong Xu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI

Comments 6 pages, 2025 ICMLCN accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10636 2025-03-03 cs.AI cs.HC cs.RO 57%

USER-VLM 360: Personalized Vision Language Models with User-aware Tuning for Social Human-Robot Interactions

Hamed Rahimi, Adil Bahaj, Mouad Abrini, Mahdi Khoramshahi, Mounir Ghogho, Mohamed Chetouani

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01264 2025-03-03 cs.CV 57%

Backdooring Vision-Language Models with Out-Of-Distribution Data

Weimin Lyu, Jiachen Yao, Saumya Gupta, Lu Pang, Tao Sun, Lingjie Yi, Lijie Hu, Haibin Ling, Chao Chen

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19672 2025-02-28 cs.CV cs.LG 57%

Improving Adversarial Transferability in MLLMs via Dynamic Vision-Language Alignment Attack

Chenhe Gu, Jindong Gu, Andong Hua, Yao Qin

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2403.09766

详情

展开后加载摘要…

URL PDF HTML 收藏