arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4672 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4672 篇

2503.07608 2025-03-11 cs.CV cs.RO 57%

AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning

Bo Jiang, Shaoyu Chen, Qian Zhang, Wenyu Liu, Xinggang Wang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Project Page: https://github.com/hustvl/AlphaDrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07603 2025-03-11 cs.CV 57%

Should VLMs be Pre-trained with Image Data?

Sedrick Keh, Jean Mercat, Samir Yitzhak Gadre, Kushal Arora, Igor Vasiljevic, Benjamin Burchfiel, Shuran Song, Russ Tedrake, Thomas Kollar, Ludwig Schmidt, Achal Dave

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07065 2025-03-11 cs.CV 57%

Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning

Huilin Deng, Ding Zou, Rui Ma, Hongchen Luo, Yang Cao, Yu Kang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06621 2025-03-11 cs.CV 57%

Dynamic Updates for Language Adaptation in Visual-Language Tracking

Xiaohai Li, Bineng Zhong, Qihua Liang, Zhiyi Mo, Jian Nong, Shuxiang Song

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.20076 2025-03-11 cs.CV 57%

EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model

Yuxuan Zhang, Tianheng Cheng, Lianghui Zhu, Rui Hu, Lei Liu, Heng Liu, Longjin Ran, Xiaoxin Chen, Wenyu Liu, Xinggang Wang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Preprint. Update: (1) better performance and (2) versatile segmentation. Code and models are available at: https://github.com/hustvl/EVF-SAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07093 2025-03-11 cs.CV 57%

LaMP: Language-Motion Pretraining for Motion Generation, Retrieval, and Captioning

Zhe Li, Weihao Yuan, Yisheng He, Lingteng Qiu, Shenhao Zhu, Xiaodong Gu, Weichao Shen, Yuan Dong, Zilong Dong, Laurence T. Yang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04592 2025-03-07 cs.CV 57%

A Benchmark for Multi-Lingual Vision-Language Learning in Remote Sensing Image Captioning

Qing Zhou, Tao Yang, Junyu Gao, Weiping Ni, Junzheng Wu, Qi Wang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04229 2025-03-07 cs.CV cs.LG 57%

Synthetic Data is an Elegant GIFT for Continual Vision-Language Models

Bin Wu, Wuxuan Shi, Jinqiao Wang, Mang Ye

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments This work is accepted by CVPR 2025. Modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16981 2025-03-07 cs.CV 57%

Modulating CNN Features with Pre-Trained ViT Representations for Open-Vocabulary Object Detection

Xiangyu Gao, Yu Dai, Benliu Qiu, Lanxiao Wang, Heqian Qiu, Hongliang Li

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03613 2025-03-06 cs.CV 57%

CLIP is Strong Enough to Fight Back: Test-time Counterattacks towards Zero-shot Adversarial Robustness of CLIP

Songlong Xing, Zhengyu Zhao, Nicu Sebe

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02865 2025-03-06 cs.CL 57%

FairSense-AI: Responsible AI Meets Sustainability

Shaina Raza, Mukund Sayeeganesh Chettiar, Matin Yousefabadi, Tahniat Khan, Marcelo Lotif

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12915 2025-03-05 cs.CV 57%

VILA-M3: Enhancing Vision-Language Models with Medical Expert Knowledge

Vishwesh Nath, Wenqi Li, Dong Yang, Andriy Myronenko, Mingxin Zheng, Yao Lu, Zhijian Liu, Hongxu Yin, Yucheng Tang, Pengfei Guo, Can Zhao, Ziyue Xu, Yufan He, Greg Heinrich, Yee Man Law, Benjamin Simon, Stephanie Harmon, Stephen Aylward, Marc Edgar, Michael Zephyr, Song Han, Pavlo Molchanov, Baris Turkbey, Holger Roth, Daguang Xu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01184 2025-03-04 cs.LG cs.CV 57%

Language-Assisted Feature Transformation for Anomaly Detection

EungGu Yun, Heonjin Ha, Yeongwoo Nam, Bryan Dongik Lee

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00936 2025-03-04 cs.CV 57%

IteRPrimE: Zero-shot Referring Image Segmentation with Iterative Grad-CAM Refinement and Primary Word Emphasis

Yuji Wang, Jingchen Ni, Yong Liu, Chun Yuan, Yansong Tang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08079 2025-03-04 cs.CV 57%

MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models

Peng-Fei Zhang, Guangdong Bai, Zi Huang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00376 2025-03-04 cs.CV 57%

Few-shot crack image classification using clip based on bayesian optimization

Yingchao Zhang, Cheng Liu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 5 pages, 5 figures, 3 tables, submit to the 1st International Workshop on Bayesian Approach in Civil Engineering (IWOBA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19842 2025-03-04 cs.CV 57%

CLIP Under the Microscope: A Fine-Grained Analysis of Multi-Object Representation

Reza Abbasi, Ali Nazari, Aminreza Sefid, Mohammadali Banayeeanzade, Mohammad Hossein Rohban, Mahdieh Soleymani Baghshah

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11965 2025-03-04 eess.SP cs.AI 57%

A MIMO Wireless Channel Foundation Model via CIR-CSI Consistency

Jun Jiang, Wenjun Yu, Yunfan Li, Yuan Gao, Shugong Xu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI

Comments 6 pages, 2025 ICMLCN accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10636 2025-03-03 cs.AI cs.HC cs.RO 57%

USER-VLM 360: Personalized Vision Language Models with User-aware Tuning for Social Human-Robot Interactions

Hamed Rahimi, Adil Bahaj, Mouad Abrini, Mahdi Khoramshahi, Mounir Ghogho, Mohamed Chetouani

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01264 2025-03-03 cs.CV 57%

Backdooring Vision-Language Models with Out-Of-Distribution Data

Weimin Lyu, Jiachen Yao, Saumya Gupta, Lu Pang, Tao Sun, Lingjie Yi, Lijie Hu, Haibin Ling, Chao Chen

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19672 2025-02-28 cs.CV cs.LG 57%

Improving Adversarial Transferability in MLLMs via Dynamic Vision-Language Alignment Attack

Chenhe Gu, Jindong Gu, Andong Hua, Yao Qin

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2403.09766

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16842 2025-02-25 cs.CV 57%

Exploring Causes and Mitigation of Hallucinations in Large Vision Language Models

Yaqi Sun, Kyohei Atarashi, Koh Takeuchi, Hisashi Kashima

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16815 2025-02-25 cs.CV 57%

CLIP-SENet: CLIP-based Semantic Enhancement Network for Vehicle Re-identification

Liping Lu, Zihao Fu, Duanfeng Chu, Wei Wang, Bingrong Xu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16790 2025-02-25 cs.CL 57%

Are Large Language Models Good Data Preprocessors?

Elyas Meguellati, Nardiena Pratama, Shazia Sadiq, Gianluca Demartini

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08119 2025-02-25 cs.CV 57%

Q-VLM: Post-training Quantization for Large Vision-Language Models

Changyuan Wang, Ziwei Wang, Xiuwei Xu, Yansong Tang, Jie Zhou, Jiwen Lu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15381 2025-02-24 cs.CV 57%

MOVE: A Mixture-of-Vision-Encoders Approach for Domain-Focused Vision-Language Processing

Matvey Skripkin, Elizaveta Goncharova, Dmitrii Tarasov, Andrey Kuznetsov

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 10 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14976 2025-02-24 cs.LG cs.CR cs.CV 57%

EigenShield: Causal Subspace Filtering via Random Matrix Theory for Adversarially Robust Vision-Language Models

Nastaran Darabi, Devashri Naik, Sina Tayebati, Dinithi Jayasuriya, Ranganath Krishnan, Amit Ranjan Trivedi

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14881 2025-02-24 cs.CR cs.CV 57%

A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations

Mang Ye, Xuankun Rong, Wenke Huang, Bo Du, Nenghai Yu, Dacheng Tao

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13942 2025-02-20 cs.CV 57%

A Chain-of-Thought Subspace Meta-Learning for Few-shot Image Captioning with Large Vision and Language Models

Hao Huang, Shuaihang Yuan, Yu Hao, Congcong Wen, Yi Fang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments 11 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12469 2025-02-14 eess.SP cs.AI cs.LG cs.NI 57%

AI Flow at the Network Edge

Jiawei Shao, Xuelong Li

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

Comments This paper has been accepted to IEEE Network Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏