arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2509.06759 2025-09-09 cs.LG cs.AI 57%

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization

Thanh Thi Nguyen, Campbell Wilson, Janis Dalins

机构 * AiLECS Lab, Monash University Melbourne, Australia(墨尔本大学AiLECS实验室,澳大利亚) AiLECS Lab, Monash University, Australia ICMEC Australia, Sydney, Australia(墨尔本大学AiLECS实验室,澳大利亚 ICMEC澳大利亚,悉尼,澳大利亚)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

Comments Accepted for publication in the Proceedings of the 8th International Conference on Algorithms, Computing and Artificial Intelligence (ACAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05669 2025-09-09 cs.CV 57%

Context-Aware Multi-Turn Visual-Textual Reasoning in LVLMs via Dynamic Memory and Adaptive Visual Guidance

Weijie Shen, Xinrui Wang, Yuanqi Nie, Apiradee Boonmee

机构 * Beihua University(白华大学) Kasem Bundit University(Kasem Bundit大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19757 2025-09-09 cs.RO cs.CV 57%

Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy

Zhi Hou, Tianyi Zhang, Yuwen Xiong, Haonan Duan, Hengjun Pu, Ronglei Tong, Chengyang Zhao, Xizhou Zhu, Yu Qiao, Jifeng Dai, Yuntao Chen

机构 * Shanghai AI Lab(上海人工智能实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) Peking University(北京大学) SenseTime Research(商汤科技研究院) Tsinghua University(清华大学) HKISI, CAS(中国科学院香港中文大学研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Preprint; https://robodita.github.io; To appear in ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10032 2025-09-09 cs.CV 57%

Osprey: Pixel Understanding with Visual Instruction Tuning

Yuqian Yuan, Wentong Li, Jian Liu, Dongqi Tang, Xinjie Luo, Chi Qin, Lei Zhang, Jianke Zhu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Microsoft(微软) The HongKong Polytechnical University(香港理工大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments CVPR2024, Code and Demo link:https://github.com/CircleRadon/Osprey

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03800 2025-09-05 cs.CV 57%

MedVista3D: Vision-Language Modeling for Reducing Diagnostic Errors in 3D CT Disease Detection, Understanding and Reporting

Yuheng Li, Yenho Chen, Yuxiang Lai, Jike Zhong, Vanessa Wildman, Xiaofeng Yang

机构 * Department of Biomedical Engineering(生物医学工程系) Georgia Institute of Technology(佐治亚理工学院) Department of Machine Learning(机器学习系) Department of Radiation Oncology(放射肿瘤科) Emory University School of Medicine(埃默里大学医学院) University of Southern California(南加州大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13859 2025-09-03 cs.CV 57%

Learning Visual Proxy for Compositional Zero-Shot Learning

Shiyu Zhang, Cheng Yan, Yang Liu, Chenchen Jing, Lei Zhou, Wenjun Wang

机构 * Tianjin University(天津大学) Zhejiang University(浙江大学) Zhejiang University of Technology(浙江工业大学) Hainan University(海南大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00676 2025-09-03 cs.CV cs.LG 57%

LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model

Xiyao Wang, Chunyuan Li, Jianwei Yang, Kai Zhang, Bo Liu, Tianyi Xiong, Furong Huang

机构 * University of Maryland College Park(马里兰大学 College Park 分校) The Ohio State University(俄亥俄州立大学) National University of Singapore(新加坡国立大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15576 2025-08-29 cs.CV cs.LG 57%

Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models

Xin Huang, Ruibin Li, Tong Jia, Wei Zheng, Ya Wang

机构 * School of Artificial Intelligence and Software Engineering, Nanyang Normal University, Henan, China(人工智能与软件工程学院,南阳师范学院,河南) Institute for Artificial Intelligence, Peking University, Beijing, China(人工智能研究院,北京大学,北京) Collaborative Innovation Center of Intelligent Explosion-proof Equipment, Henan, China(智能防爆设备协同创新中心,河南)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted at the International Joint Conference on Artificial Intelligence (IJCAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17595 2025-08-26 cs.CV 57%

TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints

Vinh-Thuan Ly, Hoang M. Truong, Xuan-Huong Nguyen

机构 * University of Science, VNU-HCM(越南胡志明市国家大学) Vietnam National University(越南国家大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted for presentation at the IEEE/CVF International Conference on Computer Vision (ICCV) Workshops, 2025

Journal ref IEEE/CVF International Conference on Computer Vision (ICCV) Workshops, Hawaii, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13045 2025-08-26 cs.LG cs.CV 57%

Continual Learning for Generative AI: From LLMs to MLLMs and Beyond

Haiyang Guo, Fanhu Zeng, Fei Zhu, Jiayi Wang, Xukai Wang, Jingang Zhou, Hongbo Zhao, Wenzhuo Liu, Shijie Ma, Da-Han Wang, Xu-Yao Zhang, Cheng-Lin Liu

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences(中国科学院香港科学与创新研究院人工智能与机器人中心) School of Computer and Information Engineering, Xiamen University of Technology(厦门理工大学计算机与信息工程学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15798 2025-08-26 cs.CV 57%

MM-Retinal V2: Transfer an Elite Knowledge Spark into Fundus Vision-Language Pretraining

Ruiqi Wu, Na Su, Chenran Zhang, Tengfei Ma, Tao Zhou, Zhiting Cui, Nianfeng Tang, Tianyu Mao, Yi Zhou, Wen Fan, Tianxing Wu, Shenqi Jing, Huazhu Fu

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Department of Ophthalmology, The First Affiliated Hospital of Nanjing Medical University(南京医科大学第一附属医院眼科部) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) Institute of High-Performance Computing, Agency for Science, Technology and Research(科技研究局高性能计算研究所)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16292 2025-08-25 cs.AI cs.RO 57%

Do What? Teaching Vision-Language-Action Models to Reject the Impossible

Wen-Han Hsieh, Elvis Hsieh, Dantong Niu, Trevor Darrell, Roei Herzig, David M. Chan

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

Comments 9 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10225 2025-08-22 cs.CV 57%

Synthesizing Near-Boundary OOD Samples for Out-of-Distribution Detection

Jinglun Li, Kaixun Jiang, Zhaoyu Chen, Bo Lin, Yao Tang, Weifeng Ge, Wenqiang Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University, Shanghai(智能机器人与先进制造学院,复旦大学,上海) Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University, Shanghai(上海智能信息处理重点实验室,计算机科学与人工智能学院,复旦大学,上海) JIIOV Technology, Beijing(JIIOV技术,北京)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by ICCV 2025 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03984 2025-08-21 cs.CV 57%

CoT-Segmenter: Enhancing OOD Detection in Dense Road Scenes via Chain-of-Thought Reasoning

Jeonghyo Song, Kimin Yun, DaeUng Jo, Jinyoung Kim, Youngjoon Yoo

机构 * Department of Artificial Intelligence, Chung-Ang University(Chung-Ang大学人工智能系) Visual Intelligence Lab., ETRI(ETRI视觉智能实验室) University of Science and Technology (UST)(科技大学(UST)) School of Electronics Engineering, Kyungpook National University(Kyungpook国立大学电子工程学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 6 pages, 3 figures. Accepted at IEEE International Conference on Advanced Visual and Signal-Based Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12455 2025-08-19 cs.CV 57%

X-Ray-CoT: Interpretable Chest X-ray Diagnosis with Vision-Language Models via Chain-of-Thought Reasoning

Chee Ng, Liliang Sun, Shaoqing Tang

机构 * Universiti Teknologi Malaysia(马来西亚技术大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12400 2025-08-19 cs.CV 57%

MPCAR: Multi-Perspective Contextual Augmentation for Enhanced Visual Reasoning in Large Vision-Language Models

Amirul Rahman, Qiang Xu, Xueying Huang

机构 * University of Malaya(马来大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10357 2025-08-19 cs.CV 57%

Optimization of Prompt Learning via Multi-Knowledge Representation for Vision-Language Models

Enming Zhang, Bingke Zhu, Yingying Chen, Qinghai Miao, Ming Tang, Jinqiao Wang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) Wuhan AI Research(武汉人工智能研究所) Peng Cheng Laboratory(鹏城实验室)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11341 2025-08-18 cs.CV cs.CR cs.LG 57%

Semantically Guided Adversarial Testing of Vision Models Using Language Models

Katarzyna Filus, Jorge M. Cruz-Duarte

机构 * Institute of Theoretical and Applied Informatics, Polish Academy of Sciences(波兰科学院理论与应用信息学研究所) University of Lille, CNRS, Inria, Centrale Lille, UMR 9189 CRIStAL(里尔大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments 12 pages, 4 figures, 3 tables. Submitted for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10645 2025-08-15 cs.CV 57%

SemPT: Semantic Prompt Tuning for Vision-Language Models

Xiao Shi, Yangjun Ou, Zhenzhong Chen

机构 * School of Computer Science and Artificial Intelligence, Wuhan Textile University(武汉纺织大学计算机科学与人工智能学院) School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感与信息工程学院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10333 2025-08-15 cs.RO cs.CV 57%

ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver

Wenxuan Song, Ziyang Zhou, Han Zhao, Jiayi Chen, Pengxiang Ding, Haodong Yan, Yuxin Huang, Feilong Tang, Donglin Wang, Haoang Li

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07985 2025-08-15 cs.CV 57%

Common Data Properties Limit Object-Attribute Binding in CLIP

Bijay Gurung, David T. Hoffmann, Thomas Brox

机构 * University of Freiburg(弗赖堡大学) deepset

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments accepted at GCPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06564 2025-08-14 cs.CV 57%

Grounding Emotion Recognition with Visual Prototypes: VEGA -- Revisiting CLIP in MERC

Guanyu Hu, Dimitrios Kollias, Xinyu Yang

机构 * Xi'an Jiaotong University(西安交通大学) Queen Mary University of London(伦敦女王玛丽大学) Center for Multimodal AI(多模态人工智能中心) Digital Environment Research Institute(数字环境研究院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments accepted for publication at ACM Multimedia (ACM MM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22398 2025-08-14 cs.CV 57%

On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations

Jordan Vice, Naveed Akhtar, Yansong Gao, Richard Hartley, Ajmal Mian

机构 * University of Western Australia(西澳大学) University of Melbourne(墨尔本大学) Australian National University(澳大利亚国立大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Keywords: Vision-Language Models, Frequency-Domain Perturbations, Adversarial Robustness, Image Authenticity, Reliability

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17609 2025-08-14 cs.AI 57%

Integrating Visual Interpretation and Linguistic Reasoning for Math Problem Solving

Zixian Guo, Ming Liu, Qilong Wang, Zhilong Ji, Jinfeng Bai, Lei Zhang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨理工大学) The Hong Kong Polytechnic University(香港理工大学) Tianjin University(天津大学) Tomorrow Advancing Life(明天进步生命) Pazhou Lab, Guangzhou(广州琶洲实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03926 2025-08-13 cs.CV 57%

Multiple Stochastic Prompt Tuning for Few-shot Adaptation under Extreme Domain Shift

Debarshi Brahma, Soma Biswas

机构 * Indian Institute of Science(印度科学研究院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07318 2025-08-12 cs.CV 57%

RORPCap: Retrieval-based Objects and Relations Prompt for Image Captioning

Jinjing Gu, Tianbao Qin, Yuanyuan Pu, Zhengpeng Zhao

机构 * School of Information Science and Engineering(信息科学与工程学院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07260 2025-08-12 cs.CV 57%

Small-Large Collaboration: Training-efficient Concept Personalization for Large VLM using a Meta Personalized Small VLM

Sihan Yang, Huitong Ji, Shaolin Lu, Jiayi Chen, Binxiao Xu, Ming Lu, Yuanxing Zhang, Wenhui Dong, Wentao Zhang

机构 * Peking University(北京大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06525 2025-08-12 cs.CV 57%

Large Language Models Facilitate Vision Reflection in Image Classification

Guoyuan An, JaeYoon Kim, SungEui Yoon

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06452 2025-08-11 cs.CV cs.LG 57%

TRUST: Leveraging Text Robustness for Unsupervised Domain Adaptation

Mattia Litrico, Mario Valerio Giuffrida, Sebastiano Battiato, Devis Tuia

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04987 2025-08-08 cs.CV 57%

Unified modality separation: A vision-language framework for unsupervised domain adaptation

Xinyao Li, Jingjing Li, Zhekai Du, Lei Zhu, Heng Tao Shen

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Tongji University(同济大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted to TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏