arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6903 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6903 篇

2510.21808 2025-10-28 cs.CV cs.AI 62%

Semantic Relation-Enhanced CLIP Adapter for Domain Adaptive Zero-Shot Learning

Jiaao Yu, Mingjie Han, Jinkun Jiang, Junyu Dong, Tao Gong, Man Lan

机构 * School of Computer Science and Technology, East China Normal University, China(东华大学计算机科学与技术学院) College of Computer Science and Technology, Ocean University of China, China(中国海洋大学计算机科学与技术学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21794 2025-10-28 cs.CV cs.AI 62%

Token-Level Inference-Time Alignment for Vision-Language Models

Kejia Chen, Jiawen Zhang, Jiacong Hu, Kewei Gao, Jian Lou, Zunlei Feng, Mingli Song

机构 * Zhejiang University(浙江大学) Sun Yat-sen University(中山大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22038 2025-10-24 cs.CV cs.AI 62%

Balanced Token Pruning: Accelerating Vision Language Models Beyond Local Optimization

Kaiyuan Li, Xiaoyue Chen, Chen Gao, Yong Li, Xinlei Chen

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) BNRist, Tsinghua University(清华大学北京研究院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01411 2025-10-17 cs.CV cs.AI 62%

ViTA-PAR: Visual and Textual Attribute Alignment with Attribute Prompting for Pedestrian Attribute Recognition

Minjeong Park, Hongbeen Park, Jinkyu Kim

机构 * Department of Computer Science and Engineering, Korea University, Seoul 02841, Korea(计算机科学与工程系,韩国大学,首尔02841,韩国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted to IEEE ICIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21976 2025-10-16 cs.CV cs.AI 62%

Geo-R1: Improving Few-Shot Geospatial Referring Expression Understanding with Reinforcement Fine-Tuning

Zilun Zhang, Zian Guan, Tiancheng Zhao, Haozhan Shen, Tianyu Li, Yuxiang Cai, Zhonggen Su, Zhaojun Liu, Jianwei Yin, Xiang Li

机构 * College of Computer Science and Technology of Zhejiang University(浙江大学计算机科学与技术学院) Polytechnic Institute of Zhejiang University(浙江大学Polytechnic学院) Om AI Research(Om AI研究机构) Binjiang Research Institute of Zhejiang University(浙江大学滨江研究机构) School of Software Engineering of Zhejiang University(浙江大学软件工程学院) School of Mathematical Sciences of Zhejiang University(浙江大学数学科学学院) China Academy of Space Technology(中国航天科技研究院) University of Bristol(布里斯托大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12482 2025-10-15 cs.CV cs.AI 62%

A Text-Image Fusion Method with Data Augmentation Capabilities for Referring Medical Image Segmentation

Shurong Chai, Rahul Kumar JAIN, Rui Xu, Shaocong Mo, Ruibo Hou, Shiyu Teng, Jiaqing Liu, Lanfen Lin, Yen-Wei Chen

机构 * College of Information Science and Engineering(信息科学与工程学院) Ritsumeikan University(立命馆大学) Tiwaki Co., Ltd.(Tiwaki公司) Dalian University of Technology(大连理工大学) School of Software(软件学院) Zhejiang University(浙江大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12287 2025-10-15 cs.CV cs.CL 62%

Vision Language Models Map Logos to Text via Semantic Entanglement in the Visual Projector

Sifan Li, Hongkai Chen, Yujun Cai, Qingwen Ye, Liyang Chen, Junsong Yuan, Yiwei Wang

机构 * University of California, Merced(加州大学梅尔德分校) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司) University of Queensland(昆士兰大学) UCLA(加州大学洛杉矶分校) University at Buffalo(布法罗大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12178 2025-10-15 cs.AI cs.CL 62%

Evolution of meta's llama models and parameter-efficient fine-tuning of large language models: a survey

Abdulhady Abas Abdullah, Arkaitz Zubiaga, Seyedali Mirjalili, Amir H. Gandomi, Fatemeh Daneshfar, Mohammadsadra Amini, Alan Salam Mohammed, Hadi Veisi

机构 * University of Kurdistan(库尔德斯坦大学) Queen Mary University(女王玛丽大学) Torrens University Australia(澳大利亚托伦斯大学) University of Technology Sydney(悉尼技术大学) University of Kurdistan Sanandaj, Iran(伊朗桑和杰德大学) TU Dortmund University(多特蒙德技术大学) University of Kurdistan Hewler(库尔德斯坦大学海勒) Tehran University(德黑兰大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21857 2025-10-15 cs.CV cs.AI cs.LG 62%

SPADE: Spatial Transcriptomics and Pathology Alignment Using a Mixture of Data Experts for an Expressive Latent Space

Ekaterina Redekop, Mara Pleasure, Zichen Wang, Kimberly Flores, Anthony Sisk, William Speier, Corey W. Arnold

机构 * Biomedical AI Research Lab, University of California, Los Angeles(生物医学人工智能研究实验室,加州大学洛杉矶分校) Department of Pathology, University of California, Los Angeles(病理学系,加州大学洛杉矶分校) Department of Radiology, University of California, Los Angeles(放射学系,加州大学洛杉矶分校) Department of Bioengineering, University of California, Los Angeles(生物工程系,加州大学洛杉矶分校) UCLA Medical Informatics Home Area, University of California, Los Angeles(UCLA医学信息学家庭区域,加州大学洛杉矶分校) Department of Computational Medicine, University of California, Los Angeles(计算医学系,加州大学洛杉矶分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11632 2025-10-14 cs.CV cs.AI cs.LG 62%

NV3D: Leveraging Spatial Shape Through Normal Vector-based 3D Object Detection

Krittin Chaowakarn, Paramin Sangwongngam, Nang Htet Htet Aung, Chalie Charoenlarpnopparut

机构 * The School of Information, Computer, and Communication Technology, Sirindhorn International Institute of Technology, Thammasat University(信息、计算机与通信技术学院,Sirindhorn国际技术学院,泰国朱拉隆梭大学) National Electronics and Computer Technology Center, National Science and Technology Development Agency(国家电子与计算机技术中心,国家科学技术发展局) Department of Electrical Engineering, Faculty of Engineering, Chulalongkorn University(电气工程系,工程学院,朱拉隆梭大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10264 2025-10-14 cs.CV cs.AI 62%

MRFD: Multi-Region Fusion Decoding with Self-Consistency for Mitigating Hallucinations in LVLMs

Haonan Ge, Yiwei Wang, Ming-Hsuan Yang, Yujun Cai

机构 * Department of Computer Science and Engineering, University of California at Merced(计算机科学与工程系,加州大学默塞德分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12661 2025-10-14 cs.LG cs.CL cs.CV 62%

VLMGuard-R1: Proactive Safety Alignment for VLMs via Reasoning-Driven Prompt Optimization

Menglan Chen, Xianghe Pang, Jingjing Dong, WenHao Wang, Yaxin Du, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08470 2025-10-10 cs.AI cs.CL cs.LG 62%

Looking to Learn: Token-wise Dynamic Gating for Low-Resource Vision-Language Modelling

Bianca-Mihaela Ganescu, Suchir Salhan, Andrew Caines, Paula Buttery

机构 * ALTA Institute(ALTA研究院) Department of Computer Science & Technology, University of Cambridge(计算机科学与技术系,剑桥大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

Comments Accepted to the EMNLP 2025 BabyLM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07910 2025-10-10 cs.LG cs.AI cs.CV 62%

MMM: Quantum-Chemical Molecular Representation Learning for Combinatorial Drug Recommendation

Chongmyung Kwon, Yujin Kim, Seoeun Park, Yunji Lee, Charmgil Hong

机构 * Handong Global University(Handong Global大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Medical Image Computing and Computer-Assisted Intervention (MICCAI) Predictive Intelligence in Medicine Workshop (MICCAI PRIME) 2025; 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23867 2025-10-09 cs.CL cs.AI 62%

InfiMed: Low-Resource Medical MLLMs with Advancing Understanding and Reasoning

Zeyu Liu, Zhitian Hou, Guanghao Zhu, Zhijie Sang, Congkai Xie, Hongxia Yang

机构 * The Hong Kong Polytechnic University(香港理工大学) Sun Yat-sen University(中山大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20752 2025-10-07 cs.CV cs.AI 62%

Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models

Huajie Tan, Yuheng Ji, Xiaoshuai Hao, Xiansheng Chen, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院自动化研究所人工智能学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 51 pages, 23 figures, NeurIPS'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02425 2025-10-06 cs.CL cs.CV cs.LG 62%

Words That Make Language Models Perceive

Sophie L. Wang, Phillip Isola, Brian Cheung

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05728 2025-10-01 cs.CV cs.AI cs.LG cs.RO 62%

LiDAR-BIND-T: Improved and Temporally Consistent Sensor Modality Translation and Fusion for Robotic Applications

Niels Balemans, Ali Anwar, Jan Steckel, Siegfried Mercelis

机构 * IDLab - Faculty of Applied Engineering, University of Antwerp - imec(IDLab - 应用工程学院,安特卫普大学 - imec) Cosys-Lab - Faculty of Applied Engineering, University of Antwerp(Cosys-Lab - 应用工程学院,安特卫普大学) Flanders Make Strategic Research Centre(弗拉芒制造战略研究中心)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12716 2025-09-29 cs.CL cs.AI 62%

Shadow-FT: Tuning Instruct Model via Training on Paired Base Model

Taiqiang Wu, Runming Yang, Jiayi Li, Pengfei Hu, Yik-Chung Wu, Ngai Wong, Yujiu Yang

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学) Tencent(腾讯)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 24 pages, 12 tables, 8 figures. Previous name: Shadow-FT: Tuning Instruct via Base

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.05798 2025-09-29 cs.CV cs.AI cs.LG 62%

Multi-View Hypercomplex Learning for Breast Cancer Screening

Eleonora Lopez, Eleonora Grassucci, Danilo Comminiello

机构 * Department of Information Engineering, Electronics and Telecommunications (DIET), Sapienza University of Rome(信息工程、电子与电信系(DIET),罗马萨皮恩扎大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

Comments This paper has been submitted to Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04183 2025-09-24 cs.CL cs.AI 62%

GALLa: Graph Aligned Large Language Models for Improved Source Code Understanding

Ziyin Zhang, Hang Yu, Shijie Li, Peng Di, Jianguo Li, Rui Wang

机构 * Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL、cs.AI

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05255 2025-09-23 cs.CV cs.CL 62%

Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning

Yana Wei, Liang Zhao, Jianjian Sun, Kangheng Lin, Jisheng Yin, Jingcheng Hu, Yinmin Zhang, En Yu, Haoran Lv, Zejia Weng, Jia Wang, Chunrui Han, Yuang Peng, Qi Han, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) StepFun BUPT(北京邮电大学) UCAS(中国科学院大学) THU(清华大学) HUST(华中科技大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12886 2025-09-17 cs.CL cs.AI 62%

The LLM Already Knows: Estimating LLM-Perceived Question Difficulty via Hidden Representations

Yubo Zhu, Dongrui Liu, Zecheng Lin, Wei Tong, Sheng Zhong, Jing Shao

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xidian University(西安电子科技大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07588 2025-09-10 cs.CL cs.AI 62%

BALI: Enhancing Biomedical Language Representations through Knowledge Graph and Language Model Alignment

Andrey Sakhovskiy, Elena Tutubalina

机构 * AIRI Sber AI ISP RAS Research Center for Trusted AI(俄罗斯科学院信息与系统研究所可信人工智能研究中心)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL、cs.AI

Comments 9 pages, 1 figure, published in "The 48th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2025)"

Journal ref Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval (2025). Association for Computing Machinery, 1152-1164

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11299 2025-09-09 cs.CL cs.AI 62%

BriLLM: Brain-inspired Large Language Model

Hai Zhao, Hongqiu Wu, Dongjie Yang, Anni Zou, Jiale Hong

机构 * AGI Institute(AGI研究院) Computer School(计算机学院) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00905 2025-09-04 cs.CV cs.AI 62%

Spotlighter: Revisiting Prompt Tuning from a Representative Mining View

Yutong Gao, Maoyuan Shao, Xinyang Huang, Chuang Zhu, Lijuan Sun, Yu Weng, Xuan Liu, Guoshun Nan

机构 * School of Information Engineering, Minzu University of China(中国民族大学信息工程学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) National Library of China, Beijing, China(中国国家图书馆) School of Cyberspace Security, Beijing University of Posts and Telecommunications(北京邮电大学网络空间安全学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted as EMNLP 2025 Findings

Journal ref EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01214 2025-09-03 cs.CV cs.MM 62%

PRINTER:Deformation-Aware Adversarial Learning for Virtual IHC Staining with In Situ Fidelity

Yizhe Yuan, Bingsen Xue, Bangzheng Pu, Chengxiang Wang, Cheng Jin

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.MM

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17367 2025-08-27 cs.CV cs.AI 62%

EVM-Fusion: An Explainable Vision Mamba Architecture with Neural Algorithmic Fusion

Zichuan Yang, Yongzhi Wang

机构 * School of Mathematical Sciences, Tongji University(数学科学学院,同济大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17638 2025-08-26 cs.CV cs.CL 62%

Dynamic Embedding of Hierarchical Visual Features for Efficient Vision-Language Fine-Tuning

Xinyu Wei, Guoli Yang, Jialu Zhou, Mingyue Yang, Leqian Li, Kedi Zhang, Chunping Qiu

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15123 2025-08-26 cs.CV cs.AI 62%

Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding

Ta Duc Huy, Duy Anh Huynh, Yutong Xie, Yuankai Qi, Qi Chen, Phi Le Nguyen, Sen Kim Tran, Son Lam Phung, Anton van den Hengel, Zhibin Liao, Minh-Son To, Johan W. Verjans, Vu Minh Hieu Phan

机构 * Australian Institute for Machine Learning, University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Macquarie University(麦考瑞大学) Hanoi University of Science and Technology(河内科学技术大学) University of Wollongong(沃林根大学) Flinders University(弗林德斯大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted at ICCV 2025 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏