arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-25 至 2025-11-25 共收录 26 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 26 篇

2511.18875 2025-11-25 cs.CV cs.MM 84%

Parallel Vision Token Scheduling for Fast and Accurate Multimodal LMMs Inference

并行视觉令牌调度用于快速准确的多模态大语言模型推理

Wengyi Zhan, Mingbao Lin, Zhihang Lin, Rongrong Ji

机构 * Xiamen University(厦门大学) Rakuten Asia Pte. Ltd.(拉面亚洲有限公司) Xiamen University, China(厦门大学) Shanghai Innovation Institute, China(上海创新研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.MM

AI总结 ParVTS通过并行调度视觉令牌,高效减少多模态大语言模型推理的计算复杂度,实现高剪枝率与性能损失小的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17927 2025-11-25 cs.CV cs.AI 84%

PA-FAS: Towards Interpretable and Generalizable Multimodal Face Anti-Spoofing via Path-Augmented Reinforcement Learning

PA-FAS: 向可解释和通用的多模态人脸反伪装迈进:通过路径增强强化学习

Yingjie Ma, Xun Lin, Yong Xu, Weicheng Xie, Zitong Yu

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 PA-FAS通过路径增强强化学习提升多模态人脸反伪装的可解释性和泛化能力。

Comments Accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17596 2025-11-25 cs.CV cs.AI 84%

Reconstruction-Driven Multimodal Representation Learning for Automated Media Understanding

基于重建的多模态表示学习用于自动化媒体理解

Yassir Benhammou, Suman Kalyan, Sujay Kumar

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出多模态自编码器MMAE,通过统一学习文本、音频和视觉数据的表示,实现广播内容的端到端自动化元数据提取与语义聚类,提升广播档案的可检索性与管理效率。

Comments 8 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17952 2025-11-25 cs.CV 83%

Multi-speaker Attention Alignment for Multimodal Social Interaction

多说话者注意力对齐用于多模态社交互动

Liangyang Ouyang, Yifei Huang, Mingfang Zhang, Caixin Kang, Ryosuke Furuta, Yoichi Sato

机构 * The University of Tokyo(东京大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种多模态多说话者注意力对齐方法,通过动态头选择和自适应注意力偏差提升多模态社交互动理解能力,实现SOTA效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15122 2025-11-25 cs.IR cs.AI 83%

Multi-Aspect Cross-modal Quantization for Generative Recommendation

多方面跨模态量化用于生成性推荐

Fuwei Zhang, Xiaoyu Liu, Dongbo Xi, Jishen Yin, Huan Chen, Peng Yan, Fuzhen Zhuang, Zhao Zhang

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 MACRec通过多方面跨模态量化方法,提升生成性推荐中多模态信息利用和语义ID学习的性能。

Comments Accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18824 2025-11-25 cs.CV cs.CL 81%

Assessing the alignment between infants' visual and linguistic experience using multimodal language models

利用多模态语言模型评估婴儿的视觉和语言经验一致性

Alvin Wei Ming Tan, Jane Yang, Tarun Sepuri, Khai Loong Aw, Robert Z. Sparks, Zi Yin, Virginia A. Marchman, Michael C. Frank, Bria Long

机构 * Department of Psychology, Stanford University(心理学系,斯坦福大学) Department of Psychology, University of California, San Diego(心理学系,加州大学圣地亚哥分校) Department of Psychology, Tsinghua University(心理学系,清华大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 基于多模态语言模型评估婴儿视觉与语言经验一致性,揭示日常学习中视觉与语言对齐的稀有性及跨儿童差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17965 2025-11-25 cs.CV cs.MM 81%

Signal: Selective Interaction and Global-local Alignment for Multi-Modal Object Re-Identification

信号:选择性交互与全局-局部对齐用于多模态对象重识别

Yangyang Liu, Yuhao Wang, Pingping Zhang

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.MM

AI总结 Signal通过选择性交互和全局-局部对齐框架提升多模态对象重识别的性能。

Comments Accepted by AAAI2026. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14169 2025-11-25 cs.CV cs.AI 81%

AdaTok: Adaptive Token Compression with Object-Aware Representations for Efficient Multimodal LLMs

AdaTok: 一种基于对象感知表示的自适应令牌压缩方法,用于高效多模态大语言模型

Xinliang Zhang, Lei Zhu, Hangzhou He, Shuang Zeng, Ourui Fu, Jiakui Hu, Zhengjian Yao, Yanye Lu

机构 * Institute of Medical Technology, Peking University Health Science Center(北京大学医学部医学技术研究所) Department of Biomedical Engineering, Peking University(北京大学生物医学工程系) National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 AdaTok通过自适应令牌压缩方法,利用对象感知表示提升多模态大语言模型的效率,实现高压缩比与高性能的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15986 2025-11-25 cs.CV cs.CY cs.LG 80%

Fairness in Multi-modal Medical Diagnosis with Demonstration Selection

多模态医学诊断中的公平性与演示选择

Dawei Li, Zijian Gu, Peng Wang, Chuhan Song, Zhen Tan, Mohan Zhang, Tianlong Chen, Yu Tian, Song Wang

机构 * Arizona State University(亚利桑那州立大学) University of Rochester(罗切斯特大学) University of Virginia(弗吉尼亚大学) UCL(伦敦大学学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Central Florida(佛罗里达中央大学)

专题命中 多模态训练与对齐 :multi-modal(title,comments);multimodal(abstract);分类 cs.CV

AI总结 本文提出FADS方法,通过基于聚类的采样提升多模态医学影像诊断的公平性,减少性别、种族和族裔相关差异,同时保持高准确性。

Comments 10 pages (including 2 pages of references), 4 figures. This work explores fairness in multi-modal medical image reasoning using in-context learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19023 2025-11-25 cs.LG cs.AI 79%

OrdMoE: Preference Alignment via Hierarchical Expert Group Ranking in Multimodal Mixture-of-Experts LLMs

OrdMoE:通过多模态混合专家模型中的层次专家小组排名实现偏好对齐

Yuting Gao, Weihao Chen, Lan Wang, Ruihan Xu, Qingpei Guo

机构 * AntGroup(蚂蚁集团) Peking University(北京大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 OrdMoE通过利用混合专家架构中的内在信号,实现多模态混合专家语言模型的零成本偏好对齐,无需人工标注数据即可提升模型对齐和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18677 2025-11-25 cs.CV 79%

A Theory-Inspired Framework for Few-Shot Cross-Modal Sketch Person Re-Identification

基于理论的少样本跨模态素描人重识别框架

Yunpeng Gong, Yongjie Hou, Jiangming Shi, Kim Long Diep, Min Jiang

机构 * School of Informatics, Xiamen University(厦门大学信息学院) School of Electronic Science and Engineering, Xiamen University(厦门大学电子科学与技术学院) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院) Department of Artificial Intelligence, Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, School of Informatics, Key Laboratory of Digital Protection and Intelligent Processing of Intangible CulturalHeritage of Fujian and Taiwan, Ministry of Culture and Tourism, Xiamen University(人工智能系,教育部多媒体可信感知与高效计算重点实验室,厦门大学信息学院,福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室,文化和旅游部,厦门大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出KTCAA框架,通过理论指导的对齐增强和知识转移催化剂,解决少样本跨模态素描人重识别中的模态差距和数据稀缺问题。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23206 2025-11-25 cs.CV 79%

HyperPointFormer: Multimodal Fusion in 3D Space with Dual-Branch Cross-Attention Transformers

HyperPointFormer: 在三维空间中通过双分支交叉注意力变换器实现多模态融合

Aldino Rizaldy, Richard Gloaguen, Fabian Ewald Fassnacht, Pedram Ghamisi

机构 * Helmholtz-Zentrum Dresden-Rossendorf (HZDR)(德累斯顿-罗斯托克亥姆霍尔茨研究中心) Freie Universität Berlin(柏林自由大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 HyperPointFormer通过双分支交叉注意力Transformer在三维空间中融合多模态数据,提升城市场景土地利用分类的精度与灵活性。

Journal ref IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing, vol. 18, pp. 21254-21274, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00728 2025-11-25 eess.IV cs.CV cs.LG 79%

MultiFusionNet: Multilayer Multimodal Fusion of Deep Neural Networks for Chest X-Ray Image Classification

MultiFusionNet:多层多模态融合的深度神经网络用于胸部X光图像分类

Saurabh Agarwal, K. V. Arya, Yogesh Kumar Meena

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 MultiFusionNet通过多层多模态融合和FDSFM模块提升胸部X光图像分类的准确率,达到97.21%和99.60%

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18424 2025-11-25 cs.CV 79%

CrossJEPA: Cross-Modal Joint-Embedding Predictive Architecture for Efficient 3D Representation Learning from 2D Images

跨模态联合嵌入预测架构CrossJEPA:用于从2D图像高效学习3D表示的架构

Avishka Perera, Kumal Hewagamage, Saeedha Nazar, Kavishka Abeywardana, Hasitha Gallella, Ranga Rodrigo, Mohamed Afham

机构 * University of Moratuwa(摩图瓦大学) Technische Universität Darmstadt(达姆施塔特技术大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 CrossJEPA通过跨模态联合嵌入预测架构,利用图像基础模型知识,实现高效3D表示学习,达到SOTA性能,且训练高效、内存占用低。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17904 2025-11-25 cs.CV cs.RO 79%

CUS-GS: A Compact Unified Structured Gaussian Splatting Framework for Multimodal Scene Representation

CUS-GS: 一种紧凑的统一结构高斯点扩散框架用于多模态场景表示

Yuhang Ming, Chenxin Fang, Xingyuan Yu, Fan Zhang, Weichen Dai, Wanzeng Kong, Guofeng Zhang

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院) CAD & CG, Zhejiang University(浙江大学计算机辅助设计与图形学研究所) School of Computer Science, University of Bristol(布里斯托大学计算机科学学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 CUS-GS通过统一结构化高斯点扩散框架,实现多模态场景表示的高效建模与语义一致性。

Comments 15 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17587 2025-11-25 cs.LG cs.AI 79%

Emotion and Intention Guided Multi-Modal Learning for Sticker Response Selection

基于情感与意图引导的多模态学习用于贴纸响应选择

Yuxuan Hu, Jian Chen, Yuhao Wang, Zixuan Li, Jing Xiong, Pengyue Jia, Wei Wang, Chengming Li, Xiangyu Zhao

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出EIGML框架,通过联合建模情感与意图,提升贴纸响应选择的准确性和理解深度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18325 2025-11-25 q-bio.NC cs.LG 78%

Brain-MGF: Multimodal Graph Fusion Network for EEG-fMRI Brain Connectivity Analysis Under Psilocybin

Brain-MGF:多模态图融合网络用于psilocybin下EEG-fMRI脑连接分析

Sin-Yee Yap, Fuad Noman, Junn Yong Loo, Devon Stoliker, Moein Khajehnejad, Raphaël C. -W. Phan, David L. Dowe, Adeel Razi, Chee-Ming Ting

机构 * School of Information Technology, Monash University Malaysia(信息技术学院,墨尔本大学马来西亚分校) Department of Data Science and AI, Faculty of Information Technology, Monash University(数据科学与人工智能系,信息科技学院,墨尔本大学) Turner Institute for Brain and Mental Health, School of Psychological Sciences, Monash University(脑与心理健康研究所,心理学科学学院,墨尔本大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 Brain-MGF通过多模态图融合网络实现psilocybin下EEG-fMRI脑连接分析,提升冥想和休息状态下的区分准确率与F1分数。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12609 2025-11-25 cs.CL cs.AI cs.CV 75%

Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data

Uni-MoE-2.0-Omni: 通过先进MoE、训练和数据扩展语言导向的多模态大模型

Yunxin Li, Xinyu Chen, Shenyuan Jiang, Haoyuan Shi, Zhenyu Liu, Xuanyu Zhang, Nanhao Deng, Zhenran Xu, Yicheng Ma, Meishan Zhang, Baotian Hu, Min Zhang

机构 * Research Institute of Computing and Intelligence(计算与智能研究 institute) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Uni-MoE-2.0-Omni通过先进MoE、训练和数据技术,实现了语言导向的多模态大模型,展现出在多模态理解、推理和生成任务中的卓越性能。

Comments 47 pages,10 Figures, Project Website: https://idealistxy.github.io/Uni-MoE-v2.github.io/ Codes: https://github.com/HITsz-TMG/Uni-MoE

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01558 2025-11-25 cs.CV cs.AI 73%

VideoLights: Feature Refinement and Cross-Task Alignment Transformer for Joint Video Highlight Detection and Moment Retrieval

VideoLights: 用于联合视频亮点检测和时刻检索的特征细化与跨任务对齐变换器

Dhiman Paul, Md Rizwan Parvez, Nabeel Mohammed, Shafin Rahman

机构 * North South University(北南大学) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究 institute)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 VideoLights通过引入特征细化、跨模态融合和联合任务反馈机制,提升视频亮点检测与时刻检索的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17547 2025-11-25 eess.SP cs.AI cs.CV cs.HC cs.LG 62%

SYNAPSE: Synergizing an Adapter and Finetuning for High-Fidelity EEG Synthesis from a CLIP-Aligned Encoder

SYNAPSE: 适配器与微调协同实现高保真EEG信号到图像的合成

Jeyoung Lee, Hochul Kang

机构 * The Catholic University of Korea(韩国天主大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 SYNAPSE通过结合适配器与微调技术,实现了高保真EEG信号到图像的合成,提升了EEG数据的图像生成质量和跨受体泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06843 2025-11-25 cs.CL cs.AI 62%

Integrating Cognitive Processing Signals into Language Models: A Review of Advances, Applications and Future Directions

将认知处理信号整合进语言模型:关于进展、应用与未来方向的综述

Angela Lopez-Cardona, Sebastian Idesis, Ioannis Arapakis

机构 * Telefónica Scientific Research(Telefónica科学研究院) Universitat Politècnica de Catalunya(加泰罗尼亚理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了将认知信号,特别是眼动数据整合到语言模型中的最新进展、应用及未来方向,探讨了其在提升模型性能和解决环境成本方面的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18865 2025-11-25 cs.CV 57%

DualGazeNet: A Biologically Inspired Dual-Gaze Query Network for Salient Object Detection

DualGazeNet: 一种生物启发的双目注视查询网络用于显著物体检测

Yu Zhang, Haoan Ping, Yuchen Li, Zhenshan Bing, Fuchun Sun, Alois Knoll

机构 * School of Computation, Information and Technology, Technical University of Munich(计算信息与技术学院,慕尼黑技术大学) Department of Informatics, Technical University of Munich(信息学院,慕尼黑技术大学) University Research and Innovation Center, Obuda University(奥布达大学研究与创新中心) State Key Laboratory for Novel Software Technology, Nanjing University Suzhou Campus(新型软件技术国家重点实验室,南京大学苏州校区) School of Science and Technology, Nanjing University Suzhou Campus(科学与技术学院,南京大学苏州校区) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 DualGazeNet通过生物启发的纯Transformer框架,实现了显著物体检测的高效准确性和计算效率,超越了多种现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18028 2025-11-25 cs.CV 57%

MambaX: Image Super-Resolution with State Predictive Control

MambaX:基于状态预测控制的图像超分辨率

Chenyu Li, Danfeng Hong, Bing Zhang, Zhaojie Pan, Naoto Yokoya, Jocelyn Chanussot

机构 * Southeast University(东南大学) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所) College of Resources and Environment, University of Chinese Academy of Sciences(中国科学院大学资源与环境学院) School of Mathematics, Southeast University(东南大学数学学院) Department of Complexity Science and Engineering, Graduate School of Frontier Sciences, the University of Tokyo(东京大学前沿科学研究院复杂科学与工程部门) Univ. Grenoble Alpes, Inria, CNRS, Grenoble INP, LJK(格勒诺布尔阿尔卑斯大学、Inria、CNRS、Grenoble INP、LJK)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 MambaX通过动态状态预测控制和多模态融合方法提升图像超分辨率性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17967 2025-11-25 cs.CV 57%

CADTrack: Learning Contextual Aggregation with Deformable Alignment for Robust RGBT Tracking

CADTrack: 基于可变形对齐的上下文聚合学习用于鲁棒的RGBT跟踪

Hao Li, Yuhao Wang, Xiantao Hu, Wenning Hao, Pingping Zhang, Dong Wang, Huchuan Lu

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 CADTrack通过上下文聚合与可变形对齐框架,提升RGBT跟踪的鲁棒性和准确性。

Comments Accepted by AAAI2026. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17668 2025-11-25 cs.CV 57%

MedPEFT-CL: Dual-Phase Parameter-Efficient Continual Learning with Medical Semantic Adapter and Bidirectional Memory Consolidation

MedPEFT-CL:基于医学语义适配器和双向记忆巩固的双阶段参数高效持续学习

Ziyuan Gao

机构 * University College London(伦敦大学学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 MedPEFT-CL通过语义驱动适配器和双向记忆协调,实现医学视觉-语言任务中的参数高效持续学习,有效缓解灾难性遗忘。

Comments Accepted by WACV 2026 (round 2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13404 2025-11-25 cs.LG 50%

SWIR-LightFusion: Multi-spectral Semantic Fusion of Synthetic SWIR with Thermal IR (LWIR/MWIR) and RGB

SWIR-LightFusion: 多光谱合成SWIR与热红外(LWIR/MWIR)及RGB的语义融合

Muhammad Ishfaq Hussain, Ma Van Linh, Zubia Naz, Unse Fatima, Yeongmin Ko, Moongu Jeon

机构 * GIST(韩国全南大学) Kyungpook National University(庆尚国立大学) KISTI(韩国科学技术院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出SWIR-LightFusion框架,通过合成SWIR图像融合LWIR、RGB多模态数据,提升恶劣环境下的场景理解能力。

Journal ref Cluster Computing (Springer) as Volume 29, Issue 1, Article 48, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏