arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-06 至 2026-01-06 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 8 篇

2601.02249 2026-01-06 cs.CV 83%

SLGNet: Synergizing Structural Priors and Language-Guided Modulation for Multimodal Object Detection

SLGNet: 结合结构先验与语言引导调制的多模态目标检测

Xiantai Xiang, Guangyao Zhou, Zixiao Wen, Wenshuai Li, Ben Niu, Feng Wang, Lijia Huang, Qiantong Wang, Yuhan Liu, Zongxu Pan, Yuxin Hu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所) Key Laboratory of Target Cognition and Application Technology, Chinese Academy of Sciences(中国科学院目标认知与应用技术重点实验室) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 SLGNet通过结合结构先验与语言引导调制,在冻结的ViT基础上实现高效多模态目标检测,提升环境适应性和检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01339 2026-01-06 cs.CV 83%

Achieving Fine-grained Cross-modal Understanding through Brain-inspired Hierarchical Representation Learning

通过脑启发的分层表征学习实现细粒度跨模态理解

Weihang You, Hanqi Jiang, Yi Pan, Junhao Chen, Tianming Liu, Fei Dou

机构 * School of Computing, University of Georgia, Athens, GA, USA(计算学院,佐治亚大学,亚特兰大,GA,USA)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 NeuroAlign通过脑启发的分层表征学习,在fMRI-视频对齐中实现细粒度跨模态理解,提升跨模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21582 2026-01-06 cs.CV 79%

Data-Augmented Multimodal Feature Fusion for Multiclass Visual Recognition of Oral Cancer Lesions

数据增强多模态特征融合用于口腔癌病变的多类视觉识别

Joy Naoum, Revana Salama, Ali Hamdi

机构 * MSA University(MSA大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种数据增强驱动的多模态特征融合框架,用于提升口腔癌病变的多类视觉识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02315 2026-01-06 cs.CV 57%

Prithvi-Complimentary Adaptive Fusion Encoder (CAFE): unlocking full-potential for flood inundation mapping

普里提维-互补自适应融合编码器(CAFE):解锁洪水淹没制图的全部潜力

Saurabh Kaushik, Lalit Maurya, Beth Tellman

机构 * Center for Sustainability and the Global Environment (SAGE), University of Wisconsin–Madison(可持续性与全球环境中心(SAGE),威斯康星大学麦迪逊分校) Portsmouth AI and Data Science Centre (PAIDS), School of Computing, University of Portsmouth(波特兰人工智能与数据科学中心(PAIDS),计算学院,波特兰大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 普里提维-互补自适应融合编码器(CAFE)通过融合多通道多模态数据提升洪水制图的分割性能。

Comments Accepted at CV4EO Workshop @ WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02038 2026-01-06 cs.CV 57%

AlignVTOFF: Texture-Spatial Feature Alignment for High-Fidelity Virtual Try-Off

AlignVTOFF: 基于纹理-空间特征对齐的高保真虚拟试穿

Yihan Zhu, Mengying Ge

机构 * Sino-European School of Technology, Shanghai University(上海大学 sino-欧洲技术学院) National Demonstration Center for Experimental Engineering Training Education, Shanghai University(上海大学国家级实验工程培训教育示范中心)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 AlignVTOFF通过纹理-空间特征对齐提升虚拟试穿的高保真生成效果

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01926 2026-01-06 cs.CV 57%

MacVQA: Adaptive Memory Allocation and Global Noise Filtering for Continual Visual Question Answering

MacVQA: 适应性内存分配与全局噪声过滤用于连续视觉问答

Zhifei Li, Yiran Wang, Chenyi Xiong, Yujing Xia, Xiaoju Hou, Yue Zhao, Miao Zhang, Kui Xiao, Bing Yang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 MacVQA通过适应性内存分配和全局噪声过滤提升持续视觉问答的性能,实现更高的准确率和更低的遗忘率。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01925 2026-01-06 cs.CV 57%

AR-MOT: Autoregressive Multi-object Tracking

AR-MOT:自回归多目标跟踪

Lianjie Jia, Yuhan Wu, Binghao Ran, Yifan Wang, Lijun Wang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 AR-MOT通过自回归范式将多目标跟踪建模为序列生成任务,利用灵活的序列构建实现结构化输出,引入物体分词器和区域感知对齐模块,提升多模态和长期跟踪能力。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01870 2026-01-06 cs.CV 57%

Entity-Guided Multi-Task Learning for Infrared and Visible Image Fusion

实体引导的多任务学习用于红外和可见图像融合

Wenyu Shao, Hongbo Liu, Yunchuan Ma, Ruili Wang

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 EGMT通过实体引导的多任务学习方法,提升红外和可见图像融合的语义一致性与质量。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏