arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-06 至 2026-02-06 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 11 篇

2503.21843 2026-02-06 cs.CV cs.AI 84%

CMD-HAR: Cross-Modal Disentanglement for Wearable Human Activity Recognition

CMD-HAR:基于交叉模态解耦的可穿戴人类活动识别

Ying Yu, Siyao Li, Yixuan Jiang, Hang Xiao, Jingxi Long, Haotian Tang, Hanyu Liu, Chao Li

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CMD-HAR通过交叉模态解耦和时空注意力机制,提升可穿戴设备中人类活动识别的准确性和部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05729 2026-02-06 cs.CV cs.LG 83%

Adaptive Global and Fine-Grained Perceptual Fusion for MLLM Embeddings Compatible with Hard Negative Amplification

自适应全局与细粒度感知融合用于兼容硬负样本放大的人脸嵌入

Lexiang Hu, Youze Xue, Dian Li, Gang Liu, Zhouchen Lin

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能国家重点实验室,智能科学与技术学院,北京大学) Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)

专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出AGFF-Embed方法,通过自适应融合全局和细粒度语义信息,提升多模态嵌入在一般和细粒度理解上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22936 2026-02-06 cs.CV 83%

PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models

PPE:用于多模态大语言模型中token压缩的位置保持嵌入

Mouxiao Huang, Borui Jiang, Dehua Zheng, Hailin Hu, Kai Han, Xinghao Chen

机构 * Huawei Technologies(华为技术有限公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 PPE通过保持位置信息提升多模态大语言模型的token压缩效率和性能

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05646 2026-02-06 cs.LG 82%

Empowering Time Series Analysis with Large-Scale Multimodal Pretraining

通过大规模多模态预训练增强时间序列分析

Peng Chen, Siyuan Wang, Shiyan Hu, Xingjian Wu, Yang Shu, Zhongwen Rao, Meng Wang, Yijie Li, Bin Yang, Chenjuan Guo

机构 * East China Normal University, Shanghai, China(华东师范大学) HuaWei, ShenZhen, China(华为,深圳,中国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multimodal foundation model(abstract)

AI总结 本文提出HORAI模型,通过多模态预训练提升时间序列分析的泛化能力,实现零样本预测和异常检测的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04920 2026-02-06 cs.LG cs.SD 82%

CyIN: Cyclic Informative Latent Space for Bridging Complete and Incomplete Multimodal Learning

CyIN:循环信息潜在空间用于连接完整与不完整多模态学习

Ronghao Lin, Qiaolin He, Sijie Mai, Ying Zeng, Aolin Xiong, Li Huang, Yap-Peng Tan, Haifeng Hu

机构 * School of Electronics and Information Technology, Sun Yat-Sen University(中山大学电子与信息学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) School of Computer Science, South China Normal University(华南师范大学计算机科学学院) Desay SV Automotive Co., Ltd(德赛股份有限公司) Pazhou Laboratory(琶洲实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 CyIN通过构建循环信息潜在空间,解决多模态学习中完整与不完整数据之间的性能差距,实现统一优化。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04937 2026-02-06 cs.LG cs.AI cs.CL 81%

Linear Model Merging Unlocks Simple and Scalable Multimodal Data Mixture Optimization

线性模型合并解锁了简单且可扩展的多模态数据混合优化

Davide Berasi, Matteo Farina, Massimiliano Mancini, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过模型合并高效估算多模态数据混合效果,结合领域专家训练与参数空间组合,实现可扩展的混合优化方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07163 2026-02-06 cs.CV 79%

Test-time Adaptive Hierarchical Co-enhanced Denoising Network for Reliable Multimodal Classification

测试时自适应层次联合增强去噪网络用于可靠的多模态分类

Shu Shen, C. L. Philip Chen, Tong Zhang

机构 * The Guangdong Provincial Key Laboratory of Computational Intelligence and Cyberspace Information, the School of Computer Science and Engineering, South China University of Technology(广东省计算智能与网络信息重点实验室、计算机科学与工程学院、华南理工大学) The Pazhou Laboratory(琶洲实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出TAHCD网络,通过自适应稳定子空间对齐和样本自适应置信度对齐,有效去除多模态噪声,提升多模态分类的鲁棒性和泛化能力。

Comments 14 pages,9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06040 2026-02-06 cs.CV 70%

SwimBird: Eliciting Switchable Reasoning Mode in Hybrid Autoregressive MLLMs

SwimBird: 在混合自回归大语言模型中实现可切换的推理模式

Jintao Tong, Shilin Yan, Hongwei Xue, Xiaojun Tang, Kunyu Shi, Guannan Zhang, Ruixuan Li, Yixiong Zou

机构 * Huazhong University of Science and Technology(华中科技大学) Accio Team, Alibaba Group(阿里集团Accio团队)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 SwimBird通过动态切换三种推理模式,提升多模态大语言模型在视觉密集任务中的性能,同时保持文本推理能力。

Comments Project Page: https://accio-lab.github.io/SwimBird

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04904 2026-02-06 cs.LG cs.AI cs.MM eess.IV 62%

DCER: Dual-Stage Compression and Energy-Based Reconstruction

DCER:双阶段压缩与基于能量的重建

Yiwen Wang, Jiahao Qin

机构 * Yiwen Wang(无) Jiahao Qin(无)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 DCER通过双阶段压缩和基于能量的重建解决多模态融合中的噪声和缺失模态问题,实现鲁棒性提升。

Comments 13 pages, 2 figures, 8 tables. Submitted to ICML 2026. Code will be available on GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06035 2026-02-06 cs.CV cs.GR cs.RO 57%

InterPrior: Scaling Generative Control for Physics-Based Human-Object Interactions

InterPrior:为基于物理的人-物体交互扩展生成控制

Sirui Xu, Samuel Schulter, Morteza Ziyadi, Xialin He, Xiaohan Fei, Yu-Xiong Wang, Liangyan Gui

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 InterPrior通过大规模模仿预训练和强化学习微调,扩展生成控制以实现人形机器人在多样环境下泛化移动-操作技能。

Comments Webpage: https://sirui-xu.github.io/InterPrior/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01789 2026-02-06 cs.RO 50%

RFS: Reinforcement Learning with Residual Flow Steering for Dexterous Manipulation

RFS: 通过残差流引导的强化学习用于灵巧操作

Entong Su, Tyler Westenbroek, Anusha Nagabandi, Abhishek Gupta

机构 * University of Washington, Paul G. Allen School of Computer Science & Engineering(华盛顿大学,保罗·G·艾伦计算机科学与工程学院) Amazon Frontier AI & Robotics(亚马逊前沿人工智能与机器人)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 RFS通过残差流引导强化学习,实现高效适应预训练生成策略,提升灵巧操作任务的性能

详情

展开后加载摘要…

URL PDF HTML 收藏