arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-30 至 2026-01-30 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 12 篇

2601.22020 2026-01-30 cs.LG cs.CV 83%

Visual-Guided Key-Token Regularization for Multimodal Large Language Model Unlearning

多模态大语言模型去敏中的视觉引导关键标记正则化

Chengyi Cai, Zesheng Ye, Peike Li, Bo Han, Jianzhong Qi, Feng Liu

机构 * The University of Melbourne(墨尔本大学) Google Research(谷歌研究) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出视觉引导的关键标记正则化方法,用于多模态大语言模型的去敏,通过信息熵定义关键标记并利用梯度重新加权提升去敏效果,实验表明能有效减少遗忘并保持响应一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22009 2026-01-30 cond-mat.mtrl-sci cs.AI cs.LG physics.comp-ph 83%

MEIDNet: Multimodal generative AI framework for inverse materials design

MEIDNet: 多模态生成式AI框架用于反向材料设计

Anand Babu, Rogério Almeida Gouvêa, Pierre Vandergheynst, Gian-Marco Rignanese

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 MEIDNet通过多模态生成式AI框架实现反向材料设计,利用对比学习提升学习效率,生成低带隙钙钛矿结构并验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21547 2026-01-30 cs.LG cs.AI 83%

Multi-Modal Time Series Prediction via Mixture of Modulated Experts

多模态时间序列预测 via 专家混合

Lige Zhang, Ali Maatouk, Jialin Chen, Leandros Tassiulas, Rex Ying

机构 * Duke Kunshan University, China(杜克昆山大学) Yale University, USA(耶鲁大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出专家调制方法,通过条件控制专家行为实现多模态时间序列预测的高效跨模态控制。

Comments 26 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21673 2026-01-30 cs.CV 79%

Multimodal Visual Surrogate Compression for Alzheimer's Disease Classification

多模态视觉代理压缩用于阿尔茨海默病分类

Dexuan Ding, Ciyuan Peng, Endrowednes Kuantama, Jingcai Guo, Jia Wu, Jian Yang, Amin Beheshti, Ming-Hsuan Yang, Yuankai Qi

机构 * Macquarie University(麦考瑞大学) Federation University Australia(联邦大学澳大利亚) The Hong Kong Polytechnic University(香港理工大学) University of California at Merced(加州大学默塞德分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 MVSC通过压缩和适应大尺寸3D sMRI体积为紧凑的2D视觉代理,提升阿尔茨海默病分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21453 2026-01-30 cs.AI 79%

LION: A Clifford Neural Paradigm for Multimodal-Attributed Graph Learning

LION: 一种基于克莱因代数的多模态属性图学习神经范式

Xunkai Li, Zhengyu Wu, Zekai Chen, Henan Sun, Daohan Su, Guang Zeng, Hongchao Qin, Rong-Hua Li, Guoren Wang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 LION基于克莱因代数和解耦图神经范式,通过几何诱导的高阶图传播实现模态交互,结合自适应全息聚合模块提升多模态属性图学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21426 2026-01-30 cs.CV 79%

MultiModal Fine-tuning with Synthetic Captions

多模态微调与合成描述

Shohei Enomoto, Shin'ya Yamaguchi

机构 * NTT Tokyo(日本NTT东京)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出通过多模态大语言模型生成合成描述,提升多模态微调效果,尤其在少样本学习中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21675 2026-01-30 cs.MM 70%

Rethinking Fusion: Disentangled Learning of Shared and Modality-Specific Information for Stance Detection

重新思考融合:为立场检测学习解耦的共享信息和模态特定信息

Zhiyu Xie, Fuqiang Niu, Genan Dai, Qianlong Wang, Li Dong, Bowen Zhang, Hu Huang

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.MM

AI总结 DiME通过解耦共享和模态特定信息提升多模态立场检测性能,采用对比学习和余弦对齐的专家模块实现更准确的立场预测。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21634 2026-01-30 cs.CV 57%

RSGround-R1: Rethinking Remote Sensing Visual Grounding through Spatial Reasoning

RSGround-R1: 重新思考通过空间推理的遥感视觉定位

Shiqi Huang, Shuting He, Bihan Wen

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(电气电子工程学院,南洋理工大学) MoE Key Laboratory of Interdisciplinary Research of Computation and Economics, Shanghai University of Finance and Economics(教育部计算与经济交叉学科重点实验室,上海财经大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 RSGround-R1通过引入空间推理引导的后训练框架,提升遥感图像中目标物体的定位精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21488 2026-01-30 cs.MM 57%

HADUA: Hierarchical Attention and Dynamic Uniform Alignment for Robust Cross-Subject Emotion Recognition

HADUA:层次注意力与动态统一对齐用于鲁棒的跨受体情绪识别

Jiahao Tang, Youjun Li, Yangxuan Zheng, Xiangting Fan, Siyuan Lu, Nuo Zhang, Zi-Gang Huang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.MM

AI总结 HADUA通过层次注意力与动态统一对齐方法,提升跨受体情绪识别的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20884 2026-01-30 cs.LG cs.AI 57%

Finetune-Informed Pretraining Boosts Downstream Performance

微调引导预训练提升下游性能

Atik Faysal, Mohammad Rostami, Reihaneh Gh. Roshan, Nikhil Muralidhar, Huaxia Wang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 FIP通过优化目标模态的表示学习,提升多模态下游任务性能,无需额外数据或计算资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21792 2026-01-30 cs.LG 50%

NetMamba+: A Framework of Pre-trained Models for Efficient and Accurate Network Traffic Classification

NetMamba+: 一种用于高效准确网络流量分类的预训练模型框架

Tongze Wang, Xiaohui Xie, Wenduo Wang, Chuyi Wang, Jinzhou Liu, Boyan Huang, Yannan Hu, Youjian Zhao, Yong Cui

机构 * Institute for Network Sciences and Cyberspace, Tsinghua University(网络科学与网络空间研究院,清华大学) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) Zhongguancun Laboratory(中关村实验室) Central South University(中南大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 NetMamba+通过高效架构、多模态表示和标签分布感知微调,实现高效准确的网络流量分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21420 2026-01-30 cs.LG 50%

ConceptMoE: Adaptive Token-to-Concept Compression for Implicit Compute Allocation

ConceptMoE: 适应性令牌到概念压缩以实现隐式计算分配

Zihao Huang, Jundong Zhou, Xingwei Qu, Qiyang Min, Ge Zhang

机构 * ByteDance Seed(字节跳动种子)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 ConceptMoE通过动态合并语义相似令牌实现隐式计算分配,提升语言和视觉语言任务性能,同时减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏