arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-12 至 2026-01-12 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 5 篇

2601.03666 2026-01-12 cs.CL cs.AI cs.CV 89%

e5-omni: Explicit Cross-modal Alignment for Omni-modal Embeddings

e5-omni: 显式跨模态对齐用于多模态嵌入

Haonan Chen, Sicheng Gao, Radu Timofte, Tetsuya Sakai, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) University of Würzburg(乌尔姆大学) Waseda University(早稻田大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);omni-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 e5-omni通过显式对齐方法改进多模态嵌入,解决相似性尺度不一致、负样本效果下降和跨模态统计不匹配问题。

Comments https://huggingface.co/Haon-Chen/e5-omni-7B

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05538 2026-01-12 cs.CV 83%

DIFF-MF: A Difference-Driven Channel-Spatial State Space Model for Multi-Modal Image Fusion

DIFF-MF: 一种基于差分驱动的通道-空间状态空间模型用于多模态图像融合

Yiming Sun, Zifan Ye, Qinghua Hu, Pengfei Zhu

机构 * School of Automation, Southeast University(东南大学自动化学院) Low-Altitude Intelligence Lab, Xiong’an National Innovation Center Technology Co., Ltd.(雄安国家创新中心技术有限公司低空智能实验室) Xiong’an Guochuang Lantian Technology Co., Ltd.(雄安国创蓝天科技有限公司) School of Artificial Intelligence, Tianjin University(天津大学人工智能学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 DIFF-MF通过差分驱动的通道-空间状态空间模型,有效整合多模态图像信息,提升融合图像的质量和显著性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14329 2026-01-12 cs.MM 79%

TF-Mamba: Text-enhanced Fusion Mamba with Missing Modalities for Robust Multimodal Sentiment Analysis

具有缺失模态的文本增强融合Mamba用于鲁棒多模态情感分析

Xiang Li, Xianfu Cheng, Dezhuang Miao, Xiaoming Zhang, Zhoujun Li

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.MM

AI总结 TF-Mamba通过文本增强融合框架,有效处理多模态情感分析中缺失模态的问题,提升模型鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22947 2026-01-12 eess.SP 78%

Intelligent Multimodal Multi-Sensor Fusion-Based UAV Identification, Localization, and Countermeasures for Safeguarding Low-Altitude Economy

智能多模多传感器融合-based无人机识别、定位与防护系统用于保障低空经济安全

Yi Tao, Zhen Gao, Fangquan Ye, Jingbo Xu, Tao Song, Weidong Li, Yu Su, Lu Peng, Xiaomei Wu, Tong Qin, Zhongxiang Li, Dezhi Zheng

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出基于深度学习的多模多传感器融合系统,用于实现无人机的识别、定位与防护,提升低空经济安全防护效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05470 2026-01-12 cs.CV cs.CL 62%

ROAP: A Reading-Order and Attention-Prior Pipeline for Optimizing Layout Transformers in Key Information Extraction

ROAP:一种基于阅读顺序和注意力优先的流水线,用于优化布局变换器在关键信息提取中的应用

Tingwei Xie, Jinxin He, Yonghong Song

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 ROAP通过优化布局变换器的注意力分布,提升关键信息提取的性能,解决阅读顺序建模和视觉干扰问题。

Comments 10 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏