arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-21 至 2026-01-21 共收录 20 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 20 篇

2601.13659 2026-01-21 cs.CL cs.AI cs.MM 85%

Temporal-Spatial Decouple before Act: Disentangled Representation Learning for Multimodal Sentiment Analysis

在动作前解耦时序与空间:用于多模态情感分析的解耦表示学习

Chunlei Meng, Ziyang Zhou, Lucas He, Xiaojing Du, Chun Ouyang, Zhongxue Gan

机构 * Fudan University(复旦大学) Shantou University(汕尾大学) University College London(伦敦大学学院) University of South Australia(澳大利亚南澳大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 本文提出TSDA方法,在动作前解耦时序与空间信息,通过因子一致对齐和门控重联模块提升多模态情感分析性能。

Comments This study has been accepted by IEEE ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02438 2026-01-21 cs.SE cs.AI cs.CR 83%

Focus on What Matters: Fisher-Guided Adaptive Multimodal Fusion for Vulnerability Detection

聚焦关键要素:基于Fisher信息的自适应多模态融合用于漏洞检测

Yun Bian, Yi Chen, HaiQuan Wang, ShiHao Li, Zhe Cui

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出TaCCS-DFA框架,通过Fisher信息引导的自适应多模态融合,提升漏洞检测的F1分数,同时降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13331 2026-01-21 cs.CV cs.LG 79%

MultiST: A Cross-Attention-Based Multimodal Model for Spatial Transcriptomic

MultiST: 一种基于交叉注意力的多模态模型用于空间转录组

Wei Wang, Quoc-Toan Ly, Chong Yu, Jun Bai

机构 * Department of Computer Science, University of Cincinnati(计算机科学系,辛辛那提大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 MultiST通过基于交叉注意力的多模态融合方法,实现了对空间转录组数据中空间拓扑、基因表达和组织形态的联合建模,提升了空间域边界解析的准确性和生物解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12994 2026-01-21 cs.CV 79%

AsyncBEV: Cross-modal Flow Alignment in Asynchronous 3D Object Detection

AsyncBEV: 无感异步3D目标检测中的跨模态流对齐

Shiming Wang, Holger Caesar, Liangliang Nan, Julian F. P. Kooij

专题命中 多模态训练与对齐 :cross-modal(title);multi-modal(abstract);分类 cs.CV

AI总结 AsyncBEV通过跨模态流对齐提升3D目标检测在传感器异步情况下的鲁棒性,尤其在动态物体识别中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11885 2026-01-21 cs.AI 79%

MyGram: Modality-aware Graph Transformer with Global Distribution for Multi-modal Entity Alignment

MyGram: 多模态实体对齐的模态感知图变换器与全局分布

Zhifei Li, Ziyue Qin, Xiangyu Luo, Xiaoju Hou, Yue Zhao, Miao Zhang, Zhifang Huang, Kui Xiao, Bing Yang

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI

AI总结 MyGram通过模态感知图变换器与全局分布机制,提升多模态实体对齐的性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13979 2026-01-21 cs.RO 78%

Active Cross-Modal Visuo-Tactile Perception of Deformable Linear Objects

主动跨模态视觉-触觉感知用于可变形线性物体

Raffaele Mazza, Ciro Natale, Pietro Falco

机构 * Dipartimento di Ingegneria, Università degli Studi della Campania Luigi Vanvitelli(工程学院,坎帕尼亚路易吉·范维蒂利大学) Dipartimento di Ingegneria dell’Informazione, Università degli Studi di Padova(信息工程学院,帕多瓦大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 本文提出一种结合视觉和触觉的跨模态感知框架,用于重建受遮挡的可变形线性物体的3D形状。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11545 2026-01-21 cs.HC 78%

Multimodal Data Fusion to Capture Dynamic Interactions between Built Environment and Vulnerable Older Adults

多模态数据融合以捕捉建成环境与易受伤害的老年人之间的动态交互

Houhao Liang, Azrin Jamaluddin, Kresimir Friganovic, Kirstie Neo, Raphael Han, Navrag Singh, Panos Mavros

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本研究通过多模态数据融合技术,探索建成环境对易受伤害老年人移动性的影响,为包容性城市规划提供数据支持。

Comments This work has been accepted to the AAAI 2026 Workshop on AI for Urban Planning

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15394 2026-01-21 cs.CV 70%

Doracamom: Joint 3D Detection and Occupancy Prediction with Multi-view 4D Radars and Cameras for Omnidirectional Perception

Doracamom:多视角4D雷达与摄像头联合3D检测与占用预测用于全方位感知

Lianqing Zheng, Jianan Liu, Runwei Guan, Long Yang, Shouyi Lu, Yuanzhe Li, Xiaokai Bai, Jie Bai, Zhixiong Ma, Hui-Liang Shen, Xichan Zhu

机构 * School of Automotive Studies, Tongji University(同济大学汽车学院) Momoni AI Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Chair of Automotive Engineering, Technische Universität Berlin(柏林技术大学汽车工程学系) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) School of Information and Electrical Engineering, Hangzhou City University(杭州城市学院信息与电气工程学院)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 Doracamom通过融合多视角4D雷达与摄像头,实现3D物体检测与语义占用预测,提升自动驾驶环境感知能力。

Comments Accepted by IEEE TCSVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12697 2026-01-21 cs.CV cs.CG 70%

Fusing in 3D: Free-Viewpoint Fusion Rendering with a 3D Infrared-Visible Scene Representation

在三维中融合:基于三维红外-可见场景表示的自由视角融合渲染

Chao Yang, Deshui Miao, Chao Tian, Guoqing Zhu, Yameng Gu, Zhenyu He

机构 * School of Computer Science(计算机科学学院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于三维红外-可见场景表示的融合框架,通过跨模态调整模块和融合损失确保融合图像保留关键特征,有效解决传统方法在复杂场景下的信息丢失问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12227 2026-01-21 cs.LG 67%

Learning Longitudinal Health Representations from EHR and Wearable Data

从电子健康记录和可穿戴数据中学习纵向健康表示

Yuanyun Zhang, Han Zhou, Li Feng, Yilin Hong, Shi Li

机构 * University of the Chinese Academy of Sciences, Columbia University(中国科学院大学,哥伦比亚大学)

专题命中 多模态训练与对齐 :multimodal(abstract);multimodal foundation model(abstract)

AI总结 本文提出一种多模态基础模型,通过联合表示电子健康记录和可穿戴数据,提升纵向健康预测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06504 2026-01-21 cs.CV cs.AI cs.RO 62%

Method of UAV Inspection of Photovoltaic Modules Using Thermal and RGB Data Fusion

基于热成像与RGB数据融合的光伏板无人机检测方法

Andrii Lysyi, Anatoliy Sachenko, Pavlo Radiuk, Mykola Lysyi, Oleksandr Melnychenko, Diana Zahorodnia

机构 * Khmelnytskyi National University(赫梅利尼茨基国立大学) Department of Informatics and Teleinformatics(信息学与电信学系) Kazimierz Pulaski University of Ra-dom(卡齐米日·波尼亚图夫斯基大学) National Academy of the State Border Service of Ukraine named after Bogdan Khmelnitsky(以博丹·赫梅利尼茨基命名的乌克兰国家边境服务学院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出了一种基于热成像与RGB数据融合的无人机光伏板检测方法,通过多模态系统实现自动化检测,提升电站安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13502 2026-01-21 cs.CV 57%

DIS2: Disentanglement Meets Distillation with Classwise Attention for Robust Remote Sensing Segmentation under Missing Modalities

DIS2: 通过类级注意机制实现解耦与蒸馏以在缺失模态下实现鲁棒的遥感分割

Nhi Kieu, Kien Nguyen, Arnold Wiliem, Clinton Fookes, Sridha Sridharan

机构 * Queensland University of Technology(昆士兰理工大学) Shield AI

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 DIS2通过类级注意机制实现解耦与蒸馏,以在缺失模态下实现鲁棒的遥感分割。

Comments Accepted to WACV 2026 - Computer Vision for Earth Observation Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03648 2026-01-21 cs.CL 57%

ELO: Efficient Layer-Specific Optimization for Continual Pretraining of Multilingual LLMs

ELO:面向多语言大语言模型持续预训练的高效分层优化

HanGyeol Yoo, ChangSu Choi, Minjun Kim, Seohyun Song, SeungWoo Song, Inho Won, Jongyoul Park, Cheoneum Park, KyungTae Lim

机构 * Seoul National University of Science and Technology(首尔科学技术大学) LG CNS Korea Advanced Institute of Science and Technology(韩国科学技术院) Hanbat National University(汉 bat 国立大学)

专题命中 多模态训练与对齐 :MLLM(abstract);分类 cs.CL

AI总结 ELO通过分层优化提升多语言大模型持续预训练效率,实现6.46倍加速和6.2%性能提升。

Comments 12 pages, Accepted to EACL 2026 (Industrial Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12303 2026-01-21 cs.CV 57%

Concepts from Representations: Post-hoc Concept Bottleneck Models via Sparse Decomposition of Visual Representations

表示法中的概念:通过视觉表示的稀疏分解实现事后概念瓶颈模型

Shizhan Gong, Xiaofan Zhang, Qi Dou

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出PCBM-ReD,通过视觉表示的稀疏分解,实现对预训练模型的可解释性增强,提升图像分类任务的准确性和可解释性。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12710 2026-01-21 cs.CV 57%

RIS-FUSION: Rethinking Text-Driven Infrared and Visible Image Fusion from the Perspective of Referring Image Segmentation

RIS-FUSION: 重新思考基于文本的红外和可见图像融合:从指代图像分割的角度

Siju Ma, Changsiyu Gong, Xiaofeng Fan, Yong Ma, Chengjie Jiang

机构 * Central University of Finance and Economics(中央财经大学) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 RIS-FUSION通过联合优化融合与指代图像分割,提升基于文本的红外和可见图像融合性能,实现mIoU指标的显著提升。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13927 2026-01-21 eess.IV 50%

Towards Modality-Agnostic Continual Domain-Incremental Brain Lesion Segmentation

面向模态无关的持续域增量性脑部病变分割

Yousef Sadegheih, Dorit Merhof, Pratibha Kumari

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 CLMU-Net通过灵活的模态处理和重放机制,提升持续域增量性脑部病变分割的性能和鲁棒性。

Comments Submitted to MIDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06980 2026-01-21 cs.DB cs.LG 50%

Relational Database Distillation: From Structured Tables to Condensed Graph Data

关系数据库蒸馏:从结构化表到压缩图数据

Xinyi Gao, Jingxi Zhang, Lijian Chen, Tong Chen, Lizhen Cui, Hongzhi Yin

机构 * The University of Queensland(昆士兰大学) Shandong University(山东大学)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本研究提出关系数据库蒸馏方法,将大规模结构化数据库压缩为紧凑图数据,保留预测能力,通过异质图结构和核岭回归引导目标实现高效学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12469 2026-01-21 physics.plasm-ph 50%

SPARC Tokamak Error Field Expectations and Physics-Based Correction Coil Design

SPARC环形磁体误差场预期与基于物理的校正线圈设计

N. C. Logan, C. E. Myers, R. Sweeney, C. Paz-Soldan, M. Pharr, N. Leuthold, M. Nickerson, J. Halpern, I. Stewart

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 SPARC环形磁体通过基于物理的校正线圈设计,实现高效误差场校正和抑制边缘局域模,确保高场运行稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21743 2026-01-21 cs.CY 50%

When Proximity Falls Short: Inequalities in Commuting and Accessibility by Public Transport in Santiago, Chile

当距离不足:智利圣地亚哥公共交通通勤与可达性中的不平等

Cesar Marin-Flores, Leo Ferres, Henrikki Tenkanen

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本研究利用移动电话数据分析智利圣地亚哥公共交通通勤与可达性不平等,发现社会经济群体间存在显著差异,高收入群体并未始终享有更短的通勤时间。

Comments 30 pages, Journal Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16245 2026-01-21 cs.LG q-bio.BM 50%

Large-Scale Multi-omic Biosequence Transformers for Modeling Protein-Nucleic Acid Interactions

大规模多组学生物序列变压器用于建模蛋白质-核酸相互作用

Sully F. Chen, Robert J. Steele, Glen M. Hocky, Beakal Lemeneh, Shivanand P. Lad, Eric K. Oermann

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 OmniBioTE是一种大规模多组学生物序列变压器,通过混合蛋白质和核酸数据训练,实现了对蛋白质-核酸相互作用的高效预测和结构信息学习。

Comments 47 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏