arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6929 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6929 篇

2604.21056 2026-04-24 physics.med-ph 50%

Radiomics-Guided Vision Transformers for Survival Analysis

基于放射组学的视觉变换器用于生存分析

Qiyuan Shi, Yi Li

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出一种结合放射组学与视觉变换器的模型,通过多模态Cox框架和对比对齐提升生存分析的预测性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20621 2026-04-23 cs.CR 50%

SoK: The Next Frontier in AV Security: Systematizing Perception Attacks and the Emerging Threat of Multi-Sensor Fusion

SoK:自动驾驶安全的下一个前沿:系统化感知攻击与多传感器融合的新兴威胁

Shahriar Rahman Khan, Tariqul Islam, Raiful Hasan

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本文系统化分析了48篇关于自动驾驶感知层攻击的研究,揭示了从单传感器攻击到多传感器融合威胁的发展趋势,指出现有研究在现实测试、短期评估偏见及跨传感器一致性防御方面的不足,并提出融合感知安全的设计方向。

Comments 20 Pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18152 2026-04-21 stat.ML cs.LG 50%

mlr3torch: A Deep Learning Framework in R based on mlr3 and torch

mlr3torch: 基于mlr3和torch的深度学习框架

Sebastian Fischer, Lukas Burk, Carson Zhang, Bernd Bischl, Martin Binder

机构 * LMU Munich(慕尼黑莱布尼茨大学) MCML(预防研究与流行病学研究所) Leibniz Institute for Prevention Research and Epidemiology - BIPS(预防研究与流行病学研究所) University of Bremen(布伦瑞大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文介绍mlr3torch框架,基于mlr3生态系统构建,简化了神经网络的定义、训练和评估,支持表格数据和通用张量,提供预定义架构和图形化建模流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18021 2026-04-21 eess.SP 50%

Paradigm Shift from Statistical Channel Modeling to Digital Twin Prediction: An Environment-Generalizable ChannelLM for 6G AI-enabled Air Interface

从统计信道建模到数字孪生预测的范式转变:一种适用于6G AI赋能空气接口的环境通用化信道LM

Yichen Cai, Yuelong Qiu, Jianhua Zhang, Li Yu, Yuxiang Zhang, Zhen Zhang, Guangyi Liu

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出一种环境通用化的信道LM驱动的数字孪生架构,通过动态物体检测和多模态对齐实现高精度环境重建,结合物理可解释的特征提取和信道LM核心,实现多任务信道预测,实验表明在未见过的环境中,信道状态信息预测误差降低4.23 dB,端到端推理延迟仅70毫秒。

Comments 16 pages, 12 figures, Submitted to Nature Partner Journals Wireless Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15705 2026-04-20 cs.LG 50%

Towards Robust Endogenous Reasoning: Unifying Drift Adaptation in Non-Stationary Tuning

迈向稳健的内生推理:统一非平稳调谐中的漂移适应

Xiaoyu Yang, En Yu, Wei Duan, Jie Lu

机构 * Australian Artificial Intelligence Institute (AAII)(澳大利亚人工智能研究所) Faculty of Engineering and Information Technology(工程与信息技术学院)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出CPO++框架,解决多模态大语言模型在内生推理中的漂移问题,通过反事实推理与领域知识结合,提升推理连贯性和决策精度,适用于医疗诊断和自动驾驶等安全关键领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15469 2026-04-20 stat.ME 50%

Sample continuation in Bayesian hierarchical model via variational inference

通过变分推断在贝叶斯分层模型中进行样本延续

Yucong Liu, Zilai Si, Alexander Strang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究通过变分推断跟踪先验参数变化对后验分布的影响,分析后验分布对先验假设的敏感性,并在先验假设显著改变时实现解的延续。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13560 2026-04-16 cs.LG cs.ET quant-ph 50%

Parameter-efficient Quantum Multi-task Learning

参数高效的量子多任务学习

Hevish Cowlessur, Chandra Thapa, Tansu Alpcan, Seyit Camtepe

机构 * CSIRO(澳大利亚联邦科学与工业研究组织)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出参数高效的量子多任务学习框架,通过量子预测头替代传统任务特定线性头,实现任务专一性与参数效率的平衡,实验表明在自然语言处理、医学影像和多模态讽刺检测等任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17976 2026-04-15 stat.CO cs.LG 50%

metasnf: Meta Clustering with Similarity Network Fusion in R

metasnf:基于相似性网络融合的元聚类在R中

Prashanth S Velayudhan, Xiaoqiao Xu, Prajkta Kallurkar, Ana Patricia Balbon, Maria T Secara, Adam Taback, Denise Sabac, Nicholas Chan, Shihao Ma, Bo Wang, Daniel Felsky, Stephanie H Ameis, Brian Cox, Colin Hawco, Lauren Erdman, Anne L Wheeler

机构 * Hospital for Sick Children(Sick Children 医院) University of Toronto(多伦多大学) Centre for Addiction and Mental Health(成瘾与心理健康中心)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 metasnf包通过元聚类方法,利用相似性网络融合实现高效搜索聚类解,提供可视化、表征和验证功能,帮助研究者发现基于上下文的聚类解。

Comments 66 pages, 26 figures, provisionally accepted at Journal of Statistical Software

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09374 2026-04-15 quant-ph cs.LG 50%

Variational Quantum Physics-Informed Neural Networks for Hydrological PDE-Constrained Learning with Inherent Uncertainty Quantification

变分量子物理信息神经网络用于具有内在不确定性量化的水文PDE约束学习

Prasad Nimantha Madusanka Ukwatta Hewage, Midhun Chakkravarthy, Ruvan Kumara Abeysekara

机构 * Faculty of Computer Science and Multimedia, Lincoln University College, Petaling Jaya, Selangor, Malaysia(计算机科学与多媒体学院,林肯大学学院,Petaling Jaya,Selangor,马来西亚)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出一种融合参数化变分量子电路的混合量子-经典物理信息神经网络,用于水文PDE约束学习,通过量子态编码多源遥感特征,并利用圣文森特浅水方程和曼宁流方程作为可微物理损失项,实现不确定性量化。

Comments 25 pages, 6 tables. Code available at https://github.com/nimanpra/HQC-PINN-Flood-Prediction. v2: corrected reference attributions in Section II.B

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10982 2026-04-14 cs.RO 50%

Ψ-Map: Panoptic Surface Integrated Mapping Enables Real2Sim Transfer

Ψ-Map:全景表面集成映射实现真实到仿真转移

Xuan Yu, Yuxuan Xie, Changjian Jiang, Shichao Zhai, Rong Xiong, Yu Zhang, Yue Wang

机构 * Department of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 Ψ-Map通过整合几何强化、端到端学习和高效渲染,实现大规模场景中高精度全景重建,兼顾几何精度与实时推理,满足机器人仿真需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10593 2026-04-14 cs.RO 50%

MonoEM-GS: Monocular Expectation-Maximization Gaussian Splatting SLAM

MonoEM-GS: 单目期望-最大化高斯点云SLAM

Evgenii Kruzhkov, Sven Behnke

机构 * Autonomous Intelligent Systems group, Computer Science Institute VI – Intelligent Systems and Robotics – and the Center for Robotics and the Lamarr Institute for Machine Learning and Artificial Intelligence, University of Bonn(波恩大学自主智能系统组、计算机科学研究所VI——智能系统与机器人学——以及机器人中心与拉马尔机器学习和人工智能研究所)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 MonoEM-GS通过整合几何预测到全局高斯点云表示中,解决视点依赖性和噪声问题,结合期望-最大化方法稳定几何并采用ICP对齐估计姿态,支持多模式特征参数化实现开放集分割等下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08910 2026-04-13 cs.HC 50%

Lightweight and Generalizable Multi-Sensor Human Activity Recognition via Cascaded Fusion and Style-Augmented Decomposition

轻量且通用的多传感器人类活动识别:通过级联融合与风格增强分解

Wang Chenglong, Zhuo Yan, Ding Wenbo, Chen Xinlei

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出一种轻量且通用的多传感器人类活动识别框架,通过级联融合与风格增强分解提升效率与鲁棒性,实验表明在Realdisp和Skoda数据集上优于现有方法,计算开销降低超30%。

Comments 8 pages. arXiv admin note: text overlap with arXiv:2501.10917 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15409 2026-04-10 eess.SP cs.LG q-bio.NC 50%

Coupled generator decomposition for fusion of electro- and magnetoencephalography data

耦合生成器分解用于脑电与磁脑图数据融合

Anders Stevnhoved Olsen, Jesper Duemose Nielsen, Morten Mørup

机构 * Department of Applied Mathematics and Computer Science, Technical University of Denmark(丹麦技术大学应用数学与计算机科学系) Danish Research Centre for Magnetic Resonance, Centre for Functional and Diagnostic Imaging and Research, Copenhagen University Hospital Amager and Hvidovre(丹麦磁共振研究中心,功能与诊断影像及研究中心,哥本哈根大学医院阿迈厄和海维德夫)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出耦合生成器分解方法,用于融合脑电和磁脑图数据,通过稀疏主成分分析扩展,识别共同特征并处理模态和个体差异。

Journal ref EUSIPCO2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07071 2026-04-09 cs.HC cs.CR 50%

BioMoTouch: Touch-Based Behavioral Authentication via Biometric-Motion Interaction Modeling

BioMoTouch:基于生物-运动交互建模的触控行为认证

Zijian Ling, Jianbang Chen, Hongwei Li, Hongda Zhai, Man Zhou, Jun Feng, Zhengxiong Li, Qi Li, Qian Wang

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 BioMoTouch通过整合电容触控屏与惯性传感器信号,建立生物特征与行为动态的联合模型,实现高鲁棒性的触控认证,实验显示其在99.71%的平衡准确率和0.27%的误判率下表现优异。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05614 2026-04-08 cs.RO 50%

Grounding Hierarchical Vision-Language-Action Models Through Explicit Language-Action Alignment

通过显式语言-动作对齐实现层次化视觉-语言-动作模型的 grounding

Theodor Wulff, Federico Tavella, Rahul Singh Maharjan, Manith Adikari, Angelo Cangelosi

机构 * The University of Manchester(曼彻斯特大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出通过显式语言-动作对齐训练框架,提升视觉-语言-动作模型的 grounding 能力,基于 LanguageTable 数据集验证了多模态 grounding 表示的有效性,并建立强基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04243 2026-04-07 cs.NI 50%

RELIEF: Turning Missing Modalities into Training Acceleration for Federated Learning on Heterogeneous IoT Edge

RELIEF: 将缺失的模态转化为联邦学习在异构物联网边缘设备上的训练加速

Beining Wu, Zihao Ding, Jun Huang

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 针对异构物联网边缘设备中系统-模态-数据异质性问题,提出RELIEF框架,通过将低秩适应(LoRA)投影矩阵划分模态对齐的列块,实现聚合、弹性训练和通信的统一接口,提升训练效率和资源利用率。

Comments 14 pages, submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04016 2026-04-07 cs.RO 50%

Odometry Calibration and Pose Estimation of a 4WIS4WID Mobile Wall Climbing Robot

四轮独立转向四轮独立驱动壁爬机器人姿态估计与里程计校准

Branimir Ćaran, Vladimir Milić, Marko Švaco, Bojan Jerbić

机构 * Croatian Academy of Sciences and Arts(克罗地亚科学与艺术学院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文基于多模态测量融合设计了四轮独立转向四轮独立驱动壁爬机器人姿态估计器,采用扩展卡尔曼滤波和无迹卡尔曼滤波方法,解决传统定位传感器在复杂建筑立面环境中的不可行性问题。

Comments ACCEPTED FOR IEEE EUROPEAN CONFERENCE ON MOBILE ROBOTS 2025. PREPRINT VERSION. ACCEPTED JUNE, 2025 AND PRESENTED SEPTEMBER, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02501 2026-04-06 eess.SP 50%

ECG Foundation Models and Medical LLMs for Agentic Cardiovascular Intelligence at the Edge: A Review and Outlook

ECG基础模型与医疗大语言模型用于边缘端心血管智能:综述与展望

Mudassir Hasan Khan, Ahmad Nayfeh, Mudassir Masood, Ali Ahmad Al-Shaikhi, Muhammad Mahboob Ur Rahman, Tareq Y. Al-Naffouri

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文综述了用于心血管疾病诊断、监测和临床决策支持的ECG基础模型和医疗大语言模型,探讨了其在边缘计算中的应用及未来发展方向。

Comments 18 pages, 4 figures, 4 tables, under review with a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01526 2026-04-03 cs.LG 50%

Learning ECG Image Representations via Dual Physiological-Aware Alignments

通过双生理感知对齐学习ECG图像表示

Hung Manh Pham, Jialu Tang, Aaqib Saeed, Dong Ma, Bin Zhu, Pan Zhou

机构 * University of Cambridge(剑桥大学) Singapore Management University(新加坡管理大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出ECG-Scan框架,通过多模态对比对齐和软导联约束,提升ECG图像表示学习效果,验证了图像模型在心血管诊断中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29478 2026-04-01 physics.ao-ph 50%

30-meter Land Surface Temperature from Landsat via Progressive Self-Training Downscaling

基于Landsat的30米地表温度降尺度方法

Huanfeng Shen, Chan Li, Menghui Jiang, Penghai Wu, Guanhao Zhang, Tian Xie

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本文提出一种渐进自训练框架,通过交叉模态融合网络在无需高精度地面数据的情况下,将Landsat地表温度降尺度至30米分辨率,提升了空间分辨率和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29354 2026-04-01 eess.SP cs.SY eess.SY stat.ME 50%

ARC: Alignment-based RPM Estimation with Curvature-adaptive Tracking

基于对齐的无转速计转速估计与曲率自适应跟踪

Weiheng Hua, Changyu Hao

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出ARC方法,通过统一观测表示融合多个估计器,利用曲率感知的状态依赖运动先验,实现稳定且物理合理的轨迹估计,验证了不确定性感知的时间传播的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29205 2026-04-01 cs.HC 50%

BiMoE: Brain-Inspired Experts for EEG-Dominant Affective State Recognition

BiMoE:受脑启发的专家用于EEG主导的情感状态识别

Hongyu Zhu, Lin Chen, Mingsheng Shang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 BiMoE通过脑拓扑感知划分EEG信号,利用双流编码器提取局部和全局时空特征,结合多尺度大核卷积处理PPS,动态融合专家并通过联合损失函数提升多模态情感分类性能。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28529 2026-03-31 eess.SY cs.SY 50%

Intelligent Radio Resource Slicing for 6G In-Body Subnetworks

面向6G体内子网络的智能无线电资源切片

Samira Abdelrahman, Hossam Farag

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本文提出基于SAC算法的智能资源切片策略,解决IBS与eMBB用户共存问题,通过优化奖励函数提升用户体验并保障服务质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27672 2026-03-31 stat.ML cs.LG 50%

Energy Score-Guided Neural Gaussian Mixture Model for Predictive Uncertainty Quantification

基于能量分数的神经高斯混合模型用于预测不确定性量化

Yang Yang, Chunlin Ji, Haoyang Li, Ke Deng

机构 * Kuang-Chi Institute of Advanced Technology(光启高等理工研究院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出NE-GMM模型,结合高斯混合模型与能量分数,提升预测不确定性量化能力,通过理论证明和实验验证其有效性。

Comments 39 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26799 2026-03-31 cs.LG 50%

Gaussian Joint Embeddings For Self-Supervised Representation Learning

高斯联合嵌入用于自监督表示学习

Yongchao Huang

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出基于生成联合建模的高斯联合嵌入(GJE)和其多模态扩展GMJE,通过联合密度建模替代黑盒预测,实现对潜在空间几何的控制,并解决传统方法在多模态逆问题中的局限性。

Comments 92 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17339 2026-03-30 cs.LG 50%

ReBaPL: Repulsive Bayesian Prompt Learning

ReBaPL:排斥式贝叶斯提示学习

Yassir Bendou, Omar Ezzahir, Eduardo Fernandes Montesuma, Gabriel Mahuas, Victoria Shevchenko, Mike Gartrell

机构 * Sigma Nova Rhizome Labs

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出ReBaPL,一种基于贝叶斯推理的提示学习方法,通过引入排斥力促进探索,提升模型鲁棒性和泛化能力。

Journal ref The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14612 2026-03-27 cs.RO 50%

Proprioceptive Image: An Image Representation of Proprioceptive Data from Quadruped Robots for Contact Estimation Learning

本体图像:四足机器人的本体数据图像表示用于接触估计学习

Gabriel Fischer Abati, João Carlos Virgolino Soares, Giulio Turrisi, Victor Barasuol, Claudio Semini

机构 * Dynamic Legged Systems (DLS) lab, Istituto Italiano di Tecnologia (IIT)(动态腿足系统实验室,意大利理工学院) University of Genoa(热那亚大学)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本文提出将四足机器人本体时间序列数据转换为结构化二维图像的方法,利用卷积神经网络学习运动相关任务。通过编码多信号的时序动态,保留机器人形态结构,提升特征空间丰富性。在接触估计任务中,实验表明图像表示优于传统序列模型,接触状态准确率提升16.8个百分点。

Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11864 2026-03-27 cs.CR 50%

NeuroStrike: Neuron-Level Attacks on Aligned LLMs

NeuroStrike:对对齐大语言模型的神经层面攻击

Lichao Wu, Sasha Behrouzi, Mohamadreza Rostami, Maximilian Thang, Stjepan Picek, Ahmad-Reza Sadeghi

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 NeuroStrike通过利用对齐技术引入的稀疏安全神经元漏洞,提出了一种通用攻击框架,实现了对多种大语言模型的高效攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24371 2026-03-26 physics.optics 50%

Shape-Dependent, Deep-Learning-Assisted Metamaterial Solid Immersion Lens (mSIL) Super-Resolution Imaging

形状依赖、深度学习辅助的超材料固体浸没透镜(mSIL)超分辨成像

Baidong Wu, Fiza Khan, Lingya Yu, Zengbo Wang

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本文比较了三种TiO2超材料固体浸没透镜几何结构,通过SEM分析发现超半球形透镜具有最深的浸没和最接近样品特征的接触,结合深度学习模型实现了SEM形态与光学成像响应的跨模态映射,电磁模拟证实了浸没深度与远场主波束强度的直接相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24265 2026-03-26 cs.LG 50%

DeepDTF: Dual-Branch Transformer Fusion for Multi-Omics Anticancer Drug Response Prediction

DeepDTF: 多组学抗癌症药物反应预测的双分支Transformer融合

Yuhan Zhao, Jacob Tennant, James Yang, Zhishan Guo, Young Whang, Ning Sui

机构 * Department of Computer Science(计算机科学系) North Carolina State University(北卡罗来纳州立大学) UNC School of Medicine(UNC医学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 DeepDTF通过双分支Transformer融合框架,联合预测药物IC50对数和敏感性分类,有效整合多组学数据与化学结构信息,提升药物反应预测精度与生物解释性。

Comments 7 Pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏