arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6929 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6929 篇

2603.22838 2026-03-25 stat.ME 50%

Community Detection on Inhomogeneous Multilayer Networks with Extreme Sparsity

在不均匀多层网络上进行社区检测:极端稀疏性下的方法

Tao Shen, Wanjie Wang

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出MARS-CD方法,通过多层辅助正则化谱方法解决不均匀多层网络中极端稀疏性下的社区检测问题,理论保证了聚类质量并实现了弱一致和强一致。

Comments 35 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11858 2026-03-25 cs.LG 50%

Multi-Station WiFi CSI Sensing Framework Robust to Station-wise Feature Missingness and Limited Labeled Data

多站WiFi CSI感知框架:鲁棒于站级特征缺失和有限标记数据

Keita Kayano, Takayuki Nishio, Daiki Yoda, Yuta Hirai, Tomoko Adachi

机构 * School of Engineering, Institute of Science Tokyo(东京科学研究院工程学院) Wireless Systems R&D Department, Infrastructure Systems R&D Center, Corporate Laboratory, Toshiba Corporation(东芝公司无线系统研发部、基础设施系统研发中心、企业实验室)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本文提出一个多站WiFi CSI感知框架,解决实际CSI感知中的站级特征缺失和有限标记数据问题,通过结合跨模态自监督学习和站级掩码增强,提升鲁棒性。

Comments 17 pages, 14 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03473 2026-03-25 astro-ph.SR 50%

Vision-Based CNN Prediction of Sunspot Numbers from SDO/HMI Images

基于视觉的CNN对SDO/HMI图像中太阳黑子数的预测

Fabian C. Quintero-Pareja, Diederik A. Montano-Burbano, Santiago Quintero-Pareja, D. Sierra-Porta

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出基于视觉的回归框架,利用SDO/HMI图像预测太阳黑子数,通过CNN实现端到端映射,实验结果显示模型在预测精度和可解释性方面表现良好,为大规模太阳监测提供可行方案。

Comments 10 pages, 9 figures, 2 tables

Journal ref Published in the Open Journal of Astrophysics - 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20680 2026-03-24 q-bio.NC cs.LG 50%

Hierarchical Multiscale Structure-Function Coupling for Brain Connectome Integration

层次化多尺度结构-功能耦合用于脑连接组整合

Jianwei Chen, Zhengyang Miao, Wenjie Cai, Jiaxue Tang, Boxing Liu, Yunfan Zhang, Yuhang Yang, Hao Tang, Carola-Bibiane Schönlieb, Zaixu Cui, Du Lei, Shouliang Qi, Chao Li

机构 * School of Medicine, University of Dundee, UK(邓迪大学医学院) School of Science and Engineering, University of Dundee, UK(邓迪大学科学与工程学院) College of Medicine and Biological Information Engineering, Northeastern University, China(东北大学医学院与生物信息工程学院) College of Medical Informatics, Chongqing Medical University, China(重庆医科大学医学信息学院) School of Airspace Science and Engineering, Shandong University, China(山东大学航空航天科学与工程学院) Chinese Institute for Brain Research, China(中国脑科学研究院) Department of Applied Mathematics and Theoretical Physics, University of Cambridge, UK(剑桥大学应用数学与理论物理系) Department of Clinical Neurosciences, University of Cambridge, UK(剑桥大学临床神经科学系)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本文提出层次化多尺度结构-功能耦合框架,通过联合学习结构和功能连接组的模块化组织与层级耦合,提升脑连接组整合效果,验证了其在预测脑年龄、认知分数和疾病分类中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16127 2026-03-24 cs.RO cs.SY eess.SY 50%

Reactive Slip Control in Multifingered Grasping: Hybrid Tactile Sensing and Internal-Force Optimization

多指抓取中的反应滑移控制:混合触觉感知与内部力优化

Théo Ayral, Saifeddine Aloui, Mathieu Grossard

机构 * Université Grenoble Alpes, CEA, Leti(格勒诺布尔大学、CEA、LETI) Université Paris-Saclay, CEA, List(巴黎-萨克雷大学、CEA、LIST)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出一种结合学习触觉滑移检测与模型内部力控制的混合方法,用于多指抓取的稳定控制,通过触觉反馈实现快速滑移检测与力优化,实验验证了在外部扰动下的抓取稳定性。

Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08522 2026-03-17 cs.LG physics.ao-ph 50%

Fuxi-DA: A Generalized Deep Learning Data Assimilation Framework for Assimilating Satellite Observations

Fuxi-DA: 一种通用的深度学习数据同化框架,用于同化卫星观测数据

Xiaoze Xu, Xiuyu Sun, Wei Han, Xiaohui Zhong, Lei Chen, Hao Li

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出Fuxi-DA框架,利用深度学习技术同化卫星观测数据,有效降低分析误差并提升预报性能,通过单观测实验验证其一致性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11117 2026-03-13 cs.LG 50%

Learning Tree-Based Models with Gradient Descent

通过梯度下降学习基于树的模型

Sascha Marton

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出通过梯度下降学习硬轴对齐决策树的方法,解决传统方法的局限性,提升树模型在多个领域的性能和适用性。

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10871 2026-03-12 cs.RO 50%

FG-CLTP: Fine-Grained Contrastive Language Tactile Pretraining for Robotic Manipulation

FG-CLTP: 用于机器人操作的细粒度对比语言触觉预训练

Wenxuan Ma, Chaofan Zhang, Yinghao Cai, Guocai Yao, Shaowei Cui, Shuo Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 FG-CLTP通过细粒度对比学习提升机器人触觉感知,实现高精度分类和控制,减少误差并增强跨传感器泛化能力。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10442 2026-03-12 cs.LG stat.ML 50%

GGMPs: Generalized Gaussian Mixture Processes

GGMPs: 通用高斯混合过程

Vardaan Tekriwal, Mark D. Risser, Hengrui Luo, Marcus M. Noack

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 GGMPs是一种基于高斯过程的多模态条件密度估计方法,通过局部混合拟合和异方差训练提升非高斯数据的分布近似能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03596 2026-03-11 cs.HC 50%

Exploring EEG and Eye Movement Fusion for Multi-Class Target RSVP-BCI

探索EEG和眼动融合用于多类目标RSVP-BCI

Xujin Li, Wei Wei, Kun Zhao, Jiayu Mao, Yizhuo Lu, Shuang Qiu, Huiguang He

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出MTREE-Net,通过融合EEG和眼动数据提升多类RSVP-BCI的解码性能。

Comments 17 pages, 9 figures

Journal ref Information Fusion, 2025, 121: 103135

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18741 2026-03-11 stat.ME 50%

Spectral Graph Filtering for Modality-Specific Representation Learning

基于谱图滤波的模态特异性表示学习

Shira Yoffe, Amit Moscovich, Ariel Jaffe

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出DELVE方法,通过谱图滤波提取模态特异性潜在变量,以识别不同模态间的差异结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08763 2026-03-11 cs.LG cs.RO 50%

SPREAD: Subspace Representation Distillation for Lifelong Imitation Learning

SPREAD: 为终身模仿学习的子空间表示蒸馏

Kaushik Roy, Giovanni D'urso, Nicholas Lawrance, Brendan Tidd, Peyman Moghadam

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 SPREAD通过子空间表示蒸馏方法,在终身模仿学习中提升知识迁移和泛化能力,缓解灾难性遗忘,实现最优性能。

Comments IEEE International Conference on Robotics & Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07348 2026-03-10 cs.LG 50%

Learning Clinical Representations Under Systematic Distribution Shift

在系统分布偏移下学习临床表示

Yuanyun Zhang, Shi Li

机构 * University of the Chinese Academy of Sciences(中国科学院大学) Columbia University(哥伦比亚大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出了一种实践不变的多模态临床预测框架,通过联合优化预测性能与抑制环境信息,提升模型在分布外情况下的鲁棒性和可转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04606 2026-03-06 cs.LG physics.plasm-ph 50%

PDE foundation model-accelerated inverse estimation of system parameters in inertial confinement fusion

偏微分方程基础模型加速惯性约束聚变系统参数反演

Mahindra Rautela, Alexander Scheinker, Bradley Love, Diane Oyen, Nathan DeBardeleben, Earl Lawrence, Ayan Biswas

机构 * AOT-IC Group, Los Alamos National Laboratory(AOT-IC组,洛斯阿拉莫斯国家实验室) CAI Division, Los Alamos National Laboratory(CAI部门,洛斯阿拉莫斯国家实验室) HPC Division, Los Alamos National Laboratory(HPC部门,洛斯阿拉莫斯国家实验室)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本研究利用偏微分方程基础模型加速惯性约束聚变系统参数反演,通过微调和轻量级头部训练实现高精度超光谱重建与参数回归。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21028 2026-03-03 cs.LG 50%

TRIDENT: Tri-Modal Molecular Representation Learning with Taxonomic Annotations and Local Correspondence

TRIDENT:结合分类注释和局部对应关系的三模态分子表示学习

Feng Jiang, Mangal Prakash, Hehuan Ma, Jianyuan Deng, Yuzhi Guo, Amina Mollaysa, Tommaso Mansi, Rui Liao, Junzhou Huang

机构 * University of Texas at Arlington(德克萨斯大学阿灵顿分校) Johnson & Johnson Innovative Medicine(强生创新医学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 TRIDENT通过整合SMILES、文本和分类功能注释,学习丰富的分子表示,从而在多个下游任务中取得最佳性能。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22294 2026-03-02 cs.LG 50%

When Should a Model Change Its Mind? An Energy-Based Theory and Regularizer for Concept Drift in Electrocardiogram (ECG) Signals

模型何时应改变观点?一种基于能量的理论和正则化器用于心电图(ECG)信号中的概念漂移

Timothy Oladunni, Blessing Ojeme, Kyndal Maclin, Clyde Baidoo

机构 * Department of Computer Science, Morgan State University(计算机科学系,莫根州立大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本研究提出Physiologic Energy Conservation Theory (PECT)和Energy-Constrained Representation Learning (ECRL),用于在ECG信号中稳定概念,通过能量守恒原理减少误判和漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18579 2026-03-02 cs.LG 50%

Sparsity Forcing: Reinforcing Token Sparsity of MLLMs

稀疏性强制:强化多模态大语言模型的token稀疏性

Feng Chen, Yefei He, Lequan Lin, Chenhui Gou, Jing Liu, Bohan Zhuang, Qi Wu

机构 * AIML, University of Adelaide, Australia(AIML,澳大利亚阿德莱德大学) ZIP Lab, Zhejiang University, China(浙江工业大学ZIP实验室) University of Sydney, Australia(悉尼大学) Monash University, Australia(墨尔本大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出Sparsity Forcing方法,通过强化学习框架在多模态大语言模型中提升token稀疏性,实现75%的token减少与极小的精度损失。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05629 2026-03-02 cs.LG 50%

On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification

在SFT的泛化上:从强化学习视角的奖励校正

Yongliang Wu, Yizhou Zhou, Zhou Ziheng, Yingzhe Peng, Xinyu Ye, Xinting Hu, Wenbo Zhu, Lu Qi, Ming-Hsuan Yang, Xu Yang

机构 * Southeast University(东南大学) University of California, Los Angeles(加州大学洛杉矶分校) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) Wuhan University(武汉大学) University of California, Merced(加州大学默塞德分校)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出动态微调方法,通过奖励校正提升SFT的泛化能力,在多个任务中表现优于传统SFT。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17195 2026-02-24 cs.RO 50%

Depth-PC: A Visual Servo Framework Integrated with Cross-Modality Fusion for Sim2Real Transfer

Depth-PC: 一种集成跨模态融合的视觉伺服框架用于仿真到现实迁移

Haoyu Zhang, Yang Liu, Yimu Jiang, Weiyang Lin, Chao Ye

机构 * Research Institute of Intelligent Control and Systems, Harbin Institute of Technology(智能控制与系统研究所,哈尔滨工业大学)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 Depth-PC通过跨模态融合和图神经网络实现零样本仿真到现实迁移的视觉伺服框架

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17680 2026-02-23 cs.LG 50%

BioBridge: Bridging Proteins and Language for Enhanced Biological Reasoning with LLMs

BioBridge: 蛋白质与语言的桥梁:利用大语言模型增强生物推理

Yujia Wang, Jihong Guan, Wengen Li, Shuigeng Zhou, Xuhong Wang

机构 * School of Computer Science and Technology(计算机科学与技术学院) College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 BioBridge结合蛋白质领域知识与通用语言能力,通过领域自适应持续预训练框架提升生物推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14352 2026-02-20 cs.SI 50%

Bridging the Urban Divide: Adaptive Cross-City Learning for Disaster Sentiment Understanding

弥合城市鸿沟:面向灾害情感理解的自适应跨城学习

Zihui Ma, Yiheng Chen, Runlong Yu, Afra Izzati Kamili, Fangqi Chen, Zhaoxi Zhang, Juan Li, Yuki Miura

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出自适应跨城学习框架,通过整合行为与文本数据,提升灾害情绪理解的准确性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16584 2026-02-19 q-bio.NC 50%

The Representational Alignment Hypothesis: Evidence for and Consequences of Invariant Semantic Structure Across Embedding Modalities

表征对齐假说:跨嵌入模态的不变语义结构的证据及其后果

Akhil Ramidi, Kevin Scharp

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 该研究提出表征对齐假说,探讨跨模态嵌入的不变语义结构,质疑其根本性,并提出新的哲学视角和区分方法。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14833 2026-02-17 eess.SP cs.LG 50%

RF-GPT: Teaching AI to See the Wireless World

RF-GPT:教AI看见无线世界

Hang Zou, Yu Tian, Bohao Wang, Lina Bariah, Samson Lasaulce, Chongwen Huang, Mérouane Debbah

机构 * Research Institute for Digital Future, Khalifa University(数字未来研究院,哈利法大学) College of Information Science and Electronic Engineering, Zhejiang University(信息科学与电子工程学院,浙江大学) Université de Lorraine, CNRS, CRAN(洛林大学,CNRS,CRAN)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 RF-GPT通过多模态LLM的视觉编码器处理RF频谱图,实现射频信号的高级推理与生成,无需人工标注即可在多个无线任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12532 2026-02-16 cs.RO 50%

CRAFT: Adapting VLA Models to Contact-rich Manipulation via Force-aware Curriculum Fine-tuning

CRAFT: 通过力感知的课程微调适应接触密集的操纵

Yike Zhang, Yaonan Wang, Xinxin Sun, Kaizhen Huang, Zhiyuan Xu, Junjie Ji, Zhengping Che, Jian Tang, Jingtao Sun

机构 * National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人视觉感知与控制技术国家工程研究中心,湖南大学) Beijing Innovation Center of Humanoid Robotics(人形机器人创新中心) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 CRAFT通过力感知课程微调提升机器人在接触密集任务中的表现,实现稳健且可推广的操纵能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12158 2026-02-13 cs.LG 50%

SafeNeuron: Neuron-Level Safety Alignment for Large Language Models

SafeNeuron: 大语言模型的神经层面安全对齐

Zhaoxin Wang, Jiaming Liang, Fengbin Zhu, Weixiang Zhao, Junfeng Fang, Jiayi Ji, Handing Wang, Tat-Seng Chua

机构 * Xidian University, Xi'an, China(西安电子科技大学) Harbin Institute of Technology, Harbin, China(哈尔滨工业大学) National University of Singapore,Singapore(新加坡国立大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 SafeNeuron通过神经层面安全对齐框架提升模型鲁棒性,减少攻击风险并保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22488 2026-02-13 eess.SP cs.LG 50%

EEG-to-Gait Decoding via Phase-Aware Representation Learning

通过相意识表示学习实现EEG到步态解码

Xi Fu, Weibang Jiang, Rui Liu, Gernot R. Müller-Putz, Cuntai Guan

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore 639798(计算与数据科学学院,南洋理工大学,新加坡) Department of Computer Science and Engineering, Shanghai Jiao Tong University, Shanghai 200240, China(计算机科学与工程系,上海交通大学,上海) Institute of Neural Engineering, Graz University of Technology, Graz, Austria(神经工程研究所,格拉茨技术大学,奥地利) Centre of AI in Medicine (C-AIM), Nanyang Technological University, Singapore(医学人工智能中心(C-AIM),南洋理工大学,新加坡)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 NeuroDyGait通过相意识表示学习实现EEG到步态解码,提升跨受试者性能并满足实时BCI需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11511 2026-02-13 stat.ME math.ST stat.TH 50%

Representation Learning with Blockwise Missingness and Signal Heterogeneity

具有块状缺失和信号异质性的表示学习

Ziqi Liu, Ye Tian, Weijing Tang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出APPCA方法,通过锚定投影和PCA处理块状缺失和信号异质性,提升多源数据整合的表示学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09225 2026-02-11 cs.LG 50%

Barycentric alignment for instance-level comparison of neural representations

实例层面神经表示的重心对齐

Shreya Saha, Zoe Wanying He, Meenakshi Khosla

机构 * Department of XXX, University of YYY, Location, Country(YYY大学XXX系) School of ZZZ, Institute of WWW, Location, Country(WWW研究所ZZZ学院) Department of Electrical and Computer Engineering, UCSD(UCSD电子与计算机工程系) Cognitive Science Department, UCSD(UCSD认知科学系) Department of Computer Science(计算机科学系)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 通过实例层面的神经表示重心对齐,揭示了跨视觉和语言模型的表示收敛与发散特性,并展示了人类对齐的跨模态比较能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05825 2026-02-10 cs.HC 50%

ToMigo: Interpretable Design Concept Graphs for Aligning Generative AI with Creative Intent

ToMigo:可解释的设计概念图用于对齐生成式AI与创意意图

Lena Hegemann, Xinyi Wen, Michael A. Hedderich, Tarmo Nurmi, Hariharan Subramonyam

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 ToMigo通过设计概念图实现生成式AI与创意意图的对齐,提供可解释的交互方式提升用户控制力。

Comments 18 pages, 10 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07706 2026-02-10 cs.LG 50%

Dense Feature Learning via Linear Structure Preservation in Medical Data

通过线性结构保持实现密集特征学习:医学数据

Yuanyun Zhang, Mingxuan Zhang, Siyuan Li, Zihan Wang, Haoran Chen, Wenbo Zhou, Shi Li

机构 * Independent Researcher(独立研究者) The Chinese University of Hong Kong(香港中文大学) Columbia University(哥伦比亚大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出密集特征学习方法,通过线性结构保持提升医学数据表示的稳定性与可解释性,实现更优的下游性能。

Comments ICLR Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏