arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6929 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6929 篇

2512.01554 2026-06-24 cs.RO 50%

L2M-Calib: One-key Calibration Method for LiDAR and Multiple Magnetic Sensors

L2M-Calib:一种用于激光雷达和多种磁传感器的单键校准方法

Qiyang Lyu, Wei Wang, Zhenyu Wu, Hongming Shen, Huiqin Zhou, Danwei Wang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出L2M-Calib方法,通过联合估计激光雷达与磁传感器间的外参和磁传感器的内畸变参数,实现多模态传感器融合的高效校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23668 2026-06-23 cs.LG 新提交 50%

On the Limits of Prompt-Conditioned Language Models as General-Purpose Learners

关于提示条件语言模型作为通用学习器的局限性

David Mguni, Julian Ma, Jun Wang

机构 * Queen Mary University London(伦敦玛丽女王大学) University College London(伦敦大学学院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文通过廉价谈话博弈模型分析提示条件语言模型,证明语言作为容量受限通道导致任务不可区分性,并因对齐约束产生不可约误差,从而否定其通过提示实现通用问题求解的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20920 2026-06-23 cs.LG math.DS 新提交 50%

$Ω$: Operator-based Mixture Ensemble for Generative Assimilation

$Ω$: 基于算子的混合集成生成同化

Pouria Behnoudfar, Nan Chen

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对高维非线性系统中非高斯后验分布难以刻画的问题,提出Ω框架,融合条件高斯代理、无监督分数学习和生成采样,无需真实后验样本即可高效重构后验分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04748 2026-06-23 q-bio.GN 版本更新 50%

SeekRBP: Leveraging Sequence-Structure Integration with Reinforcement Learning for Receptor-Binding Protein Identification

SeekRBP: 利用强化学习整合序列-结构信息识别受体结合蛋白

Xiling Luo, Le Ou-Yang, Yang Shen, Jiaojiao Guan, Dehan Cai, Jun Zhang, Guoliang Xing, Yanni Sun, Jiayu Shang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出SeekRBP框架,通过多臂老虎机策略动态采样难负例,融合蛋白质语言与结构嵌入,有效识别序列差异大的受体结合蛋白,在噬菌体宿主预测中表现优异。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20904 2026-06-23 eess.IV cs.LG 版本更新 50%

ECGFlowCMR: Pretraining with ECG-Generated Cine CMR Helps Cardiac Disease Classification and Phenotype Prediction

ECGFlowCMR: 利用心电图生成电影心脏磁共振的预训练助力心脏病分类和表型预测

Xiaocheng Fang, Zhengyao Ding, Guangkun Nie, Jieyi Cai, Yujie Xiao, Bo Liu, Jiarui Jin, Haoyu Wang, Shun Huang, Ting Chen, Hongyan Li, Shenda Hong

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Polytechnic Institute of Zhejiang University, Zhejiang University(浙江大学 polytechnic 院) Institute of Computing Technology, University of the Chinese Academy of Sciences(中国科学院计算技术研究所) National Institute of Health Data Science, Peking University(北京大学健康数据科学国家研究院) Institute of Microelectronics, University of the Chinese Academy of Sciences(中国科学院微电子研究所) Department of Cardiology, Zhejiang University(浙江大学心内科部)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 提出ECGFlowCMR框架,通过相位感知掩码自编码器和解剖运动解耦流解决ECG与CMR的跨模态时序错配和解剖可观测性差距,生成逼真电影CMR序列,提升下游心脏病分类和表型预测性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20382 2026-06-19 cs.LG 新提交 50%

Towards Modality-imbalanced Federated Graph Learning: A Data Synthesis-based Approach

面向模态不平衡的联邦图学习:一种基于数据合成的方法

Zhengyu Wu, Hongchao Qin, Xunkai Li, Zekai Chen, Rong-Hua Li, Guoren Wang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对联邦图学习中客户端级和节点级模态不平衡问题,提出隐式图感知潜在语义表示合成范式FedMGS,通过可用性感知图编码器、原型引导语义合成器和可靠性校准融合机制恢复缺失模态语义,在四个任务上最高提升17.41%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19989 2026-06-19 cs.DC cs.LG 新提交 50%

Online Dynamic Batching with Formal Guarantees for LLM Training

面向LLM训练的具有形式保证的在线动态批处理

Dian Li, Zekun Wang, Yaoru Wang, Jiahong Yan

机构 * Tencent(腾讯)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出在线动态批处理(ODB)系统,在数据加载器侧将批构建延迟到样本真实成本可观测时,解决离线批采样中预处理成本不可见问题,实现1.58-4.43x吞吐量提升,并提供无死锁有界终止的形式化保证。

Comments 29 pages, 3 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19529 2026-06-19 cs.DC 新提交 50%

The Sheaf Laplacian: A Topological Framework for Data Fusion and Consensus in Distributed Sensing Networks

层拉普拉斯算子:分布式传感网络中数据融合与共识的拓扑框架

Manuel Hernández, Eduardo Sánchez-Soto

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 提出层理论作为传统图模型的替代,利用层拉普拉斯算子实现异构分布式传感网络中的数据融合与共识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06001 2026-06-19 physics.comp-ph cs.LG 版本更新 50%

A deep learning framework for jointly solving transient Fokker-Planck equations with arbitrary parameters and initial distributions

一种联合求解具有任意参数和初始分布的瞬态Fokker-Planck方程的深度学习框架

Xiaolong Wang, Jing Feng, Qi Liu, Chengli Tan, Yuanyuan Liu, Yong Xu

机构 * School of Mathematics and Statistics, Shaanxi Normal University(陕西师范大学数学与统计学院) School of Mathematics and Statistics, Northwestern Polytechnical University(西北工业大学数学与统计学院) MOE Key Laboratory for Complexity Science in Aerospace, Northwestern Polytechnical University(航空复杂科学教育部重点实验室,西北工业大学) School of Science, Xi’an University of Posts and Telecommunications(西安邮电大学理学院) Department of Systems and Control Engineering, Institute of Science Tokyo(东京科学大学系统与控制工程系)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 提出基于深度学习的伪解析概率解(PAPS),通过单次训练同时求解任意多模态初始分布、系统参数和时间点的瞬态FPE,速度比GPU加速蒙特卡洛快四个数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19194 2026-06-18 cs.RO 新提交 50%

Invertible Neural Network Adapter for One-Step Flow Matching in Robot Manipulation

用于机器人操作中一步流匹配的可逆神经网络适配器

Yu Zhang, Kangyi Ji, Yongxiang Zou, Rongtao Xu, Feng Zheng, Long Cheng

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出可逆神经网络适配器,通过一步去噪过程生成高维动作,降低推理复杂度并保持精度,在仿真和真实实验中提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17010 2026-06-16 cs.LG 新提交 50%

From Tokens to Policy: Causal and Interpretable Heterogeneous Treatment Effects Identification

从令牌到策略:因果且可解释的异质性处理效应识别

Riccardo Cadei, Frank Otchere, Nyasha Tirivayi, Gustavo Angeles Tagliaferro, Falco J. Bargagli-Stoffi, Francesco Locatello

机构 * ISTA UNICEF(联合国儿童基金会) UCLA(加州大学洛杉矶分校)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 提出NEXIS方法,利用多模态预处理表示将HTE识别转化为马尔可夫毯发现问题,实现因果可解释的异质性处理效应识别,并在非洲反贫困项目中验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15221 2026-06-16 cs.CR 新提交 50%

Robust and Precise Application Fingerprinting on 5G Physical Uplink Channel

5G物理上行链路上的鲁棒且精确的应用指纹识别

Yu Li, Liqi Zhuang, Dong Wei, Jiwen Luo, Hang Zhang, Meng Zhang, Xiaona Li, Weiqing Huang

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 针对5G加密控制信道打破传统攻击链的问题,本文发现物理层侧信道(上行MCS稳定导致PRB数量反映IP包长度),结合上行控制信道重构双向流量,设计了三步被动攻击Crosshair,通过盲提取、数据增强和跨模态对齐实现高精度应用识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13970 2026-06-15 cs.RO cs.LG 新提交 50%

An Attention-based Model for Robust Forecasting with Missing Modality

基于注意力的缺失模态鲁棒预测模型

Zhitian Zhang, Wenjie Zi, Yunduz Rakhmangulova, Saghar Irandoust, Hossein Hajimirsadeghi, Thibaut Durand

机构 * Simon Fraser University(西蒙菲莎大学) RBC Borealis

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出一种基于条件变分自编码器和Transformer的多模态模型,通过注意力机制学习统一固定维度的表示,在训练和推理中处理缺失模态,在人类轨迹预测和机器人操作预测任务上优于现有方法。

Comments Work originally done in 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18166 2026-06-15 cs.IR cs.LG 版本更新 50%

PCR-CA: Parallel Codebook Representations with Contrastive Alignment for Multiple-Category App Recommendation

PCR-CA: 基于对比对齐的并行码本表示用于多类别应用推荐

Bin Tan, Wangyao Ge, Yidi Wang, Xin Liu, Jeff Burtoft, Hao Fan, Hui Wang

机构 * Microsoft Suzhou China(微软苏州中国) Microsoft Beijing China(微软北京中国) Microsoft Redmond WA USA(微软雷德蒙德华盛顿州美国)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出PCR-CA框架,通过并行码本VQ-AE模块学习多类别应用的离散语义表示,结合对比对齐损失和双注意力融合,提升CTR预测,尤其对长尾应用效果显著。

Comments Accepted by KDD 2026, oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12559 2026-06-12 physics.comp-ph cs.LG cs.NA math.NA physics.flu-dyn 新提交 50%

Feature-preserving Latent-EnKF for Data Assimilation of Flows with Shocks

保持特征的潜在EnKF用于含激波流动的数据同化

Hemanth Chandravamsi, Hangchuan Hu, Ponkrshnan Thiagarajan, Tamer A. Zaki

机构 * Department of Mechanical Engineering, Johns Hopkins University(约翰霍普金斯大学机械工程系)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对含激波流动中EnKF因多模态统计产生伪振荡的问题,提出在学习的低维潜在空间进行集合更新以保持激波特征,并通过共享解码器恢复物理状态,数值实验验证了无伪振荡的准确特征恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14427 2026-06-11 cs.RO cs.LG 版本更新 50%

Self-Supervised Multisensory Pretraining for Contact-Rich Robot Reinforcement Learning

面向接触丰富机器人强化学习的自监督多感官预训练

Rickmer Krohn, Vignesh Prasad, Gabriele Tiboni, Georgia Chalvatzaki

机构 * Interactive Robot Perception & Learning (PEARL) Lab, TU Darmstadt, Germany(图腾机器人感知与学习实验室,图腾施塔德大学,德国) Hessian.AI(海斯堡人工智能) Robotics Institute Germany (RIG)(德国机器人研究所(RIG))

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 提出MSDP框架,通过掩码自编码和跨模态预测学习多感官表示,并采用非对称架构(评论家使用交叉注意力提取动态特征,演员使用稳定池化表示)加速策略学习,在模拟和真实机器人任务中展现出鲁棒性和高效性。

Comments 8 pages, 11 figures

Journal ref IEEE Robotics and Automation Letters, 2026, Vol. 11, No. 6, pp. 6799-6806

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10365 2026-06-10 cs.SD 新提交 50%

KFC-KWS: Keyframe Fusion with CTC for User-Defined Keyword Spotting

KFC-KWS: 基于CTC的关键帧融合用于用户自定义关键词唤醒

Jin Li, Wenbin Jiang, Ji Hu

机构 * School of Electronics and Information Engineering, Hangzhou Dianzi University(杭州电子科技大学电子信息学院) School of Communication Engineering, Hangzhou Dianzi University(杭州电子科技大学通信工程学院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出KFC-KWS多模态框架,利用CTC引导的关键帧选择对齐音频、音素和文本模态,通过交叉注意力融合关键帧与全句表示,在LibriPhrase上达到98.73% AUC,困难子集上97.65% AUC和7.75% EER,有效区分易混淆关键词。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10227 2026-06-10 cs.LG 新提交 50%

Spatiotemporal Graph Transformer for 3D Neighborhood Interaction and Quality Prediction in Metal Additive Manufacturing

时空图Transformer用于金属增材制造中的3D邻域交互与质量预测

Joyce Karen Pelaez, Siqi Zhang, Hoo Sang Ko

机构 * Department of Industrial Engineering(工业工程系)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出一种时空图Transformer,通过加权网络表示和双注意力机制建模3D邻域交互,显著提升金属增材制造质量预测性能。

Comments Submitted to Journal of Intelligent Manufacturing, 23 pages, 10 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22017 2026-06-10 cs.LG 版本更新 50%

Domain Adapted Large Language Models for Additive Manufacturing

面向增材制造的领域自适应大语言模型

Peter Pak, Amir Barati Farimani

机构 * Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文通过约5000万token的小型数据集对开源大语言模型进行领域自适应预训练和指令微调,构建多模态领域自适应模型,在增材制造基准测试中达到90%以上准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09092 2026-06-09 cs.LG 新提交 50%

From Shortcuts to Reasoning: Robust Post-Training of Theory of Mind with Reinforcement Learning

从捷径到推理:基于强化学习的心理理论鲁棒后训练

Jike Zhong, Yuxiang Lai, Ming Li, Yuheng Li, Wuao Liu, Behzad Dariush, Konstantinos Psounis, Shao-Yuan Lo

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对心理理论后训练中的捷径问题,提出Thinking-RFT方法,结合可验证奖励和显式推理链,在多个无捷径数据集上显著提升推理能力,尤其在复杂高阶推理和多模态场景中表现优异。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06492 2026-06-09 cs.RO 版本更新 50%

How Well Do Latent World Models Understand Partially Observable Safety Constraints?

潜在世界模型如何理解部分可观测的安全约束?

Matthew Kim, Kensuke Nakamura, Andrea Bajcsy

机构 * UC San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究潜在世界模型在部分可观测安全约束下的故障模式,提出互信息度量和滚动预测度量来诊断估计间隙和预测间隙,并通过多模态监督和共形风险校准缓解问题,提高机器人操作安全性。

Comments 10 tables 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06970 2026-06-08 cs.IR 新提交 50%

SSRLive: Live Streaming Recommendation with Dynamic Semantic ID

SSRLive:基于动态语义ID的直播推荐

Teng Shi, Zhaoheng Li, Yuanhang Qu, Yi Liu, Lixiang Lai, Yuning Jiang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对直播推荐中静态语义ID无法反映内容动态变化、生成式方法忽略用户-主播交互信号的问题,提出SSRLive框架,结合生成模块(动态语义ID)与判别模块(交互增强),在真实部署中显著提升观看时长、GMV等指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06288 2026-06-05 stat.ML cs.LG 50%

Discrete Causal Representations from Heterogeneous Domains: A Bayesian Approach with Social Survey Applications

来自异构域的离散因果表示:一种贝叶斯方法及其在社会调查中的应用

Ankur Garg, Michael Stettler, Aaron Schein, Julius von Kügelgen

机构 * Department of Statistics, University of Chicago(芝加哥大学统计学系) University of Tübingen(图宾根大学) Department of Statistics & Data Science Institute, University of Chicago(芝加哥大学统计学与数据科学研究所) Seminars for Statistics, ETH Zürich(苏黎世联邦理工学院统计系)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出一种贝叶斯方法,从多环境数据中学习离散因果概念,通过序贯蒙特卡洛采样近似多模态后验,并在社会调查数据中验证了其推断有意义的高层概念和因果关系的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04209 2026-06-04 cs.LG 50%

A Geometric View of Counterfactual Behavior: Interaction of Boundary Proximity and Local Support

反事实行为的几何视角:边界接近度与局部支持的交互作用

Ioanna Gemou, Matteo Gamba, Randall Balestriero, Ritambhara Singh

机构 * Brown University(布朗大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文通过几何视角研究反事实行为,发现决策边界接近度与局部数据支持的交互作用决定了反事实的可行性,且反事实行为是独立于预测性能的维度,可在不改变准确率的情况下被改变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04180 2026-06-04 cs.LG cs.IT math.IT 50%

KODA: Contrastive Representation Comparison and Alignment for Vision-Language Foundation Models

KODA: 视觉-语言基础模型的对比表示比较与对齐

Youqi Wu, Mohammad Jalali, Farzan Farnia

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出KODA框架,通过核优化方法对比分析视觉-语言基础模型的表示差异,并识别弱聚类与强聚类的样本子集,实现表示对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
1604.03199 2026-06-04 q-bio.QM cs.SY eess.SY q-bio.NC 50%

From sample to knowledge: Towards an integrated approach for neuroscience discovery

从样本到知识:面向神经科学发现的综合方法

William Gray Roncal, Eva L Dyer, Doga Gürsoy, Konrad Kording, Narayanan Kasthuri

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出从样本到知识的整合方法,旨在通过反馈循环优化神经科学数据采集与处理流程,提升知识提取效率。

Comments first two authors contributed equally. 8 pages, 2 figures. v2: added acknowledgments

详情

展开后加载摘要…

URL PDF HTML 收藏
1506.07603 2026-06-04 eess.SY cs.SY 50%

Analytic MMSE Bounds in Linear Dynamic Systems with Gaussian Mixture Noise Statistics

线性动态系统中高斯混合噪声统计的解析MMSE界限

Leila Pishdad, Fabrice Labeau

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文研究线性动态系统在高斯混合噪声下的MMSE估计,提出解析上界和下界,通过高斯混合分布形状选择紧致上界,并验证在高多模噪声下MMSE收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
1204.6120 2026-06-03 math.FA cs.IT cs.NA math.IT math.NA 50%

Geometric Separation by Single-Pass Alternating Thresholding

单次交替阈值化的几何分离

Gitta Kutyniok

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对点状和曲线奇异性的分离问题,本文提出并理论分析了基于小波和曲波帧的单次交替阈值化方法,利用簇相干性和几何稀疏性证明了在足够细尺度下可实现任意精确分离。

Comments 35 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01836 2026-06-02 eess.IV 50%

Face Liveness Detection Using RGB and Thermal Image Fusion

使用RGB和热成像融合的人脸活体检测

Merve Erşan, Melike Girgin, Tayfun Akgül

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出一种融合RGB图像边缘信息与热成像的方法,利用自定义ARISTOF数据集和YOLOv8-Face模型,有效提升人脸活体检测的鲁棒性。

Comments Published in ELECO 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01745 2026-06-02 cs.SI 50%

Enhancing the Socioeconomic Understanding of Foundation Models with Urban Mobility

利用城市流动性增强基础模型的社会经济理解

Baoshen Guo, Donghang Li, Zhiqing Hong, Kailai Sun, Heye Huang, Alok Prakash, Shenhao Wang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出MobFusion范式,通过将流动性网络作为上下文、图连接器和结构化令牌三种方式融入基础模型,以提升城市社会经济预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏