arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 228 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 228 篇

2411.17667 2026-08-19 math.ST stat.TH 版本更新 50%

Rapid Bayesian Computation and Estimation for Neural Networks via Log-Concave Coupling

Curtis McDonald, Andrew R. Barron

专题命中 多模态训练与对齐 :multi-modal(abstract)

Journal ref Math. Stat. Learn. (2026), published online first

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25194 2026-08-17 cs.LG 版本更新 50%

Localization then Neutralization: Gradient-guided Token Suppression against Visual Prompt Injection Attack

先定位再中和:梯度引导的令牌抑制对抗视觉提示注入攻击

Dongpeng Zhang, Ke Ma, Yangbangyan Jiang, Gaozheng Pei, Longtao Huang, Qianqian Xu, Qingming Huang

机构 * School of Advanced Interdisciplinary Sciences, UCAS(UCAS交叉学科研究院) School of Electronic, Electrical and Communication Engineering, UCAS(UCAS电子电气与通信工程学院) State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) Alibaba Group(阿里巴巴集团) School of Computer Science and Technology, UCAS(UCAS计算机科学与技术学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Key Laboratory of Big Data Mining and Knowledge Management, UCAS(UCAS大数据挖掘与知识管理重点实验室)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对多模态大语言模型的视觉提示注入攻击,提出梯度令牌掩码(GTM)方法,通过梯度分析定位关键图像令牌并掩码中和,将攻击成功率降至接近零且计算开销极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10959 2026-08-12 cs.LG 版本更新 50%

Population-Aware Physics-Informed Neural Particle Flow for Robust Spacecraft Bayesian Navigation

群体感知的物理信息神经粒子流用于贝叶斯更新

Batu Candan, Simone Servadio

机构 * Iowa State University(爱荷华州立大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出群体感知的物理信息神经粒子流(PA-PINPF),通过群体编码器增强粒子更新,在贝叶斯后验传输中优于标准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23035 2026-08-12 cs.LG 版本更新 50%

Learning Disease-Sensitive Latent Interaction Graphs From Noisy Cardiac Flow Measurements

从噪声心脏血流测量中学习疾病敏感的潜在交互图

Viraj Patel, Marko Grujic, Philipp Aigner, Theodor Abart, Marcus Granegger, Deblina Bhattacharjee, Katharine Fraser

机构 * Department of Computer Science, University of Bath(巴斯大学计算机科学系) Department of Mechanical Engineering, University of Bath(巴斯大学机械工程系) Christian Doppler Laboratory for Mechanical Circulatory Support, Department of Cardiac and Thoracic Aortic Surgery, Medical University of Vienna(维也纳医学大学心脏和胸主动脉外科系基督教多普勒实验室)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本文提出了一种物理指导的潜在关系框架,用于从噪声心脏血流测量中学习疾病敏感的潜在交互图,以捕捉心脏疾病和干预的稳健标志。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01414 2026-08-11 cs.RO 版本更新 50%

Learning When to See and When to Feel: Adaptive Vision-Torque Fusion for Contact-Aware Manipulation

学习何时视觉何时触觉:适应性视觉-扭矩融合用于接触感知操控

Jiuzhou Lei, Chang Liu, Yu She, Xiao Liang, Minghui Zheng

机构 * Edwardson School of Industrial Engineering, Purdue University(普渡大学爱德华森工业工程学院) Zachry Department of Civil and Environmental Engineering, Texas A&M University(德州农工大学扎克里土木与环境工程系)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出适应性视觉-扭矩融合策略,通过比较不同融合方法提升机器人操控性能,实验显示方法在成功率上优于基线14%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19683 2026-08-03 cs.RO 版本更新 50%

GPA-RAM: Grasp-Pretraining Augmented Robotic Attention Mamba for Spatial Task Learning

GPA-RAM:用于空间任务学习的抓取预训练增强型机器人注意力Mamba

Juyi Sheng, Yangjun Liu, Sheng Xu, Zhixin Yang, Tiantian Xu, Mengyuan Liu

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(国家一般人工智能重点实验室,北京大学深圳研究生院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) State Key Laboratory of Internet of Things for Smart City, University of Macau(智慧城市物联网重点实验室,澳门大学)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 该研究提出GPA-RAM框架,通过GPA增强模仿策略并开发RAM实现高效计算,在多机器人平台的空间操纵任务中显著提升成功率,兼顾精度与实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25175 2026-07-30 cs.MA 版本更新 50%

Agentic AI-enabled discovery across large-scale sleep physiology

基于智能体的人工智能助力大规模睡眠生理学研究

Rahul Thapa, Umaer Hanif, Robin Guillard, Andreas Brink-Kjaer, Adrien Specht, Matteo Saibene, Magnus Ruud Kjaer, Harrison G. Zhang, Federico Bianchi, Elisabeth Roxane M. Heremans, Eric C. Landsness, Emmanuel Mignot, James Zou

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究利用人工智能睡眠联合科学家环境,在约124,000份PSG记录上进行五个案例研究,揭示睡眠与疾病风险、临床分类及自身调节的联系,展示智能体人工智能助力大规模、多模态睡眠生理学发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12338 2026-07-24 cs.LG 版本更新 50%

Wireless TokenCom: RL-Based Tokenizer Agreement for Multi-User Wireless Token Communications

无线令牌通信:基于强化学习的多用户无线令牌通信中的令牌化协议

Farshad Zeinali, Mahdi Boloursaz Mashhadi, Rahim Tafazolli

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出基于强化学习的混合框架,用于多用户无线TokenCom中的令牌化协议,提升语义质量和资源效率,减少视频传输中的冻结事件。

Comments Submitted to IEEE Journal for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28634 2026-07-21 cs.RO 版本更新 50%

PrimitiveVLA: Learning Reusable Motion Primitives for Efficient and Generalizable Robotic Manipulation

PrimitiveVLA:学习可复用的运动基元以实现高效且可泛化的机器人操作

Yutai Li, Shaohui Peng, Jiaming Guo, Di Huang, Zihao Zhang, Yuxuan Guo, Yunkai Gao, Siming Lan, Ling Li, Xing Hu, Yunji Chen

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) Jiangsu Key Laboratory of AI for Industries, Institute of AI for Industries, CAS(江苏人工智能工业重点实验室,人工智能工业研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Cambricon Technologies(寒武科技) Intelligent Software Research Center, Institute of Software, CAS(软件研究所智能软件研究中心,中国科学院) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出PrimitiveVLA框架,通过将视觉-语言-动作模型从直接指令到控制映射转向以基元为中心的拆解与组装范式,利用多模态规范表示和自动化流水线,提升数据效率并实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24395 2026-07-16 cs.LG 版本更新 50%

AvAtar: Learning to Align via Active Optimal Transport

AvAtar: 通过主动最优输运学习对齐

Qi Yu, Ruizhong Qiu, Zhichen Zeng, My T. Thai, Huan Liu, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Florida(佛罗里达大学) Arizona State University(亚利桑那州立大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出AvAtar框架,利用主动学习策略通过熵正则化最优输运的梯度影响量化候选点信息量,并采用伴随状态法高效求解,以提升对齐性能。

Comments Published as a conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19785 2026-06-29 eess.SP 版本更新 50%

Radar and Acoustic Sensor Fusion using a Transformer Encoder for Robust Drone Detection and Classification

基于Transformer编码器的雷达与声学传感器融合用于鲁棒的无人机检测与分类

Gevindu Ganganath, Pasindu Sankalpa, Samal Punsara, Demitha Pasindu, Chamira U. S. Edussooriya, Ranga Rodrigo, Udaya S. K. P. Miriya Thanthrige

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 针对无人机入侵安全问题,提出雷达与声学传感器融合的Transformer编码器方法,利用原始声学信号减少参数,在户外实验中优于现有技术。

Comments Accepted at IEEE 12$^{\text{th}}$~Moratuwa Engineering Research Conference 2026 (MERCon 2026)

Journal ref IEEE 12th Moratuwa Engineering Research Conference 2026 (MERCon 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04748 2026-06-23 q-bio.GN 版本更新 50%

SeekRBP: Leveraging Sequence-Structure Integration with Reinforcement Learning for Receptor-Binding Protein Identification

SeekRBP: 利用强化学习整合序列-结构信息识别受体结合蛋白

Xiling Luo, Le Ou-Yang, Yang Shen, Jiaojiao Guan, Dehan Cai, Jun Zhang, Guoliang Xing, Yanni Sun, Jiayu Shang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出SeekRBP框架,通过多臂老虎机策略动态采样难负例,融合蛋白质语言与结构嵌入,有效识别序列差异大的受体结合蛋白,在噬菌体宿主预测中表现优异。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20904 2026-06-23 eess.IV cs.LG 版本更新 50%

ECGFlowCMR: Pretraining with ECG-Generated Cine CMR Helps Cardiac Disease Classification and Phenotype Prediction

ECGFlowCMR: 利用心电图生成电影心脏磁共振的预训练助力心脏病分类和表型预测

Xiaocheng Fang, Zhengyao Ding, Guangkun Nie, Jieyi Cai, Yujie Xiao, Bo Liu, Jiarui Jin, Haoyu Wang, Shun Huang, Ting Chen, Hongyan Li, Shenda Hong

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Polytechnic Institute of Zhejiang University, Zhejiang University(浙江大学 polytechnic 院) Institute of Computing Technology, University of the Chinese Academy of Sciences(中国科学院计算技术研究所) National Institute of Health Data Science, Peking University(北京大学健康数据科学国家研究院) Institute of Microelectronics, University of the Chinese Academy of Sciences(中国科学院微电子研究所) Department of Cardiology, Zhejiang University(浙江大学心内科部)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 提出ECGFlowCMR框架,通过相位感知掩码自编码器和解剖运动解耦流解决ECG与CMR的跨模态时序错配和解剖可观测性差距,生成逼真电影CMR序列,提升下游心脏病分类和表型预测性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06001 2026-06-19 physics.comp-ph cs.LG 版本更新 50%

A deep learning framework for jointly solving transient Fokker-Planck equations with arbitrary parameters and initial distributions

一种联合求解具有任意参数和初始分布的瞬态Fokker-Planck方程的深度学习框架

Xiaolong Wang, Jing Feng, Qi Liu, Chengli Tan, Yuanyuan Liu, Yong Xu

机构 * School of Mathematics and Statistics, Shaanxi Normal University(陕西师范大学数学与统计学院) School of Mathematics and Statistics, Northwestern Polytechnical University(西北工业大学数学与统计学院) MOE Key Laboratory for Complexity Science in Aerospace, Northwestern Polytechnical University(航空复杂科学教育部重点实验室,西北工业大学) School of Science, Xi’an University of Posts and Telecommunications(西安邮电大学理学院) Department of Systems and Control Engineering, Institute of Science Tokyo(东京科学大学系统与控制工程系)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 提出基于深度学习的伪解析概率解(PAPS),通过单次训练同时求解任意多模态初始分布、系统参数和时间点的瞬态FPE,速度比GPU加速蒙特卡洛快四个数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18166 2026-06-15 cs.IR cs.LG 版本更新 50%

PCR-CA: Parallel Codebook Representations with Contrastive Alignment for Multiple-Category App Recommendation

PCR-CA: 基于对比对齐的并行码本表示用于多类别应用推荐

Bin Tan, Wangyao Ge, Yidi Wang, Xin Liu, Jeff Burtoft, Hao Fan, Hui Wang

机构 * Microsoft Suzhou China(微软苏州中国) Microsoft Beijing China(微软北京中国) Microsoft Redmond WA USA(微软雷德蒙德华盛顿州美国)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出PCR-CA框架,通过并行码本VQ-AE模块学习多类别应用的离散语义表示,结合对比对齐损失和双注意力融合,提升CTR预测,尤其对长尾应用效果显著。

Comments Accepted by KDD 2026, oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14427 2026-06-11 cs.RO cs.LG 版本更新 50%

Self-Supervised Multisensory Pretraining for Contact-Rich Robot Reinforcement Learning

面向接触丰富机器人强化学习的自监督多感官预训练

Rickmer Krohn, Vignesh Prasad, Gabriele Tiboni, Georgia Chalvatzaki

机构 * Interactive Robot Perception & Learning (PEARL) Lab, TU Darmstadt, Germany(图腾机器人感知与学习实验室,图腾施塔德大学,德国) Hessian.AI(海斯堡人工智能) Robotics Institute Germany (RIG)(德国机器人研究所(RIG))

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 提出MSDP框架,通过掩码自编码和跨模态预测学习多感官表示,并采用非对称架构(评论家使用交叉注意力提取动态特征,演员使用稳定池化表示)加速策略学习,在模拟和真实机器人任务中展现出鲁棒性和高效性。

Comments 8 pages, 11 figures

Journal ref IEEE Robotics and Automation Letters, 2026, Vol. 11, No. 6, pp. 6799-6806

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22017 2026-06-10 cs.LG 版本更新 50%

Domain Adapted Large Language Models for Additive Manufacturing

面向增材制造的领域自适应大语言模型

Peter Pak, Amir Barati Farimani

机构 * Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文通过约5000万token的小型数据集对开源大语言模型进行领域自适应预训练和指令微调,构建多模态领域自适应模型,在增材制造基准测试中达到90%以上准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06492 2026-06-09 cs.RO 版本更新 50%

How Well Do Latent World Models Understand Partially Observable Safety Constraints?

潜在世界模型如何理解部分可观测的安全约束?

Matthew Kim, Kensuke Nakamura, Andrea Bajcsy

机构 * UC San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究潜在世界模型在部分可观测安全约束下的故障模式,提出互信息度量和滚动预测度量来诊断估计间隙和预测间隙,并通过多模态监督和共形风险校准缓解问题,提高机器人操作安全性。

Comments 10 tables 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏