Rapid Bayesian Computation and Estimation for Neural Networks via Log-Concave Coupling
专题命中 多模态训练与对齐 :multi-modal(abstract)
Journal ref Math. Stat. Learn. (2026), published online first
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态训练与对齐 :multi-modal(abstract)
Journal ref Math. Stat. Learn. (2026), published online first
先定位再中和:梯度引导的令牌抑制对抗视觉提示注入攻击
机构 * School of Advanced Interdisciplinary Sciences, UCAS(UCAS交叉学科研究院) ; School of Electronic, Electrical and Communication Engineering, UCAS(UCAS电子电气与通信工程学院) ; State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) ; Alibaba Group(阿里巴巴集团) ; School of Computer Science and Technology, UCAS(UCAS计算机科学与技术学院) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Key Laboratory of Big Data Mining and Knowledge Management, UCAS(UCAS大数据挖掘与知识管理重点实验室)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 针对多模态大语言模型的视觉提示注入攻击,提出梯度令牌掩码(GTM)方法,通过梯度分析定位关键图像令牌并掩码中和,将攻击成功率降至接近零且计算开销极小。
群体感知的物理信息神经粒子流用于贝叶斯更新
机构 * Iowa State University(爱荷华州立大学)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 提出群体感知的物理信息神经粒子流(PA-PINPF),通过群体编码器增强粒子更新,在贝叶斯后验传输中优于标准方法。
从噪声心脏血流测量中学习疾病敏感的潜在交互图
机构 * Department of Computer Science, University of Bath(巴斯大学计算机科学系) ; Department of Mechanical Engineering, University of Bath(巴斯大学机械工程系) ; Christian Doppler Laboratory for Mechanical Circulatory Support, Department of Cardiac and Thoracic Aortic Surgery, Medical University of Vienna(维也纳医学大学心脏和胸主动脉外科系基督教多普勒实验室)
专题命中 多模态训练与对齐 :cross-modal(abstract)
AI总结 本文提出了一种物理指导的潜在关系框架,用于从噪声心脏血流测量中学习疾病敏感的潜在交互图,以捕捉心脏疾病和干预的稳健标志。
学习何时视觉何时触觉:适应性视觉-扭矩融合用于接触感知操控
机构 * Edwardson School of Industrial Engineering, Purdue University(普渡大学爱德华森工业工程学院) ; Zachry Department of Civil and Environmental Engineering, Texas A&M University(德州农工大学扎克里土木与环境工程系)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 本文提出适应性视觉-扭矩融合策略,通过比较不同融合方法提升机器人操控性能,实验显示方法在成功率上优于基线14%。
GPA-RAM:用于空间任务学习的抓取预训练增强型机器人注意力Mamba
机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(国家一般人工智能重点实验室,北京大学深圳研究生院) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) ; State Key Laboratory of Internet of Things for Smart City, University of Macau(智慧城市物联网重点实验室,澳门大学)
专题命中 多模态训练与对齐 :multi-modal(abstract)
AI总结 该研究提出GPA-RAM框架,通过GPA增强模仿策略并开发RAM实现高效计算,在多机器人平台的空间操纵任务中显著提升成功率,兼顾精度与实时性。
基于智能体的人工智能助力大规模睡眠生理学研究
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 研究利用人工智能睡眠联合科学家环境,在约124,000份PSG记录上进行五个案例研究,揭示睡眠与疾病风险、临床分类及自身调节的联系,展示智能体人工智能助力大规模、多模态睡眠生理学发现。
无线令牌通信:基于强化学习的多用户无线令牌通信中的令牌化协议
机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 本文提出基于强化学习的混合框架,用于多用户无线TokenCom中的令牌化协议,提升语义质量和资源效率,减少视频传输中的冻结事件。
Comments Submitted to IEEE Journal for possible publication
PrimitiveVLA:学习可复用的运动基元以实现高效且可泛化的机器人操作
机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) ; Jiangsu Key Laboratory of AI for Industries, Institute of AI for Industries, CAS(江苏人工智能工业重点实验室,人工智能工业研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Cambricon Technologies(寒武科技) ; Intelligent Software Research Center, Institute of Software, CAS(软件研究所智能软件研究中心,中国科学院) ; University of Science and Technology of China(中国科学技术大学)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 提出PrimitiveVLA框架,通过将视觉-语言-动作模型从直接指令到控制映射转向以基元为中心的拆解与组装范式,利用多模态规范表示和自动化流水线,提升数据效率并实现零样本泛化。
AvAtar: 通过主动最优输运学习对齐
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Florida(佛罗里达大学) ; Arizona State University(亚利桑那州立大学)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 提出AvAtar框架,利用主动学习策略通过熵正则化最优输运的梯度影响量化候选点信息量,并采用伴随状态法高效求解,以提升对齐性能。
Comments Published as a conference paper at ICML 2026
基于Transformer编码器的雷达与声学传感器融合用于鲁棒的无人机检测与分类
专题命中 多模态训练与对齐 :multi-modal(abstract)
AI总结 针对无人机入侵安全问题,提出雷达与声学传感器融合的Transformer编码器方法,利用原始声学信号减少参数,在户外实验中优于现有技术。
Comments Accepted at IEEE 12$^{\text{th}}$~Moratuwa Engineering Research Conference 2026 (MERCon 2026)
Journal ref IEEE 12th Moratuwa Engineering Research Conference 2026 (MERCon 2026)
SeekRBP: 利用强化学习整合序列-结构信息识别受体结合蛋白
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 提出SeekRBP框架,通过多臂老虎机策略动态采样难负例,融合蛋白质语言与结构嵌入,有效识别序列差异大的受体结合蛋白,在噬菌体宿主预测中表现优异。
Comments 7 pages, 5 figures
ECGFlowCMR: 利用心电图生成电影心脏磁共振的预训练助力心脏病分类和表型预测
机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) ; Polytechnic Institute of Zhejiang University, Zhejiang University(浙江大学 polytechnic 院) ; Institute of Computing Technology, University of the Chinese Academy of Sciences(中国科学院计算技术研究所) ; National Institute of Health Data Science, Peking University(北京大学健康数据科学国家研究院) ; Institute of Microelectronics, University of the Chinese Academy of Sciences(中国科学院微电子研究所) ; Department of Cardiology, Zhejiang University(浙江大学心内科部)
专题命中 多模态训练与对齐 :cross-modal(abstract)
AI总结 提出ECGFlowCMR框架,通过相位感知掩码自编码器和解剖运动解耦流解决ECG与CMR的跨模态时序错配和解剖可观测性差距,生成逼真电影CMR序列,提升下游心脏病分类和表型预测性能。
Comments Accepted to KDD 2026
一种联合求解具有任意参数和初始分布的瞬态Fokker-Planck方程的深度学习框架
机构 * School of Mathematics and Statistics, Shaanxi Normal University(陕西师范大学数学与统计学院) ; School of Mathematics and Statistics, Northwestern Polytechnical University(西北工业大学数学与统计学院) ; MOE Key Laboratory for Complexity Science in Aerospace, Northwestern Polytechnical University(航空复杂科学教育部重点实验室,西北工业大学) ; School of Science, Xi’an University of Posts and Telecommunications(西安邮电大学理学院) ; Department of Systems and Control Engineering, Institute of Science Tokyo(东京科学大学系统与控制工程系)
专题命中 多模态训练与对齐 :multi-modal(abstract)
AI总结 提出基于深度学习的伪解析概率解(PAPS),通过单次训练同时求解任意多模态初始分布、系统参数和时间点的瞬态FPE,速度比GPU加速蒙特卡洛快四个数量级。
PCR-CA: 基于对比对齐的并行码本表示用于多类别应用推荐
机构 * Microsoft Suzhou China(微软苏州中国) ; Microsoft Beijing China(微软北京中国) ; Microsoft Redmond WA USA(微软雷德蒙德华盛顿州美国)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 提出PCR-CA框架,通过并行码本VQ-AE模块学习多类别应用的离散语义表示,结合对比对齐损失和双注意力融合,提升CTR预测,尤其对长尾应用效果显著。
Comments Accepted by KDD 2026, oral
面向接触丰富机器人强化学习的自监督多感官预训练
机构 * Interactive Robot Perception & Learning (PEARL) Lab, TU Darmstadt, Germany(图腾机器人感知与学习实验室,图腾施塔德大学,德国) ; Hessian.AI(海斯堡人工智能) ; Robotics Institute Germany (RIG)(德国机器人研究所(RIG))
专题命中 多模态训练与对齐 :cross-modal(abstract)
AI总结 提出MSDP框架,通过掩码自编码和跨模态预测学习多感官表示,并采用非对称架构(评论家使用交叉注意力提取动态特征,演员使用稳定池化表示)加速策略学习,在模拟和真实机器人任务中展现出鲁棒性和高效性。
Comments 8 pages, 11 figures
Journal ref IEEE Robotics and Automation Letters, 2026, Vol. 11, No. 6, pp. 6799-6806
面向增材制造的领域自适应大语言模型
机构 * Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)
专题命中 多模态训练与对齐 :multi-modal(abstract)
AI总结 本文通过约5000万token的小型数据集对开源大语言模型进行领域自适应预训练和指令微调,构建多模态领域自适应模型,在增材制造基准测试中达到90%以上准确率。
潜在世界模型如何理解部分可观测的安全约束?
机构 * UC San Diego(加州大学圣地亚哥分校) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 研究潜在世界模型在部分可观测安全约束下的故障模式,提出互信息度量和滚动预测度量来诊断估计间隙和预测间隙,并通过多模态监督和共形风险校准缓解问题,提高机器人操作安全性。
Comments 10 tables 5 figures