DiRecT: Safe Diffusion-Based Planning via Receding-Horizon Denoising
DiRecT:基于滚动去噪的安全扩散规划
机构 * MIT(麻省理工学院)
专题命中 多模态生成 :multimodal(abstract)
AI总结 提出DiRecT算法,通过随机最优控制仅在最终干净轨迹上施加约束,避免中间去噪步骤过度约束,实现安全扩散规划,提升安全性和任务性能。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
DiRecT:基于滚动去噪的安全扩散规划
机构 * MIT(麻省理工学院)
专题命中 多模态生成 :multimodal(abstract)
AI总结 提出DiRecT算法,通过随机最优控制仅在最终干净轨迹上施加约束,避免中间去噪步骤过度约束,实现安全扩散规划,提升安全性和任务性能。
分支流:带有分裂和删除的离散、连续和流形流匹配
机构 * Department of Microbiology, Tumor and Cell Biology, Karolinska Institutet(卡罗林斯卡研究所微生物学、肿瘤和细胞生物学系)
专题命中 多模态生成 :multimodal(abstract)
AI总结 提出分支流框架,通过随机分支和死亡过程控制序列元素数量,适用于变长数据生成,并在小分子、抗体序列和蛋白质骨架生成中验证效果。
Comments 39 pages, 16 figures
流形正交双谱外推法用于参数化物理信息神经网络
机构 * National Center for Applied Mathematics, Tianjin University(天津大学应用数学中心) ; School of Mechanical and Aerospace Engineering, Jilin University(吉林大学机械与 aerospace 工程学院)
专题命中 多模态生成 :cross-modal(abstract)
AI总结 提出流形正交双谱外推法(MODE),通过主谱密集混合、残谱激活和平移解锁三种机制,在保持SVD参数效率的同时实现参数化PINN的强分布外泛化。
ReactVLA: 通过改进的平均流动作生成实现快速轻量级反应式机器人操作
机构 * Shanghai Jiao Tong University(上海交通大学) ; Technical Aspects of Multimodal Systems (TAMS), Department of Informatics, Universität Hamburg(汉堡大学信息学系多模态系统技术方面(TAMS))
专题命中 多模态生成 :multimodal(abstract)
AI总结 提出ReactVLA框架,结合改进的平均流动作生成器和注意力残差机制,实现轻量低延迟的实时机器人操作,在模拟和真实任务中性能提升达1.65倍,推理速度提升4倍以上。
从攻击到课程:面向安全自动驾驶的可学习性引导对抗训练
机构 * College of Transportation & Key Laboratory of Road and Traffic Engineering of Ministry of Education, Tongji University(同济大学交通运输工程学院 & 道路与交通工程教育部重点实验室) ; Department of Civil and Environmental Engineering, The Hong Kong Polytechnic University(香港理工大学土木与环境工程学系)
专题命中 多模态生成 :multi-modal(abstract)
AI总结 提出AlignADV框架,通过偏好对齐生成可解决场景,并利用行为指纹预测策略能力,动态采样课程以提升自动驾驶对抗训练的收敛效率与安全性。
一种稳定的路径空间方法用于基于扩散的后验采样
机构 * Oden Institute for Computational Engineering and Sciences, The University of Texas at Austin(德克萨斯大学奥斯汀分校奥登计算工程与科学研究所) ; Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室) ; Department of Biomedical Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校生物医学工程系) ; Mitsubishi Electric Research Laboratories(三菱电机研究实验室)
专题命中 多模态生成 :multimodal(abstract)
AI总结 提出一种稳定的路径空间框架,通过随机最优控制与信任域优化,实现非线性逆问题中准确且鲁棒的后验采样。
ECHO: 基于人在环操作的可解释协同编辑用于演示文稿优化
专题命中 多模态生成 :multimodal(abstract)
AI总结 针对演示文稿创作中用户缺乏细粒度控制的问题,提出ECHO系统,通过多模态意图理解和可解释操作计划,结合“自然语言+视觉选择”范式和解耦的“计划-确认-执行”循环,实现可控的局部编辑,显著降低认知负荷并提升意图映射与空间定位准确率。
使用扩散策略引导发现新行为
机构 * Munich Institute of Robotics and Machine Intelligence, Technical University of Munich(慕尼黑工业大学慕尼黑机器人与机器智能研究所)
专题命中 多模态生成 :multimodal(abstract)
AI总结 提出结合Feynman-Kac校正器与引导势能的框架,从扩散策略中挖掘并优化罕见但可行的轨迹,再训练策略以系统发现多样化可执行行为。
Comments Preprint. Supplementary video: https://youtu.be/T7MUvMA67VM
学习真实内容:在多传感器数据中分离信号和测量伪影,应用于天体物理学
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Flatiron Institute, Simons Foundation(Flatiron研究所,Simons基金会) ; Institute for Advanced Studies(高级研究 institute) ; Harvard University(哈佛大学) ; New York University(纽约大学) ; Instituto de Astrofísica de Canarias(加那利大天文台)
专题命中 多模态生成 :multi-modal(abstract)
AI总结 本文提出一种深度学习框架,通过重叠观测、双编码器架构和反事实生成目标,分离多传感器数据中的信号与伪影,提升天体物理学研究的准确性。
Comments Accepted at the 2nd Workshop on Foundation Models for Science at ICLR 2026. 10 pages, 7 figures (main text), plus appendix
生成式人工智能在自动驾驶系统测试场景生成方法中的应用综述
专题命中 多模态生成 :multimodal(abstract)
AI总结 综述生成式AI在自动驾驶测试场景生成中的应用,分析31篇主要研究,提出包含多模态扩展、伦理检查表和ODD覆盖图的分类法,以解决标准化评估缺失等问题。
Comments 40 pages,7 figures
车辆网络中的联邦基础模型
机构 * University of Waterloo(多伦多大学)
专题命中 多模态生成 :multi-modal(abstract)
AI总结 本文提出将多模态多任务联邦基础模型(M3T FedFMs)集成到车辆网络中的愿景,结合基础模型的表达力与联邦学习的隐私保护分布式学习能力,并通过Waymo数据集案例验证其潜力。
Comments 8 pages, 4 figures
等变神经信念传播
机构 * Department of Computer Science, University of Oxford(计算机科学系,牛津大学) ; FLock.io
专题命中 多模态生成 :multi-modal(abstract)
AI总结 提出等变神经信念传播(ENBP),通过等变高斯混合消息和秩2精度矩阵合成,实现SE(3)对称性下的高效概率推理,在分子构象和机器人推理任务中显著超越基线。
Comments 18 pages
L-SDPPO:用于舱内机器人操作的脉冲扩散策略优化
机构 * Department of Control Science and Engineering, Harbin Institute of Technology(控制科学与工程系,哈尔滨工业大学) ; Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(机械与自动化工程系,香港中文大学)
专题命中 多模态生成 :multimodal(abstract)
AI总结 提出L-SDPPO框架,结合脉冲扩散策略与强化学习优化,并引入状态依赖延迟注入机制,在舱内机器人操作任务中实现高成功率和低能耗。
由Coreset诱导的条件速度流匹配
机构 * Department of Statistics, Purdue University(普渡大学统计学系)
专题命中 多模态生成 :multimodal(abstract)
AI总结 本文提出了一种生成模型CCVFM,通过数据驱动的源分布增强层次化修正流,利用Coreset压缩目标数据并生成高斯混合分布,从而在无需学习神经采样器的情况下实现条件速度律的闭式表达,并通过轻量级修正流进一步优化生成效果。
D$^3$-MoE:面向风格可控的端到端自动驾驶的双解耦扩散混合专家模型
机构 * Intelligent Transportation Systems Research Center, Wuhan University of Technology(武汉理工大学智能交通系统研究中心) ; School of Mechanical and Electronic Engineering, Wuhan University of Technology(武汉理工大学机械电子工程学院) ; School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) ; Hubei Key Laboratory of Distributed System Security, School of Cyber Science and Engineering, Huazhong University of Science and Technology(湖北省分布式系统安全重点实验室,华中科技大学网络空间安全学院)
专题命中 多模态生成 :multi-modal(abstract)
AI总结 提出D$^3$-MoE框架,通过行为轴(扩散生成与选择解耦)和物理轴(纵向与横向专家解耦)的双重解耦,实现风格可控的端到端自动驾驶,在NAVSIM基准上达到SOTA规划性能。
Comments 8 pages, 6 figures
潜在共同流形学习与交替扩散:分析与应用
专题命中 多模态生成 :multimodal(abstract)
AI总结 本文提出基于交替扩散的潜在共同流形模型,用于多模态数据融合,分析其理论基础并展示在多个应用中的实验结果。
DiffUNet^2: 科学数据的双向预测、概率生成与协同视觉发现
机构 * Ohio State University(俄亥俄州立大学) ; NVIDIA ; Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)
专题命中 多模态生成 :any-to-any(abstract)
AI总结 提出基于扩散模型的条件生成框架DiffUNet^2,实现时间序列的双向任意步预测与概率分布捕获,并结合交互式可视化支持科学探索。
Comments 12 pages, 20 figures
层状材料中四方锂的可逆超密有序
专题命中 多模态生成 :multimodal(abstract)
AI总结 利用多模态扫描透射电子显微镜结合成像、光谱和衍射,原位观测全固态电化学电池中锂的插层过程,发现LaTe3中三种有序相及高浓度下具有四方对称性的三层超密锂相,实现锂有序和动力学的完整追踪。
GLENS: 通过扩散模型从求解器迭代中学习进行全局搜索
机构 * Department of Electrical and Computer Engineering, Princeton University(电气工程与计算机科学系,普林斯顿大学) ; Department of Operations Research and Financial Engineering, Princeton University(运筹学与金融工程系,普林斯顿大学) ; Department of Mechanical and Aerospace Engineering, Princeton University(机械与航空航天工程系,普林斯顿大学)
专题命中 多模态生成 :multimodal(abstract)
AI总结 提出GLENS方法,利用扩散模型学习求解器迭代过程中的局部几何结构,生成高质量且多样化的初始猜测,加速多模态非凸优化问题的全局搜索。
扑翼飞行器仿真平台
专题命中 多模态生成 :multi-modal(abstract)
AI总结 针对扑翼飞行器仿真与现实差距大的问题,提出FWAV-Sim高保真仿真平台,集成复合气动模型、湍流生成和真实传感器模拟,提升自主系统开发效果。
世界模型:架构、方法论、推理范式与应用的全面综述
机构 * School of Computer and Cyber Sciences, Augusta University(奥古斯塔大学计算机与网络科学学院) ; School of Computing, University of Georgia(佐治亚大学计算机学院) ; Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) ; Department of Radiology, Massachusetts General Hospital, Harvard Medical School(麻省总医院放射科,哈佛医学院) ; Department of Computer Science and Engineering, University of Texas at Arlington(德克萨斯大学阿灵顿分校计算机科学与工程系) ; Department of Graduate Psychology, James Madison University(詹姆斯麦迪逊大学研究生心理学系) ; Computer Science and Engineering, Lehigh University(莱斯大学计算机科学与工程系) ; School of Biomedical Engineering, The University of Sydney(悉尼大学生物医学工程学院) ; Tandon School of Engineering, New York University(纽约大学泰坦工程学院) ; Department of Radiation Oncology, City of Hope National Medical Center(城市希望国家医学中心放射肿瘤科) ; Department of Mayo Clinic Comprehensive Cancer Center, Mayo Clinics(梅奥诊所综合癌症中心,梅奥诊所) ; Savannah River Ecology Laboratory (SREL), University of Georgia(萨凡纳河生态实验室(SREL),佐治亚大学)
专题命中 多模态生成 :multimodal(abstract)
AI总结 本文提出一个多轴分类法,从架构、方法论、推理策略和应用领域四个维度系统综述世界模型,涵盖从早期认知科学基础到PlaNet、Dreamer系列、MuZero、Sora等里程碑系统,并指出未来方向。
基于图扩散的全身逆运动学
机构 * Large Model Algorithm Lab, Huawei(华为大模型算法实验室)
专题命中 多模态生成 :multi-modal(abstract)
AI总结 提出GraphDiff-IK,一种结构感知的图扩散逆运动学框架,通过将机器人表示为运动学图并引入分层消息传递和躯干感知条件,实现了多分支机器人的准确稳定IK求解。
LAP:面向自动驾驶的快速潜在扩散规划器
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 多模态生成 :multi-modal(abstract)
AI总结 提出LAP框架,在VAE学习的潜在空间中进行规划,通过单步去噪实现高质量规划,在nuPlan基准上达到学习型规划方法的最优闭环性能,推理速度提升高达10倍。
自模仿扩散策略用于高效鲁棒的视觉导航
机构 * Uni-Ubi Technology Co., Ltd.(Uni-Ubi技术有限公司) ; College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院)
专题命中 多模态生成 :multi-modal(abstract)
AI总结 提出自模仿扩散策略(SIDP),通过奖励引导的自模仿机制和课程学习范式,减少对大量采样和后过滤的依赖,实现高效鲁棒的视觉导航。
Comments Preprint
表面约束策略:学习受表面约束且动态可行的机器人技能
机构 * State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(智能制造装备与技术国家重点实验室,华中科技大学)
专题命中 多模态生成 :multimodal(abstract)
AI总结 提出表面约束策略(SCP),通过二维加权高斯核编码表面几何约束,结合扩散策略和基于相似性的动作映射生成动态可行的表面约束运动,解决了自由曲面约束下动作随机性和接触不稳定的问题。
何时、为何以及如何扩散后验采样器失败?一个有限样本视角
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 多模态生成 :multimodal(abstract)
AI总结 本文从有限样本视角分析扩散后验采样器中似然近似误差导致后验分布偏差的原因,发现中间时间步的后验扩散估计不准确会导致模式加权错误和幻觉,并提出一种与近似类型无关的诊断方法。
Comments All code for experiments is available at: https://github.com/voilalab/diagnosing-posterior-sampling
污染白矮星中潜在化学技术特征的一种校准贝叶斯搜索
专题命中 多模态生成 :multi-modal(abstract)
AI总结 提出一种陨石校准的贝叶斯框架,通过比较自然岩石与理想化“加工”模板的组成模式,搜索白矮星丰度记录中的化学技术特征,并量化其可检测发生率。
Comments 21 pages, 11 figures, 5 tables. Accepted for publication in The Astrophysical Journal
MARS策略:仅在必要时使用多模态
机构 * MARS Lab, Nanyang Technological University(MARS实验室,南洋理工大学)
专题命中 多模态生成 :multimodal(abstract)
AI总结 提出MARS策略,通过自适应地在需要时引入随机性,在单模态阶段使用确定性学习,平衡生成策略的多模态能力与确定性模型的高效率,在模拟和真实任务中提升成功率和推理速度。
Comments 13 figures, 17 pages
PhAME: 基于表型感知的潜在扩散分子编辑
机构 * Faculty of Mathematics and Computer Science, Jagiellonian University(杰洛内夫斯基大学数学与计算机科学学院) ; Doctoral School of Exact and Natural Sciences, Jagiellonian University(杰洛内夫斯基大学精确与自然科学博士学院) ; Jagiellonian Center for Artificial Intelligence, Jagiellonian University(杰洛内夫斯基人工智能中心) ; Faculty of Chemistry, Jagiellonian University(杰洛内夫斯基大学化学系) ; Ardigen SA(Ardigen公司)
专题命中 多模态生成 :multimodal(abstract)
AI总结 提出PhAME框架,利用潜在扩散模型在预训练图VAE的潜在空间中进行分子编辑,通过组合无分类器引导机制同时优化表型条件和结构相似性,实现高化学有效性和新颖性的多目标分子优化。
ROOM: 基于物理的连续体机器人模拟器,用于生成逼真的医学数据集
机构 * University of Edinburgh, UK(爱丁堡大学,英国) ; University of British Columbia, Canada(不列颠哥伦比亚大学,加拿大)
专题命中 多模态生成 :multi-modal(abstract)
AI总结 提出ROOM模拟框架,利用患者CT扫描生成多模态支气管镜训练数据,验证其在姿态估计和深度估计任务中的有效性。
Journal ref International Conference on Robotics and Automation 2026