arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4965 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4965 篇

2606.15359 2026-06-16 cs.LG 新提交 50%

DiRecT: Safe Diffusion-Based Planning via Receding-Horizon Denoising

DiRecT:基于滚动去噪的安全扩散规划

Paolo Giaretta, Zeyang Li, Navid Azizan

机构 * MIT(麻省理工学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出DiRecT算法,通过随机最优控制仅在最终干净轨迹上施加约束,避免中间去噪步骤过度约束,实现安全扩散规划,提升安全性和任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09465 2026-06-16 stat.ML cs.LG 版本更新 50%

Branching Flows: Discrete, Continuous, and Manifold Flow Matching with Splits and Deletions

分支流:带有分裂和删除的离散、连续和流形流匹配

Lukas Billera, Hedwig Nora Nordlinder, Jack Collier Ryder, Anton Oresten, Aron Stålmarck, Theodor Mosetti Björk, Ben Murrell

机构 * Department of Microbiology, Tumor and Cell Biology, Karolinska Institutet(卡罗林斯卡研究所微生物学、肿瘤和细胞生物学系)

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出分支流框架,通过随机分支和死亡过程控制序列元素数量,适用于变长数据生成,并在小分子、抗体序列和蛋白质骨架生成中验证效果。

Comments 39 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13751 2026-06-16 cs.LG 版本更新 50%

Manifold-Orthogonal Dual-spectrum Extrapolation for Parameterized Physics-Informed Neural Networks

流形正交双谱外推法用于参数化物理信息神经网络

Zhangyong Liang, Huanhuan Gao

机构 * National Center for Applied Mathematics, Tianjin University(天津大学应用数学中心) School of Mechanical and Aerospace Engineering, Jilin University(吉林大学机械与 aerospace 工程学院)

专题命中 多模态生成 :cross-modal(abstract)

AI总结 提出流形正交双谱外推法(MODE),通过主谱密集混合、残谱激活和平移解锁三种机制,在保持SVD参数效率的同时实现参数化PINN的强分布外泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14255 2026-06-15 cs.RO 新提交 50%

ReactVLA: Fast and Lightweight Reactive Robot Manipulation via Improved Mean Flow Action Generation

ReactVLA: 通过改进的平均流动作生成实现快速轻量级反应式机器人操作

Yanzhao Guo, Wenkai Chen, Jianwei Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Technical Aspects of Multimodal Systems (TAMS), Department of Informatics, Universität Hamburg(汉堡大学信息学系多模态系统技术方面(TAMS))

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出ReactVLA框架,结合改进的平均流动作生成器和注意力残差机制,实现轻量低延迟的实时机器人操作,在模拟和真实任务中性能提升达1.65倍,推理速度提升4倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14032 2026-06-15 cs.RO 新提交 50%

From Attacks to Curricula: Learnability-Guided Adversarial Training for Safe Autonomous Driving

从攻击到课程:面向安全自动驾驶的可学习性引导对抗训练

Yuewen Mei, Tong Nie, Jie Sun, Haotian Shi, Wei Ma, Jian Sun

机构 * College of Transportation & Key Laboratory of Road and Traffic Engineering of Ministry of Education, Tongji University(同济大学交通运输工程学院 & 道路与交通工程教育部重点实验室) Department of Civil and Environmental Engineering, The Hong Kong Polytechnic University(香港理工大学土木与环境工程学系)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 提出AlignADV框架,通过偏好对齐生成可解决场景,并利用行为指纹预测策略能力,动态采样课程以提升自动驾驶对抗训练的收敛效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12710 2026-06-12 cs.LG math.OC 新提交 50%

A Stabilized Path-Space Approach to Diffusion-Based Posterior Sampling

一种稳定的路径空间方法用于基于扩散的后验采样

Evan Scope Crafts, Umberto Villa, Saviz Mowlavi, Yanting Ma, Hassan Mansour, Wael H. Ali

机构 * Oden Institute for Computational Engineering and Sciences, The University of Texas at Austin(德克萨斯大学奥斯汀分校奥登计算工程与科学研究所) Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室) Department of Biomedical Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校生物医学工程系) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出一种稳定的路径空间框架,通过随机最优控制与信任域优化,实现非线性逆问题中准确且鲁棒的后验采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09851 2026-06-10 cs.HC 新提交 50%

ECHO: Explainable Co-editing with Human-in-the-loop Operations for Presentation Refinement

ECHO: 基于人在环操作的可解释协同编辑用于演示文稿优化

Yu Fu, Yongqi Kang, Yujia Zhou, Yong Zhao

专题命中 多模态生成 :multimodal(abstract)

AI总结 针对演示文稿创作中用户缺乏细粒度控制的问题,提出ECHO系统,通过多模态意图理解和可解释操作计划,结合“自然语言+视觉选择”范式和解耦的“计划-确认-执行”循环,实现可控的局部编辑,显著降低认知负荷并提升意图映射与空间定位准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08743 2026-06-09 cs.RO 新提交 50%

Guided Discovery of New Behaviors using Diffusion Policies

使用扩散策略引导发现新行为

Dian Yu, Sebastian Sanokowski, Majid Khadiv

机构 * Munich Institute of Robotics and Machine Intelligence, Technical University of Munich(慕尼黑工业大学慕尼黑机器人与机器智能研究所)

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出结合Feynman-Kac校正器与引导势能的框架,从扩散策略中挖掘并优化罕见但可行的轨迹,再训练策略以系统发现多样化可执行行为。

Comments Preprint. Supplementary video: https://youtu.be/T7MUvMA67VM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09787 2026-06-09 astro-ph.IM astro-ph.GA cs.LG 版本更新 50%

Learning What's Real: Disentangling Signal and Measurement Artifacts in Multi-Sensor Data, with Applications to Astrophysics

学习真实内容:在多传感器数据中分离信号和测量伪影,应用于天体物理学

Pablo Mercader-Perez, Carolina Cuesta-Lazaro, Daniel Muthukrishna, Jeroen Audenaert, V. Ashley Villar, David W. Hogg, Marc Huertas-Company, William T. Freeman

机构 * Massachusetts Institute of Technology(麻省理工学院) Flatiron Institute, Simons Foundation(Flatiron研究所,Simons基金会) Institute for Advanced Studies(高级研究 institute) Harvard University(哈佛大学) New York University(纽约大学) Instituto de Astrofísica de Canarias(加那利大天文台)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出一种深度学习框架,通过重叠观测、双编码器架构和反事实生成目标,分离多传感器数据中的信号与伪影,提升天体物理学研究的准确性。

Comments Accepted at the 2nd Workshop on Foundation Models for Science at ICLR 2026. 10 pages, 7 figures (main text), plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15422 2026-06-09 cs.SE 版本更新 50%

A Survey on the Applications of Generative Artificial Intelligence in Automated Driving Systems Test Scenario Generation Methods

生成式人工智能在自动驾驶系统测试场景生成方法中的应用综述

Ji Zhou, Yongqi Zhao, Yixian Hu, Hexuan Li, Zhengguo Gu, Nan Xu, Arno Eichberger

专题命中 多模态生成 :multimodal(abstract)

AI总结 综述生成式AI在自动驾驶测试场景生成中的应用,分析31篇主要研究,提出包含多模态扩展、伦理检查表和ODD覆盖图的分类法,以解决标准化评估缺失等问题。

Comments 40 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06786 2026-06-08 cs.LG cs.NI 新提交 50%

Federated Foundation Models over Vehicular Networks

车辆网络中的联邦基础模型

Kasra Borazjani, Fardis Nadimi, Payam Abdisarabshali, Owen Palinski, Allan Salihovic, Dinh Nguyen, Minghui Liwang, Seyyedali Hosseinalipour

机构 * University of Waterloo(多伦多大学)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出将多模态多任务联邦基础模型(M3T FedFMs)集成到车辆网络中的愿景,结合基础模型的表达力与联邦学习的隐私保护分布式学习能力,并通过Waymo数据集案例验证其潜力。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06344 2026-06-05 cs.LG cs.SC 50%

Equivariant Neural Belief Propagation

等变神经信念传播

Zehua Cheng, Wei Dai, Jiahao Sun

机构 * Department of Computer Science, University of Oxford(计算机科学系,牛津大学) FLock.io

专题命中 多模态生成 :multi-modal(abstract)

AI总结 提出等变神经信念传播(ENBP),通过等变高斯混合消息和秩2精度矩阵合成,实现SE(3)对称性下的高效概率推理,在分子构象和机器人推理任务中显著超越基线。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06049 2026-06-05 cs.RO 50%

L-SDPPO: Policy Optimization of Spiking Diffusion Policy for Intra-vehicular Robotic Manipulation

L-SDPPO:用于舱内机器人操作的脉冲扩散策略优化

Liwen Zhang, Dong Zhou, Guanghui Sun, Yifei Zheng, Yuhui Hu, Kaihong Ouyang, Zuoquan Zhao

机构 * Department of Control Science and Engineering, Harbin Institute of Technology(控制科学与工程系,哈尔滨工业大学) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(机械与自动化工程系,香港中文大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出L-SDPPO框架,结合脉冲扩散策略与强化学习优化,并引入状态依赖延迟注入机制,在舱内机器人操作任务中实现高成功率和低能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12951 2026-06-05 stat.ML cs.LG 50%

Coreset-Induced Conditional Velocity Flow Matching

由Coreset诱导的条件速度流匹配

Xiao Wang, Zihua She, Jianxi Su

机构 * Department of Statistics, Purdue University(普渡大学统计学系)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出了一种生成模型CCVFM,通过数据驱动的源分布增强层次化修正流,利用Coreset压缩目标数据并生成高斯混合分布,从而在无需学习神经采样器的情况下实现条件速度律的闭式表达,并通过轻量级修正流进一步优化生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04884 2026-06-04 cs.RO 50%

D$^3$-MoE:Dual Disentangled Diffusion Mixture-of-Experts for Style-Controllable End-to-End Autonomous Driving

D$^3$-MoE:面向风格可控的端到端自动驾驶的双解耦扩散混合专家模型

Renju Feng, Rukang Wang, Ning Xi, Jianguo Yu, Liping Lu, Pan Zhou, Duanfeng Chu

机构 * Intelligent Transportation Systems Research Center, Wuhan University of Technology(武汉理工大学智能交通系统研究中心) School of Mechanical and Electronic Engineering, Wuhan University of Technology(武汉理工大学机械电子工程学院) School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) Hubei Key Laboratory of Distributed System Security, School of Cyber Science and Engineering, Huazhong University of Science and Technology(湖北省分布式系统安全重点实验室,华中科技大学网络空间安全学院)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 提出D$^3$-MoE框架,通过行为轴(扩散生成与选择解耦)和物理轴(纵向与横向专家解耦)的双重解耦,实现风格可控的端到端自动驾驶,在NAVSIM基准上达到SOTA规划性能。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1602.00078 2026-06-04 physics.data-an cs.DS cs.NA math.NA stat.ML 50%

Latent common manifold learning with alternating diffusion: analysis and applications

潜在共同流形学习与交替扩散:分析与应用

Ronen Talmon, Hau-tieng Wu

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出基于交替扩散的潜在共同流形模型,用于多模态数据融合,分析其理论基础并展示在多个应用中的实验结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03926 2026-06-03 cs.HC cs.LG 50%

DiffUNet^2: Bidirectional Prediction, Probabilistic Generation and Collaborative Visual Discovery for Scientific Data

DiffUNet^2: 科学数据的双向预测、概率生成与协同视觉发现

Mengdi Chu, Jiaxin Yang, Angus G. Forbes, Nathan Debardeleben, Earl Lawrence, Ayan Biswas, Han-Wei Shen

机构 * Ohio State University(俄亥俄州立大学) NVIDIA Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 多模态生成 :any-to-any(abstract)

AI总结 提出基于扩散模型的条件生成框架DiffUNet^2,实现时间序列的双向任意步预测与概率分布捕获,并结合交互式可视化支持科学探索。

Comments 12 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03563 2026-06-03 cond-mat.mtrl-sci cond-mat.mes-hall 50%

Reversible Superdense Ordering of Tetragonal Lithium in a Layered Material

层状材料中四方锂的可逆超密有序

Natalie L. Williams, Stephen D. Funni, Sihun Lee, Drake Niedzielski, Mingjia Fang, Josh Leeman, Ratnadwip Singha, Saif Siddique, Tyler Hendee, Shiyu Xu, Jeffrey Kaaret, Giovanni Sartorello, Nicole A. Benedek, Leslie M. Schoop, Lynden A. Archer, Tomás A. Arias, Judy J. Cha

专题命中 多模态生成 :multimodal(abstract)

AI总结 利用多模态扫描透射电子显微镜结合成像、光谱和衍射,原位观测全固态电化学电池中锂的插层过程,发现LaTe3中三种有序相及高浓度下具有四方对称性的三层超密锂相,实现锂有序和动力学的完整追踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00366 2026-06-03 cs.LG math.OC 50%

GLENS: Global Search via Learning from Solver Iterates with Diffusion Models

GLENS: 通过扩散模型从求解器迭代中学习进行全局搜索

Anjian Li, Bartolomeo Stellato, Ryne Beeson

机构 * Department of Electrical and Computer Engineering, Princeton University(电气工程与计算机科学系,普林斯顿大学) Department of Operations Research and Financial Engineering, Princeton University(运筹学与金融工程系,普林斯顿大学) Department of Mechanical and Aerospace Engineering, Princeton University(机械与航空航天工程系,普林斯顿大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出GLENS方法,利用扩散模型学习求解器迭代过程中的局部几何结构,生成高质量且多样化的初始猜测,加速多模态非凸优化问题的全局搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02370 2026-06-02 cs.RO 50%

A Simulation Platform for Flapping-Wing Vehicles

扑翼飞行器仿真平台

Haichuan Li, Tomi Westerlund

专题命中 多模态生成 :multi-modal(abstract)

AI总结 针对扑翼飞行器仿真与现实差距大的问题,提出FWAV-Sim高保真仿真平台,集成复合气动模型、湍流生成和真实传感器模拟,提升自主系统开发效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00133 2026-06-02 cs.LG cs.ET 50%

World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications

世界模型:架构、方法论、推理范式与应用的全面综述

Arif Hassan Zidan, Yi Pan, Hanqi Jiang, Ruiyu Yan, Wei Ruan, Zihao Wu, Lifeng Chen, Weihang You, Xinliang Li, Bowen Chen, Huawen Hu, Peilong Wang, Sizhuang Liu, Jing Zhang, Siyuan Li, Zhengliang Liu, Yu Bao, Lin Zhao, Lichao Sun, Dajiang Zhu, Xiang Li, Jinglei Lv, Quanzheng Li, Wei Liu, Tianming Liu, Wei Zhang

机构 * School of Computer and Cyber Sciences, Augusta University(奥古斯塔大学计算机与网络科学学院) School of Computing, University of Georgia(佐治亚大学计算机学院) Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) Department of Radiology, Massachusetts General Hospital, Harvard Medical School(麻省总医院放射科,哈佛医学院) Department of Computer Science and Engineering, University of Texas at Arlington(德克萨斯大学阿灵顿分校计算机科学与工程系) Department of Graduate Psychology, James Madison University(詹姆斯麦迪逊大学研究生心理学系) Computer Science and Engineering, Lehigh University(莱斯大学计算机科学与工程系) School of Biomedical Engineering, The University of Sydney(悉尼大学生物医学工程学院) Tandon School of Engineering, New York University(纽约大学泰坦工程学院) Department of Radiation Oncology, City of Hope National Medical Center(城市希望国家医学中心放射肿瘤科) Department of Mayo Clinic Comprehensive Cancer Center, Mayo Clinics(梅奥诊所综合癌症中心,梅奥诊所) Savannah River Ecology Laboratory (SREL), University of Georgia(萨凡纳河生态实验室(SREL),佐治亚大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出一个多轴分类法,从架构、方法论、推理策略和应用领域四个维度系统综述世界模型,涵盖从早期认知科学基础到PlaNet、Dreamer系列、MuZero、Sora等里程碑系统,并指出未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00086 2026-06-02 cs.RO 50%

Whole-Body Inverse Kinematics with Graph Diffusion

基于图扩散的全身逆运动学

Helong Huang, Kai Tan, Feng Wen, Guowei Huang, Xingyue Quan

机构 * Large Model Algorithm Lab, Huawei(华为大模型算法实验室)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 提出GraphDiff-IK,一种结构感知的图扩散逆运动学框架,通过将机器人表示为运动学图并引入分层消息传递和躯干感知条件,实现了多分支机器人的准确稳定IK求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00470 2026-06-02 cs.RO 50%

LAP: Fast LAtent Diffusion Planner for Autonomous Driving

LAP:面向自动驾驶的快速潜在扩散规划器

Jinhao Zhang, Wenlong Xia, Zhexuan Zhou, Haoming Song, Youmin Gong, Jie Mei

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 提出LAP框架,在VAE学习的潜在空间中进行规划,通过单步去噪实现高质量规划,在nuPlan基准上达到学习型规划方法的最优闭环性能,推理速度提升高达10倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22965 2026-06-02 cs.RO 50%

Self-Imitated Diffusion Policy for Efficient and Robust Visual Navigation

自模仿扩散策略用于高效鲁棒的视觉导航

Runhua Zhang, Junyi Hou, Changxu Cheng, Qiyi Chen, Tao Wang, Wuyue Zhao

机构 * Uni-Ubi Technology Co., Ltd.(Uni-Ubi技术有限公司) College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 提出自模仿扩散策略(SIDP),通过奖励引导的自模仿机制和课程学习范式,减少对大量采样和后过滤的依赖,实现高效鲁棒的视觉导航。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31321 2026-06-01 cs.RO 50%

Surface Constraint Policy for Learning Surface-Constrained and Dynamically Feasible Robot Skills

表面约束策略:学习受表面约束且动态可行的机器人技能

Shuai Ke, Jiexin Zhang, Huan Zhao, Zhiao Wei, Yikun Guo, Jie Pan, Han Ding

机构 * State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(智能制造装备与技术国家重点实验室,华中科技大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出表面约束策略(SCP),通过二维加权高斯核编码表面几何约束,结合扩散策略和基于相似性的动作映射生成动态可行的表面约束运动,解决了自由曲面约束下动作随机性和接触不稳定的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30330 2026-05-29 cs.LG 50%

When, why, and how do diffusion posterior samplers fail? A finite-sample lens

何时、为何以及如何扩散后验采样器失败?一个有限样本视角

Benjamin A. Burns, Sara Fridovich-Keil

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文从有限样本视角分析扩散后验采样器中似然近似误差导致后验分布偏差的原因,发现中间时间步的后验扩散估计不准确会导致模式加权错误和幻觉,并提出一种与近似类型无关的诊断方法。

Comments All code for experiments is available at: https://github.com/voilalab/diagnosing-posterior-sampling

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29811 2026-05-29 astro-ph.EP astro-ph.GA astro-ph.IM astro-ph.SR 50%

A Calibrated Bayesian Search for Potential Chemical Technosignatures in Polluted White Dwarf

污染白矮星中潜在化学技术特征的一种校准贝叶斯搜索

Bo-Lun Huang, Zhen-Zhao Tao, Tong-Jie Zhang

专题命中 多模态生成 :multi-modal(abstract)

AI总结 提出一种陨石校准的贝叶斯框架,通过比较自然岩石与理想化“加工”模板的组成模式,搜索白矮星丰度记录中的化学技术特征,并量化其可检测发生率。

Comments 21 pages, 11 figures, 5 tables. Accepted for publication in The Astrophysical Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29766 2026-05-29 cs.RO 50%

MARS Policy: Multimodality Only When It Matters

MARS策略:仅在必要时使用多模态

Jindou Jia, Tuo An, Yuxuan Hu, Gen Li, Jingliang Li, Bohan Hou, Xiangyu Chen, Jiaqi Bai, Bofan Lyu, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(MARS实验室,南洋理工大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出MARS策略,通过自适应地在需要时引入随机性,在单模态阶段使用确定性学习,平衡生成策略的多模态能力与确定性模型的高效率,在模拟和真实任务中提升成功率和推理速度。

Comments 13 figures, 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28226 2026-05-28 cs.LG 50%

PhAME: Phenotype-Aware Molecular Editing via Latent Diffusion

PhAME: 基于表型感知的潜在扩散分子编辑

Łukasz Janisiów, Sebastian Musiał, Bartosz Zieliński, Dawid Rymarczyk, Tomasz Danel

机构 * Faculty of Mathematics and Computer Science, Jagiellonian University(杰洛内夫斯基大学数学与计算机科学学院) Doctoral School of Exact and Natural Sciences, Jagiellonian University(杰洛内夫斯基大学精确与自然科学博士学院) Jagiellonian Center for Artificial Intelligence, Jagiellonian University(杰洛内夫斯基人工智能中心) Faculty of Chemistry, Jagiellonian University(杰洛内夫斯基大学化学系) Ardigen SA(Ardigen公司)

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出PhAME框架,利用潜在扩散模型在预训练图VAE的潜在空间中进行分子编辑,通过组合无分类器引导机制同时优化表型条件和结构相似性,实现高化学有效性和新颖性的多目标分子优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13177 2026-05-28 cs.RO 50%

ROOM: A Physics-Based Continuum Robot Simulator for Photorealistic Medical Datasets Generation

ROOM: 基于物理的连续体机器人模拟器,用于生成逼真的医学数据集

Salvatore Esposito, Matías Mattamala, Daniel Rebain, Francis Xiatian Zhang, Kevin Dhaliwal, Mohsen Khadem, Subramanian Ramamoorthy

机构 * University of Edinburgh, UK(爱丁堡大学,英国) University of British Columbia, Canada(不列颠哥伦比亚大学,加拿大)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 提出ROOM模拟框架,利用患者CT扫描生成多模态支气管镜训练数据,验证其在姿态估计和深度估计任务中的有效性。

Journal ref International Conference on Robotics and Automation 2026

详情

展开后加载摘要…

URL PDF HTML 收藏