arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-06-04 至 2026-06-04 共收录 38 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 19 篇

2606.04534 2026-06-04 cs.RO 94%

MAD: Mapping-Aware World Models for Agile Quadrotor Flight

MAD: 面向敏捷四旋翼飞行的地图感知世界模型

Xinhong Zhang, Runqing Wang, Yunfan Ren, Ding Yu, Boyu Zhou, Jian Sun, Fang Deng, Jie Chen, Gang Wang

机构 * State Key Lab of Autonomous Intelligent Unmanned Systems, Beijing Institute of Technology, Beijing 100081, China(自主智能无人系统国家重点实验室,北京理工大学,北京100081,中国) Zhongguancun Academy, Beijing 100094, China(中关村学院,北京100094,中国) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Department of Mechanical and Energy Engineering, Southern University of Science and Technology(南方科技大学机械与能源工程系) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 提出地图感知世界模型MAD,通过重构机器人中心占用和可见性网格地图学习几何感知的潜在动力学,在视觉导航和竞速任务中实现更高成功率、更快飞行速度和更好跨任务迁移。

Comments 12 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03482 2026-06-04 cs.CV cs.AI cs.LG 94%

Beyond Pixel Histories: World Models with Persistent 3D State

超越像素历史:具有持久3D状态的世界模型

Samuel Garcin, Thomas Walker, Steven McDonagh, Tim Pearce, Hakan Bilen, Tianyu He, Kaixin Wang, Jiang Bian

机构 * University of Edinburgh(爱丁堡大学) Microsoft Research(微软研究院)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 提出PERSIST范式,通过模拟潜在3D场景(环境、相机、渲染器)的演化,实现具有持久空间记忆和一致几何的世界模型,显著提升3D一致性、空间记忆和长期稳定性。

Comments Accepted to the International Conference on Machine Learning (ICML) 2026. To appear in the Proceedings of Machine Learning Research (PMLR). 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05015 2026-06-04 cs.RO 93%

Generalization of World Models under Environmental Variability for Vision-based Quadrotor Navigation

环境变异性下基于视觉的四旋翼导航的世界模型泛化

Luca Zanatta, Grzegorz Malczyk, Kostas Alexis

机构 * Norwegian University of Science and Technology(挪威科学与技术大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 通过基于视觉的四旋翼导航测试,研究世界模型在不同环境随机性下的鲁棒性,发现自监督预训练阶段的泛化能力是模拟到现实迁移的强预测因子,并识别出离散潜在大小和训练序列长度是关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04130 2026-06-04 cs.RO 92%

CLAW: Learning Continuous Latent Action World Models via Adversarial Latent Regularization

CLAW: 通过对抗潜在正则化学习连续潜在动作世界模型

Tewodros Ayalew, Matthew Jeung, Samuel Wheeler, Xiao Zhang, Andre de la Cruz Arce, Kaylene Stocking, Michael Maire, Matthew R. Walter

机构 * University of Chicago(芝加哥大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Argonne National Laboratory(阿贡国家实验室)

专题命中 通用世界模型 :world model(title,abstract);world models(title);world model(title,abstract);world models(title)

AI总结 提出CLAW框架,利用对抗潜在正则化和扩散视频生成,从无动作视频中端到端学习世界模型与连续潜在动作表示,支持观察模仿学习和目标导向规划。

Comments 8 pages, 15 pages of supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06006 2026-06-04 cs.CV cs.AI cs.CL 91%

Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics

视觉语言模型能预测未来状态吗?从逆动力学引导世界模型

Yifu Qiu, Yftah Ziser, Anna Korhonen, Shay B. Cohen, Edoardo M. Ponti

机构 * Institute for Language, Cognition and Computation, University of Edinburgh(语言、认知与计算研究所,爱丁堡大学) Language Technology Lab, University of Cambridge(语言技术实验室,剑桥大学) NVIDIA(NVIDIA公司) University of Groningen(格罗宁根大学)

专题命中 通用世界模型 :world model(title);world models(title);world model(title);world models(title)

AI总结 本文发现视觉语言模型(VLM)难以直接进行前向动力学预测(FDP),但逆动力学预测(IDP)更容易学习,并利用IDP通过弱监督学习和推理时验证两种策略引导FDP,在Aurora-Bench上取得与最先进图像编辑模型竞争的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02697 2026-06-04 cs.CV cs.AI 88%

ShareVerse: Multi-Agent Consistent Video Generation for Shared World Modeling

ShareVerse:面向共享世界建模的多智能体一致视频生成

Jiayi Zhu, Jianing Zhang, Yiying Yang, Wei Cheng, Xiaoyun Yuan

机构 * Shanghai Jiao Tong University China(上海交通大学中国) Fudan University China(复旦大学中国) StepFun China(StepFun中国)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.CV

AI总结 提出ShareVerse框架,通过构建多智能体交互数据集、空间拼接策略和跨智能体注意力机制,实现多智能体共享世界的一致视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
1610.05984 2026-06-04 cs.NE cs.AI cs.LG cs.SY eess.SY 82%

Particle Swarm Optimization for Generating Interpretable Fuzzy Reinforcement Learning Policies

粒子群优化用于生成可解释的模糊强化学习策略

Daniel Hein, Alexander Hentschel, Thomas Runkler, Steffen Udluft

机构 * Siemens AG, Corporate Technology(西门子公司企业技术部)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本文提出一种基于模糊粒子群强化学习(FPSRL)的方法,通过训练参数在模拟真实系统动态的世界模型上生成可解释的模糊强化学习策略,适用于无法进行在线学习的领域。

Journal ref Engineering Applications of Artificial Intelligence, Volume 65C, October 2017, Pages 87-98

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04264 2026-06-04 cs.CV 81%

UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation

UniCanvas: 一种基于扩散的图文联合生成统一模型

Zeyuan Yang, Hao-Wei Chen, Xueyang Yu, Yuncong Yang, Haoyu Zhen, Ziqiao Ma, Maohao Shen, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) University of Michigan(密歇根大学) MIT(麻省理工学院)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 提出UniCanvas,通过扩散模型在像素画布上以文本嵌入图像的方式实现图文联合生成,解决现有模型在视觉与文本生成上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17262 2026-06-04 hep-th gr-qc 80%

Kalb-Ramond Topological Term in Majorana Superspace and Kaluza-Klein Spectrum Deformation in Five Dimensions

Majorana超空间中的Kalb-Ramond拓扑项与五维Kaluza-Klein谱变形

L. A. S. Nunes, C. A. S. Almeida

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 在五维N=1超空间中构造Kalb-Ramond拓扑项的超对称完备,揭示伪超对称构造的缺失项,并证明新玻色子项导致KK谱变形,影响Randall-Sundrum膜世界模型中的挠率现象。

Comments 21 pages. v2: added appendix; minor clarifications and corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.01141 2026-06-04 eess.SY cs.SY math.OC 72%

Retrofit Control with Approximate Environment Modeling

基于近似环境建模的改造控制

Takayuki Ishizaki, Takahiro Kawaguchi, Hampei Sasahara, Jun-ichi Imura

专题命中 通用世界模型 :environment model(title,abstract)

AI总结 本文提出了一种基于近似环境建模的改造控制方法,该方法通过调整近似环境建模的精度来调节控制性能,确保系统稳定性在原有系统稳定的情况下鲁棒性。

Journal ref Automatica, 107, pp.442-453, 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04634 2026-06-04 cs.LG 69%

Explainably Safe Reinforcement Learning

可解释的安全强化学习

Sabine Rieder, Stefan Pranger, Debraj Chakraborty, Jan Křetínský, Bettina Könighofer

机构 * Masaryk University(马萨里克大学) Graz University of Technology(格拉茨技术大学) Technical University of Munich(慕尼黑技术大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG

AI总结 提出一种基于分层决策树的可解释安全强化学习方法,通过世界模型分析状态风险并构建屏蔽策略,生成可理解的解释,同时保持安全保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04291 2026-06-04 cs.CV 69%

A Cookbook of 3D Vision: Data, Learning Paradigms, and Application

3D视觉食谱:数据、学习范式与应用

Hongyang Du, Zongxia Li, Dawei Liu, Runhao Li, Haoyuan Song, Qingyu Zhang, Yubo Wang, Jingcheng Ni, Shihang Gui, Congchao Dong, Tao Hu

机构 * Brown University(布朗大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学) New York University(纽约大学) The University of Sydney(悉尼大学) Stability AI

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 本文提出一种以数据为中心的3D视觉分类法,通过分析点云、网格、体素和3D高斯等几何表示及其获取流程,以及数据集设计、基准构建和监督机制,统一了表示、学习范式与下游任务(重建、生成、视频建模)之间的关系。

Comments Accepted to the CVPR 2026 OpenSUN3D Workshop. Official version available at CVF Open Access. https://openaccess.thecvf.com/content/CVPR2026W/OpenSUN3D/html/Du_A_Cookbook_of_3D_Vision_Data_Learning_Paradigms_and_Application_CVPRW_2026_paper.html

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23420 2026-06-04 cs.AI 69%

Bilevel Autoresearch: Meta-Autoresearching Itself

双层自动研究:元自动研究自身

Yaonan Qu, Meng Lu

机构 * Independent Researcher(独立研究者)

专题命中 通用世界模型 :world-model(abstract);world-model(abstract);分类 cs.AI

AI总结 提出双层自动研究框架,外层循环通过读取内层循环代码和轨迹、识别瓶颈并注入可执行Python搜索机制来改进内层循环,在GPT预训练基准上实现5倍改进。

Comments 16 pages, 5 figures, 3 tables. v2 expands the framing as mechanism-level agentic self-improvement and updates related work and limitations; core method and experiments unchanged. This paper was primarily drafted by AI agents with human oversight and direction

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.08280 2026-06-04 cs.RO cs.SY eess.SY 69%

Extrinisic Calibration of a Camera-Arm System Through Rotation Identification

通过旋转识别进行相机-机械臂系统的外校准

Steve McGuire, Christoffer Heckman, Daniel Szafir, Simon Julier, Nisar Ahmed

机构 * Department of Aerospace Engineering Sciences, University of Colorado at Boulder(科罗拉多大学波尔德分校航空航天工程科学系)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 本文提出了一种基于观察臂的结构运动来恢复外校准参数的方法,结合已知的机械臂运动学和图像平面中的二次曲线观测,通过最大似然估计计算校准外参数,该方法在仿真中得到验证并在现实模型中测试,结果与尺子估计一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
1502.02251 2026-06-04 stat.ML cs.LG cs.RO cs.SY eess.SY 60%

From Pixels to Torques: Policy Learning with Deep Dynamical Models

从像素到扭矩:基于深度动态模型的策略学习

Niklas Wahlström, Thomas B. Schön, Marc Peter Deisenroth

专题命中 通用世界模型 :model-based reinforcement learning(abstract);分类 cs.LG、cs.RO;predictive model(abstract)

AI总结 本文提出一种高效的数据驱动强化学习算法,通过深度动态模型直接从像素信息学习闭环控制策略,解决高维观测下的连续状态-动作空间数据高效学习问题。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04453 2026-06-04 cs.CV cs.LG 50%

Radiomic Feature Selection Using Gradient Loss of Deep Neural Network for Lung Cancer Stage Detection

基于深度神经网络梯度损失的放射组学特征选择用于肺癌分期检测

Hina Shakir, Mohammad Mohatram, Javeed Hussain, Syed Rizwan Ali, Muhammad Irfan Memon

机构 * Department of Software Engineering, Bahria University(巴尔ia大学软件工程系) Global College of Engineering and Technology(全球工程与技术学院) Software Engineering & Business Incubation Center, Bahria University(软件工程与企业孵化中心,巴尔ia大学)

专题命中 通用世界模型 :分类 cs.LG、cs.CV;predictive model(abstract);predictive models(abstract)

AI总结 提出GL-RFE框架,利用深度神经网络梯度敏感性分析递归消除低贡献特征,从106个放射组学特征中选出前15个用于肺癌早晚期分类,准确率达90.22%。

Journal ref J. Vis. Exp. (230), e70181, (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03351 2026-06-04 cs.LG cs.AI q-bio.QM 50%

epiGPTope: A machine learning-based epitope generator and classifier

epiGPTope: 一种基于机器学习的表位生成器和分类器

Natalia Flechas Manrique, Alberto Martínez, Elena López-Martínez, Luc Andrea, Román Orus, Aitor Manteca, Aitziber L. Cortajarena, Llorenç Espinosa-Portalés

机构 * Multiverse Computing(多维计算公司) Centre for Cooperative Research in Biomaterials (CIC biomaGUNE)(生物材料联合研究中心) Basque Research and Technology Alliance (BRTA)(巴斯克研究与技术联盟) Donostia International Physics Center(多斯蒂亚国际物理中心) Ikerbasque Foundation for Science(伊kerbasque科学基金会) IKERBASQUE(伊kerbasque)

专题命中 通用世界模型 :分类 cs.AI、cs.LG;predictive model(abstract);predictive models(abstract)

AI总结 提出基于大型语言模型epiGPTope,通过预训练和微调直接生成新型表位序列,并结合统计分类器预测表位来源(细菌或病毒),以加速合成表位库的构建和筛选。

Comments 11 pages, 4 figures. Supplementary Information with 5 pages, 4 figures

Journal ref ACS Synthetic Biology 2026 15 (2), 631-642

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.03435 2026-06-04 eess.SY cs.MA cs.SY 50%

Mean-field Games for Bio-inspired Collective Decision-making in Dynamical Networks

基于生物启发的动态网络中集体决策的均场博弈

Leonardo Stella, Dario Bauso

专题命中 通用世界模型 :environment model(abstract);分类 cs.MA

AI总结 本文研究了动态网络中集体决策问题,提出均场博弈模型结合宏观与微观动态,分析了蜂群、病毒传播和智能电网故障的均场模型,并通过数值分析探讨了网络攻击对频率的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
1609.05291 2026-06-04 physics.comp-ph cs.NA math.NA physics.plasm-ph 50%

A Unified Gas Kinetic Scheme for Multi-scale and Multi-component Plasma Transport

多尺度多组分等离子体输运的统一气体动力学方案

Chang Liu, Kun Xu

专题命中 通用世界模型 :environment model(abstract);simulation model(abstract)

AI总结 本文提出一种统一气体动力学方案,用于多尺度多组分等离子体输运模拟,通过直接建模方法结合Vlasov-BGK方程和Maxwell方程,实现不同尺度下的等离子体模拟,并验证了其在多种物理现象中的有效性。

Journal ref Communications in Computational Physics 22.5 (2017): 1175-1223

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身与机器人 4 篇

2602.12215 2026-06-04 cs.RO 80%

LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion

LDA-1B:通过通用具身数据摄取扩展潜动力学动作模型

Jiangran Lyu, Kai Liu, Xuheng Zhang, Haoran Liao, Yusen Feng, Wenxuan Zhu, Tingrui Shen, Jiayi Chen, Jiazhao Zhang, Yifei Dong, Wenbo Cui, Senmao Qi, Shuo Wang, Yixin Zheng, Mi Yan, Xuesong Shi, Haoran Li, Dongbin Zhao, Ming-Yu Liu, Zhizheng Zhang, Li Yi, Yizhou Wang, He Wang

机构 * Peking University(北京大学) Galbot CASIA(中国科学院自动化研究所) BAAI(北京人工智能研究院) Tsinghua University(清华大学) Sun Yat-sen University(中山大学) NVIDIA

专题命中 具身与机器人 :latent dynamics(title);world model(abstract);world model(abstract);分类 cs.RO

AI总结 提出LDA-1B机器人基础模型,通过统一格式的具身交互数据集EI-30k和结构化DINO潜空间中的动力学学习,联合建模动力学、策略和视觉预测,在接触丰富、灵巧和长时任务上分别提升高达21%、48%和23%。

Comments Accepted at RSS 2026, Project Page:https://pku-epic.github.io/LDA

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.10371 2026-06-04 cs.RO cs.LG cs.SY eess.SY 60%

Reinforcement learning for non-prehensile manipulation: Transfer from simulation to physical system

基于非操控操作的强化学习:从仿真到物理系统的迁移

Kendall Lowrey, Svetoslav Kolev, Jeremy Dao, Aravind Rajeswaran, Emanuel Todorov

机构 * University of Washington(华盛顿大学) Roboti LLC(Roboti公司)

专题命中 具身与机器人 :model-based reinforcement learning(abstract);分类 cs.LG、cs.RO;simulation model(abstract)

AI总结 本文提出了一种基于仿真的强化学习方法,用于非操控操作任务,通过在仿真环境中训练策略,成功迁移到物理系统中,且在模型集合训练下提升了策略的鲁棒性。

Comments Accepted at IEEE SIMPAR 2018. Project page: https://sites.google.com/view/phantomsim2real

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.02531 2026-06-04 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY 56%

Combining Optimal Control and Learning for Visual Navigation in Novel Environments

将最优控制与学习相结合用于新环境中的视觉导航

Somil Bansal, Varun Tolani, Saurabh Gupta, Jitendra Malik, Claire Tomlin

机构 * University of California, Berkeley(加州大学伯克利分校) Facebook AI Research(脸书人工智能研究)

专题命中 具身与机器人 :分类 cs.AI、cs.LG、cs.CV;dynamics model(abstract)

AI总结 本文提出了一种结合模型控制与学习感知的方法,用于在新环境中实现可靠的视觉导航,通过生成无碰撞路径的 waypoints,使机器人能够高效地到达目标位置,同时在低帧率和仿真到现实的迁移中表现良好。

Comments Project website: https://vtolani95.github.io/WayPtNav/

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.00113 2026-06-04 eess.SY cs.LG cs.RO cs.SY math.OC 56%

Learning Stabilizable Dynamical Systems via Control Contraction Metrics

通过控制收缩度量学习可稳定化的动态系统

Sumeet Singh, Vikas Sindhwani, Jean-Jacques E. Slotine, Marco Pavone

机构 * Dept. of Aeronautics and Astronautics, Stanford University(航空航天系,斯坦福大学) Google Brain Robotics, New York(谷歌大脑机器人,纽约) Dept. of Mechanical Engineering, Massachusetts Institute of Technology(机械工程系,麻省理工学院)

专题命中 具身与机器人 :model-based reinforcement learning(abstract);分类 cs.LG、cs.RO

AI总结 本文提出了一种新的框架,用于学习可稳定化的非线性动态系统,以实现机器人连续控制任务。核心方法是开发一种基于稳定性的控制理论正则化器,以确保学习到的系统可以配备一个稳健的控制器,能够稳定任何系统生成的开环轨迹。通过利用收缩理论、统计学习和凸优化工具,我们提供了一个通用且可操作的半监督算法来学习可稳定化的动态系统,可以应用于复杂的欠驱动系统。在模拟平面四旋翼系统上验证了所提算法,并观察到与传统回归技术学习的模型相比,使用控制理论正则化模型在轨迹生成和跟踪性能上有显著改进,尤其是在使用少量示范示例时。结果展示了将标准基于模型的强化学习算法与非线性控制理论概念结合的必要性,以提高可靠性。

Comments To appear at WAFR 2018. v2: re-structured Sections 3 & 4 to improve clarity; expanded discussion on limitations & future work in Section 5; added details on training & validation, significantly expanded experiments

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 自动驾驶 2 篇

2606.04775 2026-06-04 cs.LG cs.AI cs.CV cs.SY eess.SY math.OC 60%

Activation Steering of Video Generation Models via Reduced-Order Linear Optimal Control

通过降阶线性最优控制引导视频生成模型的激活

Jihoon Hong, Alice Chan, Qiyue Dai, Julian Skifstad, Glen Chou

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 自动驾驶 :latent dynamics(abstract);分类 cs.AI、cs.LG、cs.CV

AI总结 提出LA-LQR框架,将文本到视频推理建模为动态系统,通过降阶最优控制实现最小干预的激活引导,减少不安全内容生成同时保持视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.08871 2026-06-04 eess.SY cs.RO cs.SY 50%

Representing the Unknown - Impact of Uncertainty on the Interaction between Decision Making and Trajectory Generation

表示未知 - 不确定性对决策制定与轨迹生成交互的影响

Marcus Nolte, Susanne Ernst, Jan Richelmann, Markus Maurer

机构 * Institute of Control Engineering(控制工程研究所)

专题命中 自动驾驶 :environment model(abstract);分类 cs.RO

AI总结 本文探讨了不确定性对自动驾驶车辆运动规划问题参数和环境模型要求的影响,强调了决策制定与轨迹生成之间明确接口的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模型式强化学习 12 篇

1610.03518 2026-06-04 cs.RO cs.AI cs.LG cs.SY eess.SY 78%

Transfer from Simulation to Real World through Learning Deep Inverse Dynamics Model

通过学习深度逆动力学模型实现仿真到现实世界的迁移

Paul Christiano, Zain Shah, Igor Mordatch, Jonas Schneider, Trevor Blackwell, Joshua Tobin, Pieter Abbeel, Wojciech Zaremba

专题命中 模型式强化学习 :world model(abstract);dynamics model(title,abstract);world model(abstract);分类 cs.AI、cs.LG、cs.RO

AI总结 本文提出通过学习深度逆动力学模型,在仿真与现实世界之间实现控制策略的迁移,解决仿真与现实差异导致的性能下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12643 2026-06-04 cs.LG cs.AI stat.ML 76%

Unifying Model-Free Efficiency and Model-Based Representations via Latent Dynamics

通过潜在动力学统一无模型效率与基于模型的表示

Jashaswimalya Acharjee, Balaraman Ravindran

专题命中 模型式强化学习 :latent dynamics(title,abstract);分类 cs.AI、cs.LG

AI总结 提出统一潜在动力学算法,通过将状态-动作对嵌入到值函数近似线性的潜在空间,无需规划开销即可融合无模型效率与基于模型表示的优势,在80个环境中匹配或超越专门基线。

Comments Similarities found with a prior work. Hence, requesting for withdrawal until further notice

详情

展开后加载摘要…

URL PDF HTML 收藏
1702.08584 2026-06-04 eess.SY cs.SY math.OC 72%

Model-based reinforcement learning in differential graphical games

基于微分图游戏的模型引导强化学习

Rushikesh Kamalapurkar, Justin R. Klotz, Patrick Walters, Warren E. Dixon

专题命中 模型式强化学习 :model-based reinforcement learning(title,abstract)

AI总结 本文结合微分博弈理论与actor-critic-identifier架构,提出连续控制策略以实现多智能体系统编队跟踪,通过通信拓扑中的扩展邻居反馈设计近似最优控制器,仿真验证了该方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1506.00685 2026-06-04 eess.SY cs.SY math.OC 72%

Model-based reinforcement learning for infinite-horizon approximate optimal tracking

基于模型的强化学习用于无限 horizon 近似最优跟踪

Rushikesh Kamalapurkar, Lindsey Andrews, Patrick Walters, Warren E. Dixon

专题命中 模型式强化学习 :model-based reinforcement learning(title,abstract)

AI总结 本文提出了一种近似在线自适应解决方案,用于解决具有未知漂移动力学的连续时间非线性系统的无限 horizon 最优跟踪问题,通过基于模型的强化学习放松持续激励条件,并通过Lyapunov稳定性分析证明了策略收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1509.01186 2026-06-04 eess.SY cs.SY 72%

Model Based Reinforcement Learning with Final Time Horizon Optimization

基于最终时间 horizon 的模型驱动强化学习

Wei Sun, Evangelos Theodorou, Panagiotis Tsiotras

专题命中 模型式强化学习 :model based reinforcement learning(title,abstract)

AI总结 本文提出一种基于模型的强化学习与轨迹优化算法,通过最优控制理论和动态规划推导出反向微分方程,提供最优控制策略和时间 horizon。在低维线性问题中恢复理论最优解,并在非线性系统中验证应用效果。

Comments 9 pages, 5 figures, NIPS2015

详情

展开后加载摘要…

URL PDF HTML 收藏