RoboDreamer: Learning Compositional World Models for Robot Imagination
专题命中 具身推理 :world model(title,abstract);robotic(abstract);分类 cs.RO
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
专题命中 具身推理 :world model(title,abstract);robotic(abstract);分类 cs.RO
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV
Comments ICLR 2024. Explore videos, models, data, code, and more at https://tdmpc2.com
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV
Comments Position paper. Accompanying NeurIPS2023 Tutorial: https://sites.google.com/view/neurips2023law/home
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV
Comments CoRL 2023 Oral; Project website: https://yunhaifeng.com/FOWM
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.LG
Comments Published in the 40th International Conference on Machine Learning
专题命中 具身推理 :robotic(title,abstract);robotics(abstract);分类 cs.RO
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.CV
专题命中 具身推理 :robotics(title,abstract);robotic(abstract);分类 cs.RO
专题命中 具身推理 :robotic(title,abstract);manipulation(abstract);分类 cs.RO
Comments Presented at IROS 2021. Video is at https://youtu.be/FuqMxuODGlw
专题命中 具身推理 :robotic(title,abstract);robotics(abstract);分类 cs.AI
Comments Accepted for IJCAI
专题命中 具身推理 :robotic(title,abstract);robotics(abstract);分类 cs.RO
Comments Manuscript currently under review
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.AI
Comments NeurIPS Workshop on Emergent Communication
更好的槽,更好的世界:以对象为中心的世界模型中的表示质量与鲁棒性
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 该研究通过受控实验分析以对象为中心的世界模型,发现槽质量与规划成功率正相关,槽绑定良好时可减少辅助输入,且在分布偏移下其鲁棒性优于LeWM,预训练特征是鲁棒性关键因素。
Comments Published at Model-Based RL in the Era of Generative World Models Workshop at RLC 2026
基于JEPA世界模型的价值引导动作规划
机构 * École Polytechnique(巴黎高等理工学院) ; ENS Paris(巴黎高等师范学院) ; New York University(纽约大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出了一种基于JEPA世界模型的价值引导动作规划方法,通过塑造表示空间提升规划性能。
Comments Presented as a poster at the World Modeling Workshop 2026, Mila
专题命中 具身推理 :world model(title,abstract);embodied AI(abstract,comments)
Comments Accepted at NeurIPS 2025 Workshop on Space in Vision, Language, and Embodied AI
你所需要的只是能量引导吗?用于驱动世界模型的无训练规范注入
机构 * Institute of Automotive Technology, Technical University of Munich(慕尼黑工业大学汽车技术研究所)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV;robotics(comments)
AI总结 研究基于大型视频扩散主干的驾驶世界模型难以控制的问题,提出通过可微能量函数在采样时操控规划轨迹,无需重新训练主干,以Open-Sora 2.0 MM-DiT主干模型为例验证,指出跨流耦合是端到端可控关键。
Comments Accepted to Robotics: Science and Systems 2026 Robot World Models Workshop
SNOW:基于世界知识的时空场景理解用于开放世界具身推理
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; Esslingen University of Applied Sciences(埃斯林根应用科学大学) ; Dr. Ing. h.c. F. Porsche AG(德意志联邦汽车工业联合会) ; University of Michigan(密歇根大学) ; Voxel51 Inc.(Voxel51公司)
专题命中 具身推理 :robotics(abstract);navigation(abstract);world model(abstract);robotic(abstract)
AI总结 SNOW通过整合视觉语言模型与点云几何,实现统一的4D场景理解,提升开放世界具身推理的性能。
基于互联网规模知识的自监督行动预测具身推理
机构 * Stanford(斯坦福大学) ; UC Berkeley(加州大学伯克利分校) ; NVIDIA(英伟达)
专题命中 具身推理 :manipulation(abstract,abstract_cn);navigation(abstract);分类 cs.RO、cs.AI、cs.CV;robotics(comments)
AI总结 本文提出R&B-EnCoRe方法,通过自监督细化使模型从互联网知识中自推导具身推理策略,提升动作执行和导航性能,减少碰撞率。
Comments Robotics: Science and Systems (RSS) 2026
划分支撑集,重建残差:用于视频生成和世界模型的无训练稀疏注意力
机构 * Texas A&M University(德克萨斯农工大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 本文提出SparsePR算法,结合响应耦合划分与探针拟合残差重建,在四个视频生成和世界模型上实现注意力重建误差降低,22.0%-26.0%执行对密度下保持生成质量,获1.48-2.61倍端到端加速。
Comments 22 pages, 5 figures. Project page: https://pardistaghavi.github.io/SparsePR-website/
支持种群规模扩展的多智能体世界建模
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 针对多智能体世界模型的种群可扩展性问题,提出无需重训练即可扩展至任意智能体数量的Khora模型,通过解耦世界状态演化与渲染实现跨视图一致性,验证了泛化性并构建了实时交互系统。
Comments Technical report. Project page: https://rhos.ai/research/khora. Online demo: https://ophilus.ai/khora
被动对象状态世界模型中运动学、接触和物体恒存场的事件条件诊断
机构 * College of Intelligent Robitcs and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 提出一种诊断协议,测试被动对象状态世界模型中的隐式物理场是否按事件类型组织,并验证场对齐表示对预测的功能影响。
TaskSense:聚焦世界模型中的关键内容
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 TaskSense是一种以任务为中心的世界建模框架,通过可微随机空间注意力机制结合辅助逆动力学目标,提升了视觉控制模型对干扰环境的鲁棒性,在Distracting Control Suite上性能优于DreamerV3。
世界建模,何去何从?
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本研究提出以智能体为中心的交互式世界代理,将世界建模范式从物理状态转换转向智能体可用信息转换,划分六种代理类型与三个赋能层面,为构建赋能智能体的世界代理建立路线图。
Comments Technical Blog at https://worldbench.github.io/awesome-agentic-world-model GitHub Repo at https://github.com/worldbench/awesome-agentic-world-model
ShadowDancer:通过从视频及其阴影中学习统一动力学表示,赋予视频世界模型任意动作控制能力
机构 * Alaya Lab(Alaya实验室) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 ShadowDancer通过阴影对与跨阴影预测学习统一动力学表示,实现视频世界模型的任意动作帧级控制,在多动力学族上的动作迁移与长回放性能优于基线,平均盲胜率达86%。
Comments https://ShadowDancer-1.github.io
心理世界建模
专题命中 具身推理 :world model(title,abstract)
AI总结 该研究提出将心理变量作为核心组件的MWM框架,实例化为MENTIS基线,实验证明显式建模心理状态对预测人类决策至关重要,推动世界建模从物理场景模拟转向心智模拟。
Comments project website: https://mental-world.github.io/
物理空间中相邻集的动作优于世界模型中的最佳预测
机构 * Tongji University(同济大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 研究基于采样和潜在世界模型的控制器存在的条件失败提议过度生成问题,提出相邻集动作重建(ASAR)方法,在携带和释放评估集上,相比匹配选择提高了事件完成成功率,还刻画了选择风险。
Comments 26 pages, 7 figures. Includes supplementary material
深度正则化JEPA世界模型从真实户外机器人数据中学习更多可转移表示
机构 * Aigen(爱igen)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 研究针对从真实户外机器人数据学习世界模型的挑战,引入深度作为训练几何先验,结合SIGReg等方法,训练18M参数模型,实验表明该方法在降低视觉里程计误差、增加意外分数分离及提高多步展开保真度等方面有显著提升,增强了模型泛化能力。
Comments 13 pages, 3 figures
基于表示自编码器的多智能体交互世界模型
机构 * Epic Games ; École nationale des ponts et chaussées(法国国家桥梁与道路学院)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 针对复杂物理交互的高动态环境,该研究提出首个多智能体世界模型,以多智能体动作流为条件训练隐扩散模型,可实时生成稳定长时四智能体对局,开源相关资源。
Comments Technical report
通过电磁世界模型实现超表面的具身智能
专题命中 具身推理 :world model(title,abstract);manipulation(abstract)
AI总结 提出超表面具身智能通过世界模型(metaEI-WM)范式,集成语义环境建模与电动力学先验,理解电磁动力学,优化编码配置塑造电磁环境,实现复杂场景中多种无线任务自动化。
Comments 85 pages, 15 figures
DynaVieW:用于理解分层视觉动态的模式引导世界建模
机构 * EPFL, Switzerland(瑞士联邦理工学院) ; Harvard University(哈佛大学) ; Sony Group Corporation(索尼集团) ; ETH Zurich, Switzerland(瑞士苏黎世联邦理工学院)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 针对多模态语言模型难以系统建模视频视觉场景时间演变的问题,提出DynaVieW模型,通过学习交错状态转换序列理解视觉动态,在多架构下联合建模,提升下游视觉叙事创作等任务表现。
Comments ICML 2026