Physically Embodied Gaussian Splatting: A Realtime Correctable World Model for Robotics
专题命中 具身推理 :robotics(title);world model(title);分类 cs.RO
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
专题命中 具身推理 :robotics(title);world model(title);分类 cs.RO
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.RO;robotics(comments)
Comments IROS 2023 workshop World Models and Predictive Coding in Cognitive Robotics and IROS 2023 workshop Learning Robot Super Autonomy
WorldPack:用于长上下文视频世界建模的动态帧压缩
机构 * The University of Tokyo(东京大学) ; Google DeepMind(谷歌DeepMind)
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.CV、cs.LG
AI总结 研究针对长上下文视频世界建模中时空一致生成的挑战,提出WorldPack视频世界模型,通过轨迹打包和几何选择机制,基于3D空间相关性动态分配压缩率,扩展有效上下文,在相关数据集上优于基线,提升空间推理任务表现。
Comments Published in TMLR (09/2026)
Orbit-Planner:面向卫星智能体在轨避障的潜世界模型
机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) ; School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.RO、cs.AI
AI总结 该研究针对卫星在轨避障问题,提出两阶段潜世界模型Orbit-Planner,结合动作条件动力学与物理探测器,在Isaac Sim闭环避障任务中获91.7%成功率,提升了动态场景适应性。
Comments 4 pages, 6 figures. Accepted to AP-GARSS 2026. Project page: https://zhijianli2003.github.io/Orbit_Planner/
因果世界模型的统一视角:从观测到表征再到结构
机构 * Imperial College London(帝国理工学院)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV
AI总结 本文从因果视角研究不同抽象层级的世界模型,提出因果世界模型的形式定义,关联相关领域工作并阐明其组件可从数据恢复的条件,为世界模型奠定支持因果推理与决策的基础。
从经济智能体到智能体经济:经济世界模型的系统蓝图
机构 * Shenzhen Loop Area Institute(深圳河套学院) ; School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) ; University of Hong Kong(香港大学) ; Nanyang Technological University(南洋理工大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出经济世界模型(EWM)的六级能力阶梯实施蓝图,旨在加速可作为人类决策沙箱与AI智能体基础的下一代高保真经济模拟环境开发。
Comments Project page: https://github.com/FreedomIntelligence/Awesome-Economic-World-Models
Auto-JEPA:面向端到端自动驾驶的连续意图隐式世界模型
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.RO、cs.AI
AI总结 Auto-JEPA是面向端到端自动驾驶的连续意图隐式世界模型,通过联合嵌入预测学习未来驾驶意图,无需密集未来世界建模,在NAVSIM数据集上取得优异规划性能,可聚焦规划相关视觉特征。
KineBench:通过无逆动力学模型的运动学基础对具身世界模型进行基准测试
机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院) ; National University of Singapore(新加坡国立大学) ; Fudan University(复旦大学) ; Tsinghua University(清华大学) ; Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院)
专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.RO、cs.CV
AI总结 研究旨在评估具身世界模型物理一致性,提出无逆动力学模型的KineBench基准测试。利用级联视觉基础模型提取姿态,在物理模拟器中闭环验证,纳入运动学指标,基于ManiSkill3的任务评估EWMs,揭示任务复杂度受限的非线性缩放,为数据缩放策略提供指导。
Comments Accept to ECCV2026
具有反事实可控性的自主视频生成用于自进化世界模型
机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)
专题命中 具身推理 :world model(title,abstract);embodied agent(abstract);分类 cs.CV、cs.LG
AI总结 本文提出反事实可控性是自进化世界模型的关键,通过自主视频生成实现可控性,使模型能测试动作后果并反馈改进生成。
Comments 10 pages, 1 figure
GATS:用于高效智能体规划的具有分层世界模型的图增强树搜索
机构 * Institute for Cybernetics of NAS of Ukraine(乌克兰国家科学院控制论研究所)
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.AI、cs.LG
AI总结 研究针对LLM智能体规划计算成本高和行为随机的问题,提出GATS框架,结合系统树搜索与分层世界模型,在合成任务和综合测试中表现优异,规划时无需LLM调用,生成确定性计划,优于LLM引导探索。
无需语言监督的物理交互中世界模型中的涌现语义表征
机构 * Independent Researcher(独立研究者)
专题命中 具身推理 :world model(title,abstract);embodied agent(abstract);分类 cs.AI、cs.LG
AI总结 通过无语言监督的物理探索训练VAE世界模型,发现其潜在空间自发形成与物理几何结构对齐的语义结构,且预测性能与语义对齐共同提升,验证了物理几何作为世界模型表征的组织原则。
Comments 10 pages, 3 figures
RetailSMV:零售场景中基础视频世界模型的外视角与内视角适应
机构 * DreamVu
专题命中 具身推理 :world model(title,abstract);embodied agent(abstract);分类 cs.AI、cs.CV
AI总结 研究零售场景下基础视频世界模型的外视角与内视角适应,发现仅用外视角数据训练的模型在多项指标上优于或等同于联合训练。
X-Mind: 通过预测世界模型实现高效视觉思维链的端到端驾驶
机构 * XPeng Inc.(小鹏汽车)
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.AI、cs.CV
AI总结 提出X-Mind框架,将预测世界模型内化为视觉思维链,通过紧凑的草图表示和循环块扩散方案,实现高效、低延迟的端到端驾驶策略。
FlowMo-WM:具有物体动量和隐藏环境漂移的世界模型
机构 * Dartmouth College(达特茅斯学院) ; Clemson University(克莱姆森大学) ; University of Houston(休斯顿大学)
专题命中 具身推理 :world model(title,abstract);robot learning(abstract);分类 cs.RO、cs.LG
AI总结 提出FlowMo-WM,一种端到端可训练的视觉世界模型,通过分解图像-动作历史为短历史潜在状态和长历史上下文,分别建模物体运动和环境漂移,提升水下机器人等场景的长程预测精度。
什么使视频世界模型潜在空间与动作相关:预测优于重建
机构 * Graduate School of Data Science, Seoul National University(首尔大学数据科学研究生院)
专题命中 具身推理 :world model(title,abstract);robotic(abstract);分类 cs.AI、cs.CV
AI总结 通过统一探针评估,发现动作相关结构主要由时间视频预训练驱动,而非像素重建保真度,其中视频预训练自监督编码器在视觉保真度和动作预测间取得最佳帕累托权衡。
MetaWorld: 从单视角视频数据扩展多智能体视频世界模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学)
专题命中 具身推理 :world model(title,abstract);embodied AI(abstract);分类 cs.AI、cs.CV
AI总结 提出MetaWorld框架,通过单目世界状态展开、主体感知世界生成器和世界状态对齐机制,从单视角视频构建多智能体视频世界模型,解决数据稀缺和世界状态对齐问题。
何时想象以及想象多少:基于世界模型的自适应测试时缩放用于视觉空间推理
机构 * University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) ; Nanyang Technological University(南洋理工大学)
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.AI、cs.CV
AI总结 本文提出自适应测试时框架AVIC/AVIC-R,通过世界模型选择性调用和缩放视觉想象,在空间推理中平衡准确性与效率,超越GPT-4o等基线。
Comments the first two authors are equally contributed. Project page: https://adaptive-visual-tts.github.io/
超越欧几里得距离:通过地平线匹配轨迹可达性度量修复潜在世界模型
机构 * Tongji University(同济大学)
专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.RO、cs.LG
AI总结 本文提出轨迹可达性度量(TRM)作为固定潜在世界模型的后处理终端排名方法,通过训练小的成对头部来改进终端排名,从而提高连续操控任务的性能。
Comments 26 pages, 7 figures
在符号世界模型上学习双层策略以实现长周期规划
机构 * Vector Institute(向量研究所) ; University of Toronto(多伦多大学) ; LAAS-CNRS(Laas--cnrs) ; University of Toulouse(图卢兹大学) ; RWTH Aachen University(亚琛工业大学)
专题命中 具身推理 :world model(title);embodied AI(abstract);manipulation(abstract);分类 cs.RO、cs.AI
AI总结 本文提出了一种结合低层模仿学习和高层符号抽象的双层策略,用于解决长周期规划问题,通过BISON系统在扩展的MetaWorld基准上验证了其在处理大量物体和长周期任务上的优越性。
记忆专家的组合用于扩散世界模型
机构 * Computer Vision Group(计算机视觉组) ; Department of Computer Science(计算机科学系) ; University of Bern(伯恩大学)
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种基于扩散的世界模型框架,通过组合专门化的记忆专家来解决记忆与效率之间的权衡问题,提升了时间一致性、过去观察的回忆和导航性能。
Journal ref Proceedings of the Fourteenth International Conference on Learning Representations (ICLR), 2026
OrbiSim:作为具身智能的可微物理引擎的世界模型
机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science(人工智能摩尔电子实验室、人工智能学院、计算机科学学院)
专题命中 具身推理 :world model(title,abstract);robotic(abstract);分类 cs.RO、cs.LG
AI总结 OrbiSim提出了一种新的机器人仿真范式,将世界模型重新定义为完全可微的物理引擎,通过统一的物理基础路径连接结构化场景资产、神经动力学和下游强化学习,提升预测精度和控制性能。
Comments Project page: https://jjleejj85.github.io/projects/orbisim
PanoWorld:几何一致的全景视频世界建模
机构 * Northeastern University(东北大学)
专题命中 具身推理 :world model(title,abstract);embodied AI(abstract);分类 cs.AI、cs.CV
AI总结 PanoWorld通过几何和动态一致性建模生成一致的360度视频,提升了空间理解能力,适用于具身AI应用。
LoopNav:世界模型中空间一致性评估的基准测试
机构 * NUS(国立新加坡大学) ; Peking Univeristy(北京大学)
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.AI、cs.CV
AI总结 LoopNav提出一个基于循环导航的基准测试,用于评估世界模型的空间一致性,通过Minecraft开放世界环境收集250小时视频数据,并引入场景图一致性评分以量化空间一致性。
Comments V3: SGCS
OOWM: 通过面向对象的程序化世界建模结构化具身推理与规划
机构 * Sun Yat-sen University(中山大学) ; Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室) ; X-Era AI Lab(X-Era AI实验室)
专题命中 具身推理 :world model(title,abstract);robotic(abstract);分类 cs.AI、cs.LG
AI总结 OOWM通过软件工程形式化方法构建具身推理框架,利用UML类图和活动图实现环境状态与控制策略的显式建模,结合监督微调与分组相对策略优化提升规划效果。
面向多视角轨迹视频的高一致性具身世界模型
机构 * Midea Group(美的集团) ; Tongji University(同济大学) ; East China Normal University(华东师范大学)
专题命中 具身推理 :world model(title,abstract);robotic(abstract);分类 cs.RO、cs.AI
AI总结 本文提出MTV-World模型,通过多视角轨迹视频控制实现精准的视觉-运动预测,解决低层次动作与真实物理交互不一致的问题,实验表明其在复杂双臂场景中表现优异。
Comments 12 pages, 5 figures
arg-VU:结合物理感知的3D几何进行视觉理解的意图推理
机构 * University of Tennessee, Knoxville(田纳西大学诺克斯维尔分校) ; Stanford University(斯坦福大学)
专题命中 具身推理 :robotic(title,abstract);robotics(abstract);分类 cs.RO、cs.CV
AI总结 arg-VU通过整合时间一致的几何跟踪与约束诱导的机械建模,提升手术场景中变形组织的意图推理能力,实现更稳定和物理一致的预测。
EVA:通过逆动力学奖励对齐视频世界模型与可执行机器人动作
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; DexForce Technology Co., Ltd.(DexForce技术有限公司)
专题命中 具身推理 :world model(title,abstract);robotics(abstract);分类 cs.RO、cs.AI
AI总结 本文提出EVA框架,通过逆动力学奖励对齐视频世界模型与可执行动作,减少生成动作中的体感约束违规,提升下游任务执行成功率。
Comments Project page: https://eva-project-page.github.io/
U4D:从LiDAR序列中构建不确定性感知的4D世界模型
机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; National University of Singapore(新加坡国立大学) ; Fudan University(复旦大学) ; S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; Nanjing University of Posts and Telecommunications(南京邮电大学) ; SKL-TI
专题命中 具身推理 :world model(title,abstract);embodied AI(abstract);分类 cs.RO、cs.CV
AI总结 本文提出U4D框架,通过估计空间不确定性图和分阶段生成方法,提升LiDAR序列的几何精度和时间一致性,推动自动驾驶感知与模拟的可靠性。
Comments CVPR 2026; 20 pages, 7 figures, 11 tables; Code at https://github.com/worldbench/U4D
MWM: 移动世界模型用于动作条件一致预测
机构 * School of Computer Science, Peking University(北京大学计算机科学系)
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.RO、cs.CV
AI总结 MWM提出了一种移动世界模型,通过两阶段训练框架和推理一致状态蒸馏提升动作条件一致性的图像目标导航性能。
上下文与多样性至关重要:世界模型中情境学习的出现
机构 * Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人社会研究院) ; University of Science and Technology of China(中国科学技术大学) ; Anhui Province Key Laboratory of Intelligent Low-Carbon Information Technology and Equipment(安徽省智能低碳信息技术与设备重点实验室)
专题命中 具身推理 :world model(title,abstract);embodied AI(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了世界模型中情境学习的机制,揭示了环境识别和学习的核心作用,并探讨了长上下文和多样化环境对学习效果的影响。
Journal ref 2026 International Conference on Learning Representations (ICLR)