Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation
专题命中 具身与机器人 :world model(abstract);world models(abstract);dynamics model(title,abstract);world model(abstract)
Comments Project page: https://nimolty.github.io/Seer/
视觉与机器人
面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。
专题命中 具身与机器人 :world model(abstract);world models(abstract);dynamics model(title,abstract);world model(abstract)
Comments Project page: https://nimolty.github.io/Seer/
迈向视觉语言导航的双脑最小充分表示
机构 * Hangzhou Dianzi University(杭州电子科技大学) ; University of Zurich(苏黎世大学) ; University of Exeter(埃克塞特大学)
专题命中 具身与机器人 :world model(abstract);world-model(abstract);world model(abstract);world-model(abstract)
AI总结 针对视觉语言导航中存在的问题,提出BrainNav框架,包含逻辑锚定模型等三个组件,通过将语义意图与空间感知对齐,提升智能体在复杂任务中的表现,在实验中相比之前最优方法有改进,为鲁棒的视觉语言导航提供有效基础。
世界动作模型:具身AI的下一个前沿
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; National University of Singapore(新加坡国立大学)
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 本文探讨了具身AI中的世界动作模型(WAMs),通过整合环境动态预测模型,统一预测状态建模与动作生成,提出结构化分类体系并分析数据生态,为该领域提供系统性综述。
ExoPredicator:为机器人规划学习动态世界的抽象模型
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 本文提出ExoPredicator框架,通过联合学习符号状态表示和因果过程,解决长周期具身规划中的外源性过程建模问题,实现对复杂任务的泛化能力。
Comments ICLR 2026. The last two authors contributed equally in co-advising
在Veo世界模拟器中评估Gemini机器人策略
机构 * Gemini Robotics Team(Gemini机器人团队) ; Google DeepMind(谷歌DeepMind)
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 本研究提出基于Veo视频模型的生成式评估系统,用于在Veo世界模拟器中全面评估Gemini机器人策略的性能,包括名义性能、分布外泛化及安全约束测试。
机构 * Georgia Tech(佐治亚理工学院) ; Georgia Tech Research Institute(佐治亚理工研究 institute)
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
Comments Accepted for publication at IEEE Robotics and Automation Letters (RAL). Code, models and dataset available at http://calvin.cs.uni-freiburg.de
USS: 面向具身视觉跟踪的统一空间-语义提示与潜在动力学学习
机构 * Nanyang Technological University(南洋理工大学)
专题命中 具身与机器人 :latent dynamics(title,abstract);world model(abstract);world model(abstract);分类 cs.CV
AI总结 提出统一空间-语义提示范式替代纯文本目标指示,设计端到端框架USS支持多种提示类型,通过潜在世界模型提升时序鲁棒性,在真实机器人实验中优于纯文本方法。
Surgical WAM:面向数据高效型手术机器人学习的世界-动作模型
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 本文提出Surgical WAM模型,通过无动作视频预训练结合带动作标注数据微调,在四项模拟手术操纵任务中将平均成功率从63.5%提至77.8%,为数据高效的手术机器人学习提供了可行方案。
生长-剪枝-冻结网络:用于嗅觉导航的自适应与持续学习技术
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 提出生长-剪枝-冻结(GPF)网络框架,通过动态调整策略网络层数实现持续学习,在湍流羽流导航任务中达到94%成功率,并推广到其他机器学习任务。
Comments Accepted as poster to the Reinforcement Learning in Big Worlds Workshop at the 2026 Reinforcement Learning Conference
用于无人机机器人和双手操作的视觉语言动作(VLA)模型综述
机构 * Chef Robotics ; RovifyLab ; IT Application Research Center, Jeonbuk Regional Branch ; Department of Electrical, Computer and Software Engineering(电气与计算机软件工程系)
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 综述2017 - 2026年183篇文献,围绕视觉语言动作模型在无人机机器人和双手操作方面的应用,涵盖多维度,表明双手VLA相关策略可转移至无人机系统,还确定了两领域的14个研究方向。
Comments 56 pages, 11 figures, 16 tables
DynaWM:用于移动物体操纵的基于基础VLA的世界基础模型
机构 * Department of Computer Science and Technology, THUAI, Tsinghua University, Beijing 100084, China(计算机科学与技术系,THUAI,清华大学,北京100084,中国)
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 针对移动物体操纵挑战,提出DynaWM模型,用多种编码器提取特征,联合条件流匹配DiT生成动作轨迹,构建数据集评估,相比其他模型有性能提升,消融实验验证各部分作用。
Comments 17 pages, 3 figures
从人类视频到机器人操作:基于人类中心数据的可扩展视觉-语言-动作学习综述
机构 * Tsinghua University(清华大学) ; HKUST(香港科技大学) ; Xi’an Jiaotong University(西安交通大学) ; Fudan University(复旦大学) ; Microsoft Research Asia(微软亚洲研究院) ; Peking University(北京大学) ; Microsoft Zurich Project(微软苏黎世实验室)
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 本文综述了如何将丰富的人类视频转化为视觉-语言-动作(VLA)模型的有效知识,分类了四种方法(潜在动作表示、预测世界模型、显式2D监督、显式3D重建),并指出了结构化非结构化视频、跨具身和视角的动作映射、以及评估协议设计三大挑战。
Comments Accepted to IJCAI 2026 Survey Track. Project page: https://aaronfengzy.github.io/HumanCentricToVLA-Survey/
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
Comments Accepted to NeurIPS 2024
EndoWAM:用于通用内窥镜导航的基于接地的世界-动作模型
专题命中 具身与机器人 :world model(abstract);video world model(abstract);world model(abstract);video world model(abstract)
AI总结 EndoWAM是首个用于通用机器人内窥镜导航的世界-动作模型,通过未来接地机制结合轻量型扩散Transformer与离散动作专家,在EndoMotion数据集上优于基线,具强零样本泛化能力。
BWM:面向机器人学习的低成本高保真世界模拟器
专题命中 具身与机器人 :world model(abstract,abstract_cn);world model(abstract,abstract_cn);分类 cs.CV、cs.RO
AI总结 本文提出面向机器人操纵的开源世界模拟器BWM,通过动作条件化自回归预测实现高保真,兼具数据引擎与策略评估器功能,在WorldArena挑战赛中表现最优并开源相关资源。
Open-AoE:用于具身学习的开放自我中心操纵数据集和工具链
机构 * Ant Group(蚂蚁集团)
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 研究旨在为具身学习提供数据集和工具链,提出Open-AoE。它涵盖从手机捕捉到模型训练全流程,含约2000小时视频及多种注释等。通过整合多环节,降低数据贡献与重用障碍,为相关研究提供实用开放基础设施。
RxBrain:具有联合语言-视觉推理与想象的具身认知基础模型
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 研究提出具身认知基础模型RxBrain,采用统一多模态架构,通过构建自动管道训练,引入RxBrain-Bench评估,能保持具身理解和生成能力,扩展到连续机器人动作生成,为具身认知基础模型发展奠定基础。
从世界行动模型到具身大脑:开放世界物理智能路线图
机构 * IEEE
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 研究针对通用人工智能中物理世界推理行动的进展零散问题,提出以具身大脑为中心的物理智能协同进化路线图,利用世界行动模型等,通过物理框架、共享契约和闭环训练等构建模块化智能栈,推动物理智能发展。
Comments Ongoing work
具身语义场景图生成的强化学习导航现代化
机构 * Organic Computing Group(有机计算组) ; Machine Learning and Computer Vision Group(机器学习与计算机视觉组) ; University of Augsburg(奥格斯堡大学) ; Am Technologiezentrum 8(技术中心8号) ; Augsburg, Germany(德国奥格斯堡)
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 提出模块化导航组件,通过替换策略优化方法和重新设计离散动作表示,现代化具身语义场景图生成中的决策过程,并评估不同动作集和策略结构对场景图完整性、执行安全性和导航行为的影响。
WorldVLN: 用于空域视觉-语言导航的自回归世界动作模型
机构 * Tsinghua University(清华大学) ; Shandong University(山东大学) ; Manifold AI ; Beijing Institute of Technology(北京理工大学) ; Northeastern University(东北大学)
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 WorldVLN提出一种自回归世界动作模型,通过预测潜在世界演变并生成可执行的航点动作,提升空域视觉-语言导航性能,优于现有基线模型。
ComSim:通过组合模拟构建可扩展的现实世界机器人数据生成
机构 * CUHK-Shenzhen(香港中文大学(深圳)) ; Sun Yat-sen University(中山大学) ; Shanghai Jiao Tong University(上海交通大学) ; USTC(中国科学技术大学) ; The University of Hong Kong(香港大学) ; University of Oxford(牛津大学) ; Harvard University(哈佛大学)
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 本文提出Compositional Simulation方法,结合经典模拟与神经模拟生成准确的动作-视频对,通过闭环数据增强管道生成大规模高质量训练数据,减少仿真到现实的域差距,提升现实环境中的政策模型性能。
Comments 14 pages, 8 figures, 4 tables; supplementary material included; Project page: https://faceong.github.io/ComSim/
VAG:用于具身数据合成的双流视频-动作生成
机构 * GigaAI ; Zhejiang University(浙江大学) ; Peking University(北京大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 本文提出VAG模型,通过双流框架联合生成视频和动作,提升跨模态一致性,实现高效且准确的视频-动作配对生成,支持轨迹回放并提升下游策略泛化能力。
ABot-PhysWorld:用于机器人操作的交互世界基础模型,具有物理对齐
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 ABot-PhysWorld通过物理对齐的交互世界模型,生成物理合理且可控的视频,解决了传统方法在物理仿真中的不足,通过新框架和基准测试提升了性能。
Comments Code: https://github.com/amap-cvlab/ABot-PhysWorld.git
ManiDreams:一种基于不确定性强鲁棒物体操作的开源库
机构 * Department of Computer Science, Rice University, Houston, TX 77005, USA(计算机科学系,里士大学,德克萨斯州休斯敦,77005,美国) ; Robotics and AI Institute, Cambridge, MA 02142, USA(机器人与人工智能研究所,马萨诸塞州剑桥,02142,美国)
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 ManiDreams通过整合不确定性表示、传播和约束,提升机器人操作的鲁棒性,实验表明其在多种扰动下表现优于传统RL方法。
Comments 9 pages, 10 figures. Project page at https://rice-robotpi-lab.github.io/ManiDreams/
迈向机械取栓的AI自主导航:基于分层模块多智能体强化学习(HM-MARL)
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 本研究提出分层模块多智能体强化学习框架,实现机械取栓中双设备自主导航,展示体外导航能力及泛化挑战。
Comments Published in IEEE Robotics and Automation Letters
Journal ref IEEE Robotics and Automation Letters (2026)
TC-IDM:为可执行零样本机器人运动实现视频生成
机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) ; State Key Laboratory of Multimedia Information Processing(多媒体信息处理国家重点实验室) ; School of Computer Science, Peking University(北京大学计算机科学学院)
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 TC-IDM通过工具中心逆动力学模型实现视频生成,提升机器人零样本任务的执行能力与泛化性能。
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
Comments The experimental setup and metrics lacks rigor, affecting the fairness of the comparisons
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
机构 * POSTECH ; Ewha Womans University(成均馆大学) ; RLWRLD
专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
Comments 8 pages, 4 figures, accepted to CoRL 2025 LSRW workshop