PropEM-L: Radio Propagation Environment Modeling and Learning for Communication-Aware Multi-Robot Exploration
专题命中 具身与机器人 :environment model(title,abstract);分类 cs.RO
Comments Robotics: Science and Systems 2022, 8 pages
视觉与机器人
面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。
专题命中 具身与机器人 :environment model(title,abstract);分类 cs.RO
Comments Robotics: Science and Systems 2022, 8 pages
机器人操作是视觉到几何映射(f(v)→G):超越语言和视频模型的视觉-几何骨干
机构 * Sun Yat-sen University(中山大学) ; Guangdong Key Laboratory of Big Data Analysis(大数据分析与处理广东省重点实验室) ; X-Era AI Lab(X-Era人工智能实验室) ; AMAP, Alibaba(阿里妈妈实验室) ; Guangdong University of Technology(广东工业大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO;predictive model(abstract)
AI总结 本文提出基于视觉-几何骨干的机器人操作方法,通过直接利用预训练的3D表示生成动作,优于传统语言或视频模型,在精确操作和零样本泛化中表现更优。
Comments Accepted at ACM Multimedia 2026
WCM:用于通用人机交互的世界认知模型
专题命中 具身与机器人 :world-model(abstract);world-model(abstract);分类 cs.AI、cs.LG、cs.RO
AI总结 针对机器人在物理任务交互困难的问题,提出基于SLAK架构和异步运行时的世界认知模型(WCM),引入人在回路教学模式,经思维链监督改进模型,在九个现实世界人机交互任务中平均成功率达73.8%。
SWITCH:在长时程具身场景中评估和处理具象接口的基准测试
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV、cs.RO
AI总结 SWITCH基准测试通过1170个时间交互视频,评估具象接口在真实第一人称环境中的闭环交互推理,揭示多模态模型在细粒度视觉-时间感知、结果验证和错误恢复方面的不足。
Comments The dataset is available at https://huggingface.co/datasets/BAAI-Agents/SWITCH
精确等变性在训练中保持,实现跨对称群的零样本泛化
机构 * Department of Mathematics, Stony Brook University(石溪大学数学系)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG、cs.RO
AI总结 通过等变编码器和预测器构建的潜世界模型,其训练损失具有可证明的对称性,从而在仅拟合部分方向动力学时,数学上确定整个轨道上的行为,实现跨对称群的零样本泛化。
Comments 112 pages, 19 figures. v2 adds programme lineage to companion papers (arXiv:2606.13092, 2606.24945, 2606.24946), engages the equivariance-at-scale debate (arXiv:2410.23179), and adds experimental hardening: 5-seed CIs, frame-averaging/canonicalization baselines, a real-robot DROID anchor, a scale-vs-exactness curve. Core claims unchanged. Code: https://github.com/TimothyWang418/se3-ejepa
PhysisForcing:面向机器人操作的物理增强世界模拟器
机构 * Peking University(北京大学) ; NVIDIA(英伟达)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV、cs.RO
AI总结 针对视频生成模型在机器人操作模拟中物理不稳定的问题,提出PhysisForcing框架,通过像素级轨迹对齐和语义级关系对齐损失联合优化,显著提升物理一致性,在多个基准上改进基础模型,并提高下游策略成功率。
Comments Github: https://github.com/DAGroup-PKU/PhysisForcing Project website: https://dagroup-pku.github.io/PhysisForcing.github.io/#
几何动作模型用于机器人策略学习
机构 * KAIST AI(韩国科学技术院人工智能学院) ; ETH Zurich(苏黎世联邦理工学院) ; ETH AI Center(苏黎世联邦理工学院人工智能中心)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.LG、cs.CV、cs.RO
AI总结 提出几何动作模型(GAM),通过重用预训练几何基础模型(GFM)作为共享骨干,实现语言条件下的操作策略,在仿真和真实机器人任务中优于现有方法。
Comments Project page: https://cvlab-kaist.github.io/Geometric-Action-Model/
MemoryVAM:将记忆融入视频动作模型以实现机器人操作
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Nirvana Robotics(涅槃机器人) ; University of California, San Diego(加州大学圣迭戈分校) ; University of Utah(犹他大学)
专题命中 具身与机器人 :world-model(abstract);world-model(abstract);分类 cs.AI、cs.CV、cs.RO
AI总结 提出MemoryVAM,通过Recap-Cue模块将情景记忆注入视频世界模型策略,解决长时域操作中的非马尔可夫性问题,在LIBERO-Mem和真实机器人任务上显著提升成功率。
Comments Project page: https://MemoryVAM.github.io/
通过视觉和触觉进行推理时策略引导
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG、cs.RO
AI总结 提出ViTaL框架,通过视觉采样验证和触觉引导扩散编辑的双层优化,在推理时引导机器人策略,显著提升接触丰富操作任务的成功率。
薛定谔的导航者:为零样本目标导航设想未来轨迹集合
机构 * Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai University of International Business and Economics(上海对外经贸大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV、cs.RO
AI总结 提出一种信念感知框架,在推理时通过轨迹条件化的3D世界模型设想多个未来场景,结合自适应遮挡物感知采样和未来感知价值图,提升零样本目标导航在遮挡严重环境中的隐蔽目标发现和风险感知路径选择。
使远见可操作:在世界动作模型中重新利用表示对齐
机构 * The University of Hong Kong(香港大学) ; XPENG Robotics(小鹏机器人)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV、cs.RO
AI总结 针对世界动作模型中视觉预测与动作提取不匹配的问题,提出AGRA方法,通过对齐视频扩散特征与语义表示,提升动作解码器对任务相关区域的关注,从而改善操作任务的性能与泛化能力。
世界-任务分解用于机器人学习
机构 * Department of Computer Science and Technology, University of Cambridge, United Kingdom(计算机科学与技术系,剑桥大学,英国) ; Robotics and Biology Laboratory, Technische Universität Berlin(机器人与生物学实验室,柏林技术大学) ; Science of Intelligence (SCIoI), Cluster of Excellence, Berlin, Germany(智能科学(SCIoI),卓越中心,柏林,德国) ; Robotics Institute Germany(德国机器人研究所)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.LG、cs.RO、cs.MA
AI总结 提出将策略分解为世界因子和任务因子,通过可微图模型AICON与紧凑学习策略结合,实现零样本泛化到新配置并迁移到真实硬件。
梦想回溯:基于想象的体验检索用于记忆持久的视觉与语言导航
机构 * National Key Laboratory of Human Machine Hybrid Augmented Intelligence, Xi’an Jiaotong University(西安交通大学人机混合增强智能全国重点实验室) ; School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV、cs.RO
AI总结 本文提出Memoir,通过想象引导的检索机制提升记忆持久的视觉与语言导航性能,通过混合视角记忆和经验增强导航模型,在多个基准测试中实现了显著提升。
Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)
PhotoAgent:一种具有空间与审美理解的机器人摄影师
机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University(人工智能与机器人中心,深圳国际研究生院,清华大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV、cs.RO
AI总结 PhotoAgent通过整合大多模态模型与新型控制范式,将主观审美目标转化为几何约束,利用内部视觉模拟实现快速收敛于高质量图像结果。
Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026
迈向视觉-声音-语言-动作范式:用于以声音为中心的操作的HEAR框架
机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University and Shanghai Key Laboratory of Navigation and Location Based Services(自动化与智能感知学院,上海交通大学,导航与基于位置的服务重点实验室) ; Department of Engineering, Cambridge University(工程系,剑桥大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV、cs.RO
AI总结 本文提出HEAR框架,通过整合声音、视觉、语言和本体感知,解决实时声音中心操作中的关键声音遗漏问题,强调因果持续性和显式时间学习的重要性。
具有自恢复能力的失败感知强化学习:用于现实世界操控的可靠离线到在线强化学习
机构 * Shanghai Qi Zhi Institute(上海启智研究院) ; Shanghai Jiao Tong University(上海交通大学) ; IIIS, Tsinghua University(清华大学人工智能研究院) ; Nanyang Technological University(南洋理工大学) ; A*STAR Institute for Infocomm Research(新加坡科技动力研究院) ; University of Maryland(马里兰大学)
专题命中 具身与机器人 :world-model(abstract);world-model(abstract);分类 cs.AI、cs.LG、cs.RO
AI总结 本研究提出FARL框架,通过整合安全批评者和恢复策略,有效减少现实世界强化学习中的失败并提升性能。
Comments Project page: https://failure-aware-rl.github.io
机构 * Department of Artificial Intelligence, Ozyegin University(人工智能系,奥兹德温大学) ; OTRI/SISReC, Osaka University(OTRI/SISReC,大阪大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG、cs.RO
Comments 15 pages, 6 figures
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.LG、cs.RO;dynamics model(abstract)
Comments Accepted for publication at the IEEE International Conference on Robotics and Automation (ICRA), 2025
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV、cs.RO
Comments Accepted by TPAMI 2025
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.LG、cs.CV、cs.RO
Comments Accepted to IEEE Robotics and Automation Letters (RA-L) 2023
专题命中 具身与机器人 :predictive model(title,abstract);predictive models(title);分类 cs.AI、cs.LG、cs.CV;dynamics model(abstract)
Comments Accepted to ICRA 2019
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG、cs.RO
Comments NIPS Workshop on Acting and Interacting in the Real World: Challenges in Robot Learning
Journal ref Bruce, Jake, et al. "One-Shot Reinforcement Learning for Robot Navigation with Interactive Replay." Proceedings of the NIPS Workshop on Acting and Interacting in the Real World: Challenges in Robot Learning. 2017
分布偏移下异构多机器人任务分配的模型强化学习方法
机构 * John A. Paulson School Of Engineering And Applied Sciences, Harvard University(哈佛大学约翰·A·保尔森工程与应用科学学院) ; Harvard Medical School(哈佛医学院) ; Beth Israel Deaconess Medical Center(贝斯以色列女执事医疗中心) ; Stanford University School of Medicine(斯坦福大学医学院)
专题命中 具身与机器人 :model-based reinforcement learning(title);分类 cs.LG、cs.RO、cs.MA
AI总结 本文提出一种预测感知自适应滚动框架,用于分布偏移下异构多机器人任务分配,在医院护理任务案例中,该方法较多种基线缩短了等待时间,提升了服务覆盖与尾部延迟性能。
Comments 34 pages, 14 figures, 4 tables
ForeTime-VLA:面向传送带操作的世界动作模型的因果未来令牌蒸馏
机构 * Tsinghua University(清华大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Harbin Institute of Technology(哈尔滨工业大学) ; Hangzhou Yunshenchu Technology Co., Ltd. (DEEP Robotics)(杭州云深处科技有限公司(深地机器人))
专题命中 具身与机器人 :world-model(abstract);world-model(abstract);分类 cs.AI、cs.RO
AI总结 该研究提出ForeTime-VLA策略,通过从冻结Fast-WAM教师模型蒸馏因果未来令牌,在传送带操控任务上降低了MAE和L2误差,提升了抓取成功率,验证了该方法的有效性。
Comments 8 pages, 5 figures. Introduces ForeTime-VLA, a causal future-token distillation method for conveyor-belt manipulation from a frozen world action model teacher
WCM:用于视觉-语言-动作强化学习的世界评论者模型
机构 * Tongji University(同济大学) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO
AI总结 该研究针对视觉-语言-动作强化学习中评论者与机器人部分可观测性不匹配的问题,提出WCM模型,联合预测未来潜态与值估计,在149个仿真任务和7个真实任务上均实现最优性能与泛化性。
迈向可预测、对齐且可扩展的机器人学习
机构 * Astribot Team(Astribot团队)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO
AI总结 研究旨在实现可预测、对齐且可扩展的机器人学习。核心方法是引入Lumo - 2潜在世界 - 动作模型,提出多阶段模态预对齐策略。主要贡献是该模型在实证研究中表现出色,优于基线,验证了结构化多模态对齐和预测推理对具身智能的重要性。
IndoorR2X: 基于大语言模型的室内机器人与万物协调
机构 * Fujitsu Research(富士通研究所) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO、cs.MA
AI总结 IndoorR2X通过整合移动机器人和静态物联网设备的观测数据,构建全局语义状态,实现可扩展的场景理解、减少冗余探索并利用大语言模型进行高层协调,提升多机器人系统的效率和可靠性。
DSWAM:用于细粒度机器人操作的双系统世界行动基础模型
机构 * AIRC, Midea Group(美的集团美云智数) ; Tongji University(同济大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO
AI总结 研究针对世界行动模型在复杂任务指令分解及VLA与WAM执行能力对比方面的不足,引入DSWAM,通过双系统结合,利用视觉历史和任务提示预测子任务,经多种训练及加速等实现细粒度机器人操作并进行公平对比。
Comments 13 pages, 1 figures
科大讯飞-具身全能技术报告
机构 * iFLYTEK ; LindenBot ; University of Science and Technology of China(中国科学技术大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV
AI总结 研究通用具身智能体,提出统一多模态基础模型iFLYTEK-Embodied-Omni,通过共享多模态自注意力联合建模视觉、语言和动作,结合多种数据构建数据集并采用四阶段策略训练,实现脑-小脑协作。
ABot-M0.5:统一移动与操作的世界动作模型
机构 * AMAP CV Lab(AMAP CV实验室)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO
AI总结 针对移动操作任务中VLA策略缺乏世界建模、动作空间耦合及训练-推理不一致的问题,提出ABot-M0.5模型,通过三级对齐(时间粒度、动作空间、训练-测试一致性)实现细粒度控制,在长时域任务成功率和控制精度上达到最优。
Comments Code: https://github.com/amap-cvlab/ABot-Manipulation