Don't Let Your Robot be Harmful: Responsible Robotic Manipulation via Safety-as-Policy
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO
视觉与机器人
面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO
Comments Website: https://annaj2178.github.io/EnerverseAC.github.io
机构 * Carnegie Mellon University(卡内基梅隆大学) ; UC Berkeley(伯克利大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.LG、cs.RO
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV
Comments Accepted at ICCV 2023; Project page: https://github.com/hanqingwangai/Dreamwalker
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO
Comments Presented at the ICAPS'22 Workshop on Planning and Robotics (PlanRob)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.LG、cs.RO
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO
Journal ref IROS 2019
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO
Journal ref International Journal of Advanced Robotic Systems, ISSN 1729-8806, Volume 1, Number 3 September 2004, pp.141-148
机构 * University of Pennsylvania(宾夕法尼亚大学) ; College of the Atlantic(大西洋学院)
专题命中 具身与机器人 :environment model(title);分类 cs.LG、cs.RO
专题命中 具身与机器人 :latent dynamics(title);分类 cs.LG、cs.RO
Comments Preprint version of paper accepted at IEEE T-RO. Project website: https://sites.google.com/view/mild-hri
异构机器人的校准预测安全性:一种带基于模型安全盾的动作条件联合嵌入预测架构(JEPA)框架
机构 * Guangdong Bifang Intelligent Control Technology Co., Ltd.(广东毕方智能控制技术有限公司)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO
AI总结 本研究提出带基于模型安全盾的动作条件JEPA框架,用于异构机器人,可预测候选动作的任务进展与物理风险,在仿真中提升了成功率并降低碰撞漏报率。
Comments 17 pages, 9 figures. Simulation-only empirical results on LIBERO-Long (no real-robot experiments). Source, figure-generation scripts and reproducibility checklist included. Level-3 offline reranking significance test not executed; see Sec. 7 (Scope and honesty statement) for detailed disclosure
具身智能工业机器人:框架与技术
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO
AI总结 本文提出了一种新的基于知识的具身智能工业机器人框架,旨在提升工业机器人在复杂环境中的智能水平和应用潜力。
Comments 70 pages, 13 figures. The associated project can be found at https://github.com/jackyzengl/EIIR
Journal ref Journal of Manufacturing Systems 88 (2026) 158-189
JoyAI-RA 0.5:通过双动作对齐扩展机器人操纵学习
机构 * Joy Future Academy, JD(京东探索研究院)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO
AI总结 针对机器人操纵学习中异构数据的负迁移问题,提出 JoyAI-RA 0.5 框架,通过双动作对齐结合 VLWA 与强化学习,在 AgiBot 基准上实现性能提升,证明人类弱标注数据可作为扩展操纵能力的核心资源。
Comments Project Page: https://joyai-ra-05.github.io/
用于多步视觉推理的分层去噪
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理技术国家重点实验室) ; The Hong Kong University of Science and Technology(香港科技大学) ; Beihang University(北京航空航天大学) ; Fuzhou University(福州大学) ; Muka Robotics(木卡机器人)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV
AI总结 研究针对视频模型多步推理不足的问题,提出HDR框架,通过树形层次结构和稀疏分层注意力模式进行多步推理,在新基准测试中提升了成功率和进度,推理更快,数据效率更高,在机器人实验中展现潜力。
MotuBrain: 一种先进的世界动作模型用于机器人控制
机构 * MotuBrain Team(MotuBrain团队)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO
AI总结 MotuBrain提出一种统一的世界动作模型,结合视频和动作,支持多项任务,实现高效部署和高精度控制。
WALA:从带动作标签的演示和无动作视频中学习可执行的潜在动作
机构 * CASIA(中国科学院自动化所) ; Anyverse Dynamics(Anyverse动力学公司) ; UCAS(中国科学院大学) ; NUS(新加坡国立大学) ; XJYLU(西安交通大学利物浦大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO
AI总结 研究从带动作标签演示和无动作视频学习可执行潜在动作的问题,提出WALA框架,先预训练语义几何潜在动作模型,策略训练时编码器和解码器协同,由多方面联合监督潜在动作,实验证明其提升了机器人策略性能和泛化能力。
Comments Project page: https://liujiahao2077.github.io/WALA.github.io
EgoSteer:一个用于从第一人称视角视频实现可控灵巧操作的全栈系统
机构 * Institute for AI, PKU(北京大学人工智能研究院) ; PKU-PsiBot Joint Lab(北大-灵犀机器人联合实验室) ; UPenn(宾夕法尼亚大学)
专题命中 具身与机器人 :world-model(abstract);world-model(abstract);分类 cs.RO
AI总结 针对灵巧手系统因缺乏数据而无可控性的问题,提出全栈系统EgoSteer,集成EgoSmith数据管道等,通过人类数据预训练赋予语言引导操作先验,经机器人后训练强化,能执行多样任务,还开源相关内容。
TouchWorld:一种用于灵巧操作的预测性和反应性触觉基础模型
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; PHANES AI(PHANES人工智能公司)
专题命中 具身与机器人 :world-model(abstract);world-model(abstract);分类 cs.RO
AI总结 研究针对日常环境中灵巧操作需预测与反应的问题,提出TouchWorld模型。该模型采用分层策略,分离多项任务。通过将触摸用于预测和反馈,提升局部接触适应性。在六个相关任务中表现出色,超越最强基线。
InternVLA-A1.5:统一理解、潜在预见与组合泛化的行动
机构 * Physical Intelligence Team Shanghai AI Laboratory(上海人工智能实验室物理智能团队)
专题命中 具身与机器人 :world-model(abstract);world-model(abstract);分类 cs.RO
AI总结 研究旨在统一机器人操作模型,提出InternVLA-A1.5,基于原生VLM骨干构建策略,将未来预测转化为潜在查询问题,继承预训练视频生成模型动力学先验,在模拟和现实基准测试中效果良好。
Comments Homepage: https://internrobotics.github.io/internvla-a15.github.io/
无人机的最后一米精确导航:一种扩散细化的空中视觉伺服方法
机构 * FST and ICI, University of Macau(澳门大学科技学院及资讯与通信技术研究所)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV
AI总结 研究无人机最后一米精确导航,提出DreamNav框架,先粗估计旋转,再用预训练世界模型模拟未来视觉观测选轨迹,贡献PairUAV基准测试,实验表明DreamNav性能优。
多感官持续学习:将预训练的视觉运动策略适应到力觉
机构 * Stanford University(斯坦福大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO
AI总结 提出MuSe方法,通过多阶段融合、多感官未来预测和预训练数据经验回放,将有限的多感官数据融入预训练的纯视觉策略,在保持原始任务性能的同时适应新任务。
LaST-HD:从可扩展人类数据中学习潜在物理推理以进行机器人操作
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Simplexity Robotics ; Aether Tech
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO
AI总结 提出LaST-HD框架,通过将人手与机器人演示在共享潜在推理空间中对齐,利用未配对轨迹训练世界模型合成统一潜在目标,实现跨形态物理动力学内化,并开发低成本数据手套OOL Glove,结合混合训练策略,仅用少量人类数据即可达到高泛化性能。
想象以确保分层强化学习的安全性
机构 * Cognitive AI Systems Lab(认知人工智能系统实验室) ; Moscow Independent Research Institute of Artificial Intelligence(莫斯科独立人工智能研究所) ; FRC Computer Science RAS(俄罗斯科学院联邦研究中心计算机科学研究所)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI
AI总结 提出结合可学习世界模型与高低层策略的分层方法,通过高层生成安全子目标、低层利用想象滚动减少不安全行为,在长时域任务中显著优于现有安全强化学习基线。
V-JEPA 2.1: 解锁视频自监督学习中的密集特征
机构 * FAIR at Meta(Meta的FAIR) ; Universidad de Zaragoza(萨拉戈萨大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV
AI总结 提出V-JEPA 2.1系列自监督模型,通过密集预测损失、深度自监督、多模态分词器和有效缩放,学习图像和视频的密集高质量视觉表示,在多个基准上取得最优性能。
World Pilot: 用世界动作先验引导视觉-语言-动作模型
机构 * Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) ; Nanjing University(南京大学) ; Beihang University(北京航空航天大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO
AI总结 提出World Pilot框架,通过世界动作模型(WAM)的潜在引导和动作引导两条路径,为VLA模型提供场景演化先验和轨迹级运动提示,在LIBERO-Plus零样本OOD基准上达到84.7%的总成功率,并在多个真实机器人操作任务中取得最高成功率。
Comments Project Website: https://world-pilot.github.io/