东大把秋叶原85条街搬进360CityArena,Gemini导航得分仅17.1%
东京大学团队提出360CityArena,用602段360度视频重建东京秋叶原的85条街道,为具身Agent准备了175项城市探索任务。环境保留商店招牌、路口、楼宇和密集街景,不是用简化3D模型搭的规整迷宫。
东京大学团队提出360CityArena,用602段360度视频重建东京秋叶原的85条街道,为具身Agent准备了175项城市探索任务。环境保留商店招牌、路口、楼宇和密集街景,不是用简化3D模型搭的规整迷宫。
复旦大学、北京智源人工智能研究院、清华大学和中国人民大学提出SLIM,一个只有0.47B参数的机器人操作策略。它不用大型多模态骨干每个控制步都重做开放域理解,而是学习与动作和状态变化紧密相关的紧凑潜表示。
阿里达摩院与湖畔实验室提出并开源机器人价值基础模型RynnValue。它用超过7000小时的多源机器人数据学习“当前状态距任务完成还有多远”,再把这个判断转成训练策略所需的稠密奖励。
人类视频数量巨大,但把其中的手部动作直接复制给机械手,常因手指数量、关节长度和运动范围不同而失败。南京大学与中国移动研究院提出C2Dex,从单目人类视频中提取稳定的物体接触关系,再把它迁移到机器人灵巧手。在DexYCB任务上,其宽松标准成功
让人形机器人学会一个动作,麻烦的往往不是动作本身,而是要把机器人搬到不同房间、不同位置反复采集真机画面。小鹏机器人与香港理工大学提出R2S-EGO:只用6次真实采集、共48个第一视角观测,再让生成模型补出策略可能遇到的画面,宇树G1的实机坐
训练时摄像头在桌面左侧,部署时换到右侧,机器人可能把图像坐标误当成任务空间位置。伊利诺伊大学厄巴纳-香槟分校与哈佛大学提出ARGUS,先把任意视角转换成标准机位,再交给现有视觉动作策略。
东京大学、字节跳动Seed、香港大学、上海交通大学和清华大学团队发布SiMDex。它没有扩大机器人模型,也没有增加训练数据量,而是从约3200万段人类第一视角视频中筛出约149万段与目标动作相近的样本,再用于视觉—语言—动作模型后训练。
浙江大学、上海交通大学和上海创新研究院等团队提出Track4Action,把机器人演示视频中的3D场景变化变成训练监督。传统模仿学习通常只学习“下一步执行什么命令”,动作让物体、遮挡和相机视角发生了什么变化,并没有被直接写进标签;新方法在四
中山大学、斯坦福大学和东南大学团队发布DynamicManip,只用一次静态任务示范生成多种动态操作训练数据。与对照方法相比,系统在论文任务上的平均成功率提高18.4个百分点,策略查询延迟降低32.9%。
阿里巴巴通义千问、中国人民大学、上海科技大学、北京通用人工智能研究院和北京航空航天大学团队发布Ego2Robot,把人类佩戴相机拍下的第一视角操作视频转换为机器人训练数据。整套数据达到18561小时,覆盖15种机器人形态。
加州大学伯克利分校、Google DeepMind和英伟达研究人员把Gemini Robotics On-Device部署到宇树Unitree G1上,只通过托管微调接口完成两轮闭环训练。三项实机操作的成功率分别升至100%、98%和96%
加州理工学院研究团队把一套名为PAC-MAN的控制方法部署到宇树Unitree G1上。研究人员从正面向机器人手掷20次球,G1躲过19次,没有摔倒,实机成功率为95%。
机器人要学会做家务,先得看懂人是怎么做家务的。可现有数据要么来自脚本化的实验室演示,要么是网络上没有动作真值的视频,规模与真实感很难兼得。南洋理工大学 S-Lab 与 ACE Robotics 给出的思路,是把真实公寓直接改造成录制棚:一套
机器人学操作,最值钱的画面来自它"自己的眼睛":第一视角相机离夹爪和桌面最近,手与物体的接触关系看得最清楚。但这种数据恰恰最难收集——每条轨迹都要真机执行、人工重置、全程看护,失败还可能撞坏硬件。上海交通大学、阿里巴巴、天机芯智(Tianj
华盛顿大学、微软研究院和MIT的研究团队提出了ARCHITECT,把机器人策略获取当成一个交互式程序合成任务:LLM编码智能体合成模块化的机器人程序,调用一套感知与控制工具来操作真实机械臂。在Franka Panda机器人上的8个真机任务、
机器人世界模型通常直接接收关节或末端动作向量,再预测未来画面。换一台机械臂,向量含义和运动学关系都可能变化。首尔大学、RLWRLD团队提出RoFacto:先让控制器把命令变成名义轨迹,再把机器人几何渲染进相机画面,视频模型只学习物体如何响应
机械臂把物体插进狭窄接口时,相机可能看不到接触点,真正决定成败的是压力、摩擦和细微位移。上海科技大学、InstAdapt团队提出ViTacWorld,让世界模型根据机器人动作同时预测未来画面和触觉反馈,再用生成轨迹扩充插接、剥离等任务的训练
一只机械手在灯前摆动,墙上的影子可以拼出手势字母,也能模仿鹿、孔雀、鸭子和狼的动作。杜克大学团队让21自由度灵巧手学习“自己的关节怎么改变影子”,再从目标图片或视频反推机械手动作,把影子变成机器人的表达媒介。