机器人预测未来只用一步,DIDO在LIBERO成功率做到99%
中科院自动化所、智源研究院、西安交通大学和亚马逊提出DIDO,把多步视频世界动作模型压缩成一次去噪。它在LIBERO平均成功率达到99.0%,LIBERO-Plus为76.6%,RoboTwin为92.0%;99%是仿真基准成绩,真实机器人
中科院自动化所、智源研究院、西安交通大学和亚马逊提出DIDO,把多步视频世界动作模型压缩成一次去噪。它在LIBERO平均成功率达到99.0%,LIBERO-Plus为76.6%,RoboTwin为92.0%;99%是仿真基准成绩,真实机器人
加州大学洛杉矶分校提出Visible Touch,把接触位置渲染成机器人视觉策略能直接读取的画面标记,不必另建触觉编码器。接上团队自制的低成本磁传感器后,π0.5在四项真实接触任务中的成功率平均提高30个百分点;这个结果只对应论文测试的任务
清华大学、Xspark AI、香港科技大学(广州)、香港大学提出MoPA,让移动机器人不必停稳后再伸手,而是在行进中持续观察和操作。四项真机任务平均完整成功率76.3%,比最强基线高12.5个百分点;实验仍是室内受控任务,尚未证明在人群和开
北大前沿计算研究中心、银河通用机器人提出FoldNet++,让双臂机器人只看合成演示就学会展开和折叠T恤,真机端到端成功率超过90%。这意味着难采、慢采的真实机器人数据有机会被大规模仿真替代;不过实验集中在T恤和受控桌面,不能直接外推到所有
洛桑联邦理工学院、香港科技大学提出SwarmNxt,把无人机硬件组装、批量软件部署、ROS 2导航、规划和深度估计整理成开放平台。6架无人机完成高速互避,4架在障碍环境集体飞行;两组实验都在8×8×4米室内运动捕捉场地进行。
苏黎世联邦理工学院软体机器人实验室提出一套实时控制方法,让灵巧手只靠手指转动握住的笔,不用强化学习、仿真训练或预采集演示。控制器在笔记本CPU上约18秒完成初始化,实体手多次书写的平均平面误差为0.6毫米;速度提高后误差会明显变大。
西蒙菲莎大学、宾夕法尼亚大学、阿尔伯塔机器智能研究院提出IMLE-VLA,把机器人动作头从10次迭代采样改成一次生成,推理频率由15Hz升至55Hz。它在LIBERO平均成功率98.0%,真机也更顺更快;98.0%属于仿真基准,真机只验证4
加州大学伯克利分校、Sharpa Robotics、香港大学等机构提出GALATEA:先让视频模型生成手与物体的动作,再把画面重建成仿真可执行轨迹。团队落地超过1500段生成视频,仿真训练成功率较基线高出25个百分点以上,并做了真机闭环演示
香港大学、香港科技大学(广州)、苏黎世联邦理工学院等机构的研究团队让一只灵巧手独立完成瓶子、注射器和马克笔三种双零件装配,策略只在仿真中训练,随后直接迁移到真机。它不借助第二机械臂或外部夹具,但实验对象都是刚性零件,距离杂乱工位上的通用装配
香港科技大学(广州)、意大利技术研究院、浙江大学联合提出WHIRL,让机械手把人类接管动作当成风险信号,提前避开操作者可能喊停的状态。16自由度LEAP Hand在指定复杂抓取任务中做到96.7%成功率,按操作步数计算的人工干预最多减少84
北京大学、华南理工大学、新加坡国立大学联合提出MobileVLA-R1 2.0,让移动机器人先理解指令和环境,再输出能执行的导航与操作命令。宇树G1在论文设定的真实移动操作任务中,完整任务成功率比上一版提高10个百分点。它回答的是机器人怎样
南京大学、华为、天津大学与不列颠哥伦比亚大学团队提出语言轨迹编码LTE,把长视频中的物体位置、状态与语义压成可查询记忆。论文报告8.7至26.1倍压缩,24小时视频查询低于1秒;但在SMB上的两类成功率只有45.3%和48.7%,长时记忆远
中国科学技术大学、北京航空航天大学、中关村学院与合肥星旋科技团队提出VLA-Precision,让机器人直接在真实设备上在线练习高精度化学操作。论文在四种机器人、九项任务上报告98.3%平均成功率,每项平均训练45.8分钟;这些数字来自受控
浙江大学、上海人工智能实验室、清华大学、云深处科技等机构提出FWBC-VLA,让轮腿机器人无需加装力传感器,也能估计接触强度并调整全身动作。系统用5000余条数据训练,在实机上完成擦白板和开启带闭门器的门;验证只覆盖这两类接触任务。
中国科学院自动化研究所、清华大学、复旦大学、新加坡国立大学等机构提出GIFT,训练机器人策略时强制中间视觉特征保留几何、可操作区域和目标位置。三种配置在LIBERO-Plus零样本迁移中最高达到87.8%;实机结果覆盖论文设置的单臂、双臂操
浙江大学、上海交通大学、诺埃马特里斯、无尽人工智能等机构联合提出HINT,让机器人只在操作阶段切换时重新理解指令,随后用多视角定位和跟踪维持目标。框架在3项长流程任务、2种基础策略及多类未见变化中提高任务进展和端到端成功率;证据仍来自指定分
智元机器人、北京大学、中国人民大学、香港大学等机构联合提出ZETA,用14种保留机型研究视觉语言动作模型能否跨机器人迁移。仅在预训练中加入5%目标机型数据,平均任务进展就提高13.4个百分点,说明“完全没见过”和“预训练见过少量”必须分开报
加州大学伯克利分校、直觉外科公司等机构联合提出MACAW,让达芬奇研究机器人用视觉伺服对准碎片,再以单目图像控制抓取深度。双臂设置在物理实验中达到92%成功率,平均7秒处理一个碎片、折合每小时473个;实验使用研究平台和仿真组织碎片,不能视
佛罗里达人机认知研究所、西佛罗里达大学提出一套可在机器人运行时编辑的行为系统。Unitree H1-2和自研Alex人形机器人完成六类真实任务,其中推门穿越用时34秒,在人为干扰下分拣六个彩球用时45秒。
南洋理工大学团队提出Facet-0,让机器人在电脑部件装配中同时预测动作和接触后果。系统在五项亚毫米任务上的平均成功率达到82%,论文报告的最强匹配基线为15%,放置精度为0.5毫米,命令延迟为50毫秒。