清华&上海AI实验室等让机械臂预判传送带,抓取完成数从23次增至44次
传送带上的物体不会等机械臂想清楚再进入抓取区。清华大学、上海AI实验室、哈尔滨工业大学和云深处科技联合提出ForeTime-VLA,把世界动作模型看到的未来压缩成训练信号,部署时只看过去八帧。三档速度的实机测试中,它完成44/90次抓取,π
传送带上的物体不会等机械臂想清楚再进入抓取区。清华大学、上海AI实验室、哈尔滨工业大学和云深处科技联合提出ForeTime-VLA,把世界动作模型看到的未来压缩成训练信号,部署时只看过去八帧。三档速度的实机测试中,它完成44/90次抓取,π
机器人模仿人类示范学会叠杯后,第一次操作失败通常不会让它自动变聪明:失败动作不能直接拿来继续模仿。佐治亚理工提出Q-Planning,冻结原有的数十亿参数行为克隆策略,只训练一个约10亿参数的价值函数。五轮实机自我改进后,叠杯成功率从40%
同样是纸杯,空杯需要轻捏,装满后又要增加抓力;外观相近的易拉罐,也可能因为重量不同而滑落。小米机器人团队提出ViTacPhys,让机械手在抓取时显式判断物体的质量等级、刚度和接触摩擦等级,再据此调整动作。真实抓取中,它在训练分布内物体上的总
人形机器人把球打出去不算难,既保持职业网球动作风格,又在真实硬件上稳定击球更难。上海人工智能实验室、上海交通大学、诺亦腾机器人、越疆机器人等机构提出AdaPT,从转播视频学习发球与回合动作,并把策略部署到宇树G1和1.7米越疆Atom。
四足机器人装上机械臂后,摄像头会随底盘移动,手臂动作也会改变画面。清华大学、上海人工智能实验室、哈尔滨工业大学、云深处科技等机构提出DECOWAM,分别建模相机自运动、底盘和机械臂动作,再联合预测未来视频与控制。
机器人视频很多,带精确动作标签的数据却很少。小米汽车、复旦大学、清华大学、武汉大学等机构联合发表这项系统实证研究:在统一框架中比较41种隐式动作模型设计,追踪哪些选择真正改善下游操作,而不只让视频重建指标更漂亮。
机器人把面包放到目标位置,并不代表任务真的成功:抓得太松会滑落,抓得太紧会把软物体压坏,外部相机有时看不出两者差别。拓境智能、清华大学、卡内基梅隆大学等机构提出SoftVTBench,收集4000条视触觉演示,专门评估可变形物体操作中的形变
人形机器人按着坐椅指令下蹲时,椅子可能已经被移走;踢腿动作也可能让自己的四肢互相碰撞。GigaBrain-WBC-0.5把动作、下一时刻身体状态和下一条可行动作分布放进同一个因果Transformer里,让控制器在执行前识别不合理指令并收回
五指机械手要完成插销,得先找到物体、抓稳、在手中调整方向,再把它对准孔位。英伟达、密歇根大学提出ADEPT:先用通用“物体重定向”任务预训练,再用一套稳定后训练方案学习具体操作。论文的Kuka-Allegro插销实验中,五个随机种子全部训练
让人形机器人走到陌生目标前、保持平衡并伸手抓取,需要把视觉导航、全身控制和操作连在一起。加州大学洛杉矶分校、艾伦人工智能研究所、华盛顿大学等机构提出FetchMan,在超过15万个仿真场景中训练,并把策略零样本部署到真实宇树G1。
机器人换一副机械臂,原有世界模型往往就要重新学习动作含义。英伟达、布朗大学、哥伦比亚大学、哈佛大学等机构提出Hydra-0,把关节角、末端位姿等机器人专属命令转换成画面中的像素运动轨迹,让不同形态的机器人共享一种视觉动作接口。
北京大学、北京航空航天大学和京东科技联合提出AppliancePlan,让机器人结合说明书、当前画面和操作状态规划家电任务。团队构建覆盖22类家电的数据集;论文报告,7B模型在RealAppliance-Bench开放规划上超过最佳基线10
斯坦福大学、麻省理工学院和Scale AI联合提出SPD,把灵巧手的大规模操作数据采集放进VR仿真。5名操作者在一周内积累75小时多任务轨迹,模型预训练后,只用1—2小时真实演示微调,就能迁移到56自由度的双手灵巧机器人上。
上海创新研究院、智元Finch和香港中文大学联合提出τ0-VLA,让机器人在决定下一项子任务时按难度分配推理计算:简单步骤直接执行,困难或后果重要的步骤先生成多个候选,再借助世界模型比较。模型使用40115小时异构真实世界数据训练,并在多种
静态桌面上慢慢抓取,模型多想半秒未必出事;面对滚动、摆动或即将离开的目标,等图像编码和动作生成完成,机会已经过去。上海交通大学团队提出ReflexVLA,把未来运动预测、多帧视觉融合和低延迟推理放进同一策略,并发布包含6类高速动态任务的Re
机器人遇到昏暗环境、透明物体或精细几何关系时,不一定要让一个大模型硬扛所有视觉难题。星尘智能、清华大学、香港中文大学等团队提出ART,让视觉—语言—动作模型在执行过程中按需调用分割、深度等外部视觉工具。基于3万条工具增强轨迹训练后,ART在
人拿起杯子可能是自己喝,也可能准备递给机器人。若等物体已经伸到面前才判断,机械臂反应会显得迟钝;过早误判又可能突然伸手。阿里巴巴、浙江大学等团队提出PassGen,先生成未来的RGB-D递物视频来判断意图,并利用Hand2Bot真实数据中的
“穿过走廊,在画旁边左转,再停到书架前。”这类指令对轮式机器人已不轻松,换成人形机器人还要同时处理步态、碰撞和身体尺寸。VinMotion与南加州大学提出HumanoidVLN,在4种人形平台、933条路线中评测语言导航,并把宇树G1带到真
机器人在抓杯子、开抽屉前,如果能预测“动作之后场景会怎样变化”,通常更容易规划下一步。上海交通大学、ACE Robotics和南洋理工大学提出ForeWAM,让动作模型获得未来动态,却不在部署时真正生成未来视频;标准版和加速版在LIBERO
日本电气通信大学团队设计了一种混合硬度仿生指尖,中央指肚使用软硅胶,两侧换成更硬的材料,内部保留类似指甲的刚性结构。机器人不用先把硬币推到桌边,也不需要在底部留缝,就能从硬平面上抬起硬币。