字节Seed把真实房间变成可编辑仿真场景,F-Score升至0.924
字节跳动Seed、北京大学和浙江大学联合提出Lucida,把一段真实室内视频转成仿真可用的场景副本:房间里的物体不仅被重建,还能作为独立3D资产移动和编辑。论文报告其场景F-Score由SAM3D的0.794提高到0.924。
字节跳动Seed、北京大学和浙江大学联合提出Lucida,把一段真实室内视频转成仿真可用的场景副本:房间里的物体不仅被重建,还能作为独立3D资产移动和编辑。论文报告其场景F-Score由SAM3D的0.794提高到0.924。
南洋理工大学、新加坡科技研究局、小鹏机器人和浙江大学等机构提出AnyWorld:不用成对拍摄人类与机器人示范,就能把一段第一视角人类交互重组为不同机器人本体、相机视角和场景下的机器人原生视频。生成数据随后用于RoboCasa GR1桌面基准
清华大学、Galbot、北京大学和上海期智研究院等机构联合提出RoboGesture,让宇树G1人形机器人在听取语音时实时生成与内容相符的手势。团队同时建设了覆盖300多类动作的数据集,并把语音理解、流式动作生成和实体安全控制接成一套完整系
没有机械臂和夹爪,四足机器人也能用肩部、机身或腿接触椅子,把它推到指定位置。比萨大学、苏黎世联邦理工学院、英伟达等机构提出接触引导的多评论家强化学习方法,覆盖推箱、搬椅和开洗碗机三类非抓取移动操作任务。
一只五指机器人手,16个转动关节由7个电机通过腱绳驱动,论文给出的整手重量为374克、物料成本为314美元。Chestnut Robotics、加州理工学院等机构推出Aero Hand Open,并把机械设计、仿真模型、强化学习环境和真机部
一个机器人模型换到预训练阶段从未见过的人形本体,只用20%的下游轨迹就拿到49.5%的任务成功率,高于GR00T-N1.6使用全部下游数据时的47.6%。这项结果来自VLAct,一套把持续预训练重点从“继续堆机器人数据”转向“先把表示学好”
人形机器人走几级台阶并不罕见,难的是在长距离中持续处理台阶、斜坡、窄落脚点和感知噪声。中国科学技术大学、X-Humanoid、清华大学等机构提出SOLO,仅用胸前深度相机和本体感知零样本部署,完成1.5公里连续户外路线。
给机器人一张目标房间的俯视布局,它需要从第一视角找到家具、抓起、搬运并摆到正确位置。北京理工大学提出具身场景重排规划ESRP,并构建ESRP-Bench,包含超过5400组初始—目标场景和8200个物体。
看懂一张街景,并不等于能沿着街道走到目的地。上海交通大学、美团、新加坡国立大学等机构提出UrbanGround,把真实尺度城市地理数据装进可交互的Unity环境,专门检验多模态大模型在连续移动中能否认路、记路并调整路线。
长任务中,机器人要记住哪些物体已经移动、当前动作是否失败,以及下一步会不会挡住后续操作。卡内基梅隆大学提出R³,让视觉语言模型在每次低层动作前用自然语言分析场景、进度与替代计划,再把文字指导交给操作策略。
拧瓶盖时,摄像头能看到机械臂位置,却很难判断软夹爪是否已经压紧;力和触觉传感器又会增加布线、标定和成本。清华大学、南方科技大学、哈尔滨工业大学提出VISTA-Policy,从合规夹爪的三维形变场中提取接触反馈。
机器人只模仿动作,可能学会在训练画面里伸手,却没有形成稳定的三维结构与物体运动表示。图灵智新、中科院自动化所、清华大学等机构提出GaussianDream++,训练时要求视觉语言动作模型重建当前3D世界并预测未来,部署时再移除重建头。
同一个“把面包拿起来”任务,单臂机器人、双臂机器人和人手使用的关节、控制器与动作维度完全不同。小米具身智能团队、澳门大学提出UCAG-P,把这些动作先换算成相机能观察到的手腕、末端执行器和抓取中心轨迹,再交给不同机器人的运动学模块执行。
机器人世界动作模型常在执行动作前生成未来画面,用视觉预测帮助控制,但完整视频分支会拉高推理延迟。清华大学、中科院自动化所、TARS Robotics、复旦大学等机构提出LAWA,把未来变化压缩成离散潜动作,推理时不再重建未来像素。
鱼游过后,水中会留下持续一段时间的涡流。海豹能用胡须读取这些尾流,在黑暗或浑浊水体里追踪目标。斯坦福大学、上海交通大学、清华大学把这一机制做成光纤布拉格光栅触须,并装到小型水下机器人前端。
手指被杯子、工具或另一只手挡住时,摄像头很容易丢点;依赖惯性或磁场的传感手套又会遇到漂移和干扰。Meta、西北大学提出一套光纤传感手套,用沿手指铺设的多芯形状传感光纤直接恢复三维曲线,再以60Hz重建完整手部姿态。
水下单目视频不仅缺少尺度信息,还会被光线衰减、散射和颜色偏移干扰。浙江大学、上海人工智能实验室、上海交通大学、清华大学等机构提出AquaFlow,让系统一边接收视频,一边估计相机轨迹并更新3D高斯场景。62条水下轨迹上,平均定位误差比Wat
行为克隆告诉机器人“这个时刻手臂该怎么动”,却不直接说明这段动作要完成什么局部目标。浦项科技大学提出INDI,用教师视觉语言模型从执行视频中提炼行为意图,再监督VLA动作解码器。SimplerEnv-Bridge上,GR00T-N1.7平均
双臂机器人同时读取多个相机画面和语言指令时,更多信息不一定带来更稳定的动作。上海创新研究院、浙江大学、上海交通大学、中国科学技术大学等机构提出M3:训练时随机遮掉部分模态通道,不改模型结构,也不增加大规模机器人预训练。三项真实长程任务中,平
“拿住杯把”“按下按钮”“握住喷嘴”都要求机器人把一句自然语言落到物体的具体3D区域。以往方法常假设已经有完整点云和固定动作类别。同济大学与中国科学院提出AffordAny,从一张RGB图片出发重建物体,再根据自由文本定位可操作部位。自动管