小鹏给人形机器人看1万小时人类视频,6项新任务成功率55%
小鹏机器人提出IronMind,用低成本头戴设备收集人类第一视角操作,不经人体骨架重定向就转成相机空间动作。预训练数据从250小时扩到1万小时后,6项未见真机任务的成功率达到55.0%;数字来自指定平台和协议。
小鹏机器人提出IronMind,用低成本头戴设备收集人类第一视角操作,不经人体骨架重定向就转成相机空间动作。预训练数据从250小时扩到1万小时后,6项未见真机任务的成功率达到55.0%;数字来自指定平台和协议。
小鹏、北京大学与香港大学提出GroundingPI,把点、框、掌握点和密集定位收进同一个4B视觉骨干。它在34项定位基准上平均73.68%,还在机器人与驾驶任务中展现数据效率;这些结论局限于论文设定的模型、数据和评测。
亚马逊FAR、加州大学伯克利分校、卡内基梅隆大学、斯坦福大学等机构提出PRISM,把少量真人示范扩成数百段反事实视频,再转成可训练的人形机器人轨迹。策略不做真实世界微调,也能让机器人拾取、搬运并放下未见过的箱子、桶、筐和球。
Scale AI、Hugging Face、南加州大学、斯坦福大学等机构联合提出新方法,把双臂机器人的长任务拆成可预测的下一步,并公开4万多段密集标注轨迹。新策略在论文设定的空间消歧任务中把成功率从32%提高到100%,还把未见长任务的成功
香港科技大学(广州)、粤港澳大湾区数字经济研究院、香港科技大学等机构提出SatNav,用卫星影像构建城市级无人机语言导航测试。系统从18座城市的59个场景生成约11.8万条任务轨迹,平均路径长379米,让模型学习沿道路、水道和地标完成较长距
麻省理工学院、首尔大学、延世大学等机构提出一套“先看到位置、再靠手感抓稳”的机器人方案。机械臂仍可用视觉把手带到物体附近,但真正接触和收拢手指时,手部策略只读自身关节与驱动反馈,不再依赖物体图像或姿态估计。在包含3028种物体的仿真测试中,
加州大学伯克利分校、上海科技大学、Google DeepMind等机构提出HuGo,让大语言模型为人形机器人编写能反复根据观察调整动作的任务代码。机器人底层走路与平衡能力保持不变,上层代码负责决定何时走、伸手和搬物。在论文的低门穿行模拟任务
意大利理工学院与卡耐基梅隆大学等机构提出Imp-ACT,让机械臂不仅学会“手该走到哪里”,也学会碰到物体时“该有多硬、多会让”。操作者演示任务时,系统同步记录动作与自动调节的刚度,再用ACT一起学习。在论文的擦拭实验中,接触力震颤相对高刚度
加州大学伯克利分校提出形态测量模仿框架,先把人手动作跨手形重定向到机械手上并保持接触,再用残差强化学习补齐动力学差异,最后蒸馏成视觉运动策略。仅用3双手、10段手物交互视频,就在300次真机试验、30个未见物体上取得89.3%的零样本成功率
加州大学伯克利分校AUTOLab提出TRACE,让机器人把“看”和“拨弄”结合起来追踪杂乱电缆,遇到分叉和缠绕就主动拨开再判断。110次物理实验显示,在最多4根线、40个交叉点的复杂场景里,正确追踪长度比例从约60%提升到约90%。数据中心
韩国技术教育大学提出DAWN,把对噪声的抵抗力直接做进世界模型:喂给编码器的是带噪深度,重建目标却是干净深度,再用对比学习对齐两者。在Unitree Go1上,它不做任何手工滤波校准,零样本跨过70厘米缝隙、登上45厘米台阶。传感器再脏,机
南京大学联合蚂蚁集团、浙江大学提出KnowBody,在不改动视觉语言模型权重的前提下,让机器人拥有一份可查询、可修订的身体关系说明书。四个真机任务、32次固定预算试验中,完成率从原生工具的25%提升到75%。脑子很聪明的VLM终于补上了身体
南加州大学联合布朗大学、复旦大学、丰田研究院提出Rolling-WAM,让世界动作模型像滚动窗口一样边想象边出动作,不必每次从头算完。它在LIBERO、RoboTin和Unitree G1真机上保持有竞争力的操作表现,稳态重新规划速度提升4
MIT联合英伟达、新加坡国立大学、宾夕法尼亚大学提出RAPID。机器人只需看一遍人类的视觉演示,就能自动生成、验证并精化自己的控制程序,8项接触丰富的真机任务平均成功率达75.9%。机器人新技能的部署有望不再依赖工程师逐行写代码。
字节跳动Seed、耶鲁大学、普林斯顿大学、卡内基梅隆大学等机构提出EmbodiedSWE,让编程智能体先在仿真中为长时序机器人任务写出可验证解法,再将单个解法扩展成多样训练轨迹。仅用这些仿真示范微调的VLA最终完成了一项真机长时序任务。
明尼苏达大学提出PointCast,用同一种3D点集表示预测刚体、布料、绳索和多关节柜体在机器人动作后的变化。架构只有19.8M参数,在仿真四类体系中三类排名第一、刚体排名第二,并能冻结后放进模型预测控制器中规划动作。
Noetix Robotics、清华大学提出DAVIS,让人形机器人仅根据头戴深度图、本体历史和任务指令,直接输出25自由度关节目标。系统在仿真与Noetix E1真机上展示了定向射门和盘带,运行时不需要额外的视觉检测或路径规划模块。
斯坦福大学、普林斯顿大学提出TANDEM,让任务与运动规划器先做掉熟悉步骤,只在能力缺口处请人遥操。在一项代表性长时序任务中,相同人工介入时间能采集2.9倍示范;每项20条示范微调后,五项任务平均成功率从0%升至60%。
香港大学、香港科技大学、普林斯顿大学、加州大学圣迭戈分校提出NowWAM:不再让生成模型预测未来画面,而是在当前画面的去噪过程中直接学动作。它把训练视觉token从784减至392,单步耗时从2.85秒降至1.63秒,同时在LIBERO-P
英伟达、加州大学圣迭戈分校、南加州大学做出了一套通用机器人插装世界模型。它用90种几何形状不同的零件训练,面对没见过的测试零件时,零样本成功率达56%,无模型基线只有7%。这类能力直接对应高混线上频繁换件的应用难题。