arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

机器人感知、动作、操作与具身学习。

2609.39403 具身智能与机器人

小鹏给人形机器人看1万小时人类视频,6项新任务成功率55%

小鹏机器人提出IronMind,用低成本头戴设备收集人类第一视角操作,不经人体骨架重定向就转成相机空间动作。预训练数据从250小时扩到1万小时后,6项未见真机任务的成功率达到55.0%;数字来自指定平台和协议。

小鹏机器人等
文章封面
2609.39601 具身智能与机器人

小鹏4B视觉模型硬刚更大对手,34项基准平均73.68%

小鹏、北京大学与香港大学提出GroundingPI,把点、框、掌握点和密集定位收进同一个4B视觉骨干。它在34项定位基准上平均73.68%,还在机器人与驾驶任务中展现数据效率;这些结论局限于论文设定的模型、数据和评测。

小鹏、北京大学、香港大学等
文章封面
2609.38172 具身智能与机器人

几段真人视频喂出搬运工:人形机器人没做实机微调也能搬箱子

亚马逊FAR、加州大学伯克利分校、卡内基梅隆大学、斯坦福大学等机构提出PRISM,把少量真人示范扩成数百段反事实视频,再转成可训练的人形机器人轨迹。策略不做真实世界微调,也能让机器人拾取、搬运并放下未见过的箱子、桶、筐和球。

亚马逊FAR、加州大学伯克利分校、卡内基梅隆大学、斯坦福大学等
文章封面
2609.36416 具身智能与机器人

双臂机器人自己拆任务:4万段轨迹把成功率从32%推到100%

Scale AI、Hugging Face、南加州大学、斯坦福大学等机构联合提出新方法,把双臂机器人的长任务拆成可预测的下一步,并公开4万多段密集标注轨迹。新策略在论文设定的空间消歧任务中把成功率从32%提高到100%,还把未见长任务的成功

Scale AI、Hugging Face、南加州大学、斯坦福大学等
文章封面
2609.31507 具身智能与机器人

港科大NeurIPS 2026打造无人机长程导航基准:11.8万航迹覆盖18城,卫星视角直通实机

香港科技大学(广州)、粤港澳大湾区数字经济研究院、香港科技大学等机构提出SatNav,用卫星影像构建城市级无人机语言导航测试。系统从18座城市的59个场景生成约11.8万条任务轨迹,平均路径长379米,让模型学习沿道路、水道和地标完成较长距

香港科技大学(广州)、粤港澳大湾区数字经济研究院、香港科技大学等
文章封面
2609.31323 具身智能与机器人

MIT颠覆传统机械手抓取:闭眼摸索就能稳稳拿捏,3000种物体盲抓成功率95%

麻省理工学院、首尔大学、延世大学等机构提出一套“先看到位置、再靠手感抓稳”的机器人方案。机械臂仍可用视觉把手带到物体附近,但真正接触和收拢手指时,手部策略只读自身关节与驱动反馈,不再依赖物体图像或姿态估计。在包含3028种物体的仿真测试中,

麻省理工学院、首尔大学、延世大学等
文章封面
2609.30594 具身智能与机器人

伯克利DeepMind让大模型写全身策略:人形机器人自主穿门推箱,成功率达100%

加州大学伯克利分校、上海科技大学、Google DeepMind等机构提出HuGo,让大语言模型为人形机器人编写能反复根据观察调整动作的任务代码。机器人底层走路与平衡能力保持不变,上层代码负责决定何时走、伸手和搬物。在论文的低门穿行模拟任务

加州大学伯克利分校、上海科技大学、Google DeepMind等
文章封面
2609.31225 具身智能与机器人

CMU与IIT把变阻抗装进ACT:机械臂擦拭震颤暴降180倍,精密操作终于不硬怼

意大利理工学院与卡耐基梅隆大学等机构提出Imp-ACT,让机械臂不仅学会“手该走到哪里”,也学会碰到物体时“该有多硬、多会让”。操作者演示任务时,系统同步记录动作与自动调节的刚度,再用ACT一起学习。在论文的擦拭实验中,接触力震颤相对高刚度

意大利理工学院、卡耐基梅隆大学等
文章封面
2609.28660 具身智能与机器人

伯克利让机器人偷师人手:300次真机试验零样本成功率89.3%

加州大学伯克利分校提出形态测量模仿框架,先把人手动作跨手形重定向到机械手上并保持接触,再用残差强化学习补齐动力学差异,最后蒸馏成视觉运动策略。仅用3双手、10段手物交互视频,就在300次真机试验、30个未见物体上取得89.3%的零样本成功率

加州大学伯克利分校等
文章封面
2609.29103 具身智能与机器人

伯克利机器人解乱线:40个交叉点下追踪正确率从60%干到90%

加州大学伯克利分校AUTOLab提出TRACE,让机器人把“看”和“拨弄”结合起来追踪杂乱电缆,遇到分叉和缠绕就主动拨开再判断。110次物理实验显示,在最多4根线、40个交叉点的复杂场景里,正确追踪长度比例从约60%提升到约90%。数据中心

加州大学伯克利分校AUTOLab等
文章封面
2609.29092 具身智能与机器人

视觉全是噪点也能跑酷:四足机器人零样本跨过70厘米缝隙

韩国技术教育大学提出DAWN,把对噪声的抵抗力直接做进世界模型:喂给编码器的是带噪深度,重建目标却是干净深度,再用对比学习对齐两者。在Unitree Go1上,它不做任何手工滤波校准,零样本跨过70厘米缝隙、登上45厘米台阶。传感器再脏,机

韩国技术教育大学等
文章封面
2609.28530 具身智能与机器人

蚂蚁南大给机器人补身体常识,32次试验完成率从25%飙到75%

南京大学联合蚂蚁集团、浙江大学提出KnowBody,在不改动视觉语言模型权重的前提下,让机器人拥有一份可查询、可修订的身体关系说明书。四个真机任务、32次固定预算试验中,完成率从原生工具的25%提升到75%。脑子很聪明的VLM终于补上了身体

南京大学、蚂蚁集团、浙江大学等
文章封面
2609.30247 具身智能与机器人

机器人边想边动有多快?Rolling-WAM重新规划提速4.5倍

南加州大学联合布朗大学、复旦大学、丰田研究院提出Rolling-WAM,让世界动作模型像滚动窗口一样边想象边出动作,不必每次从头算完。它在LIBERO、RoboTin和Unitree G1真机上保持有竞争力的操作表现,稳态重新规划速度提升4

南加州大学、布朗大学、复旦大学、丰田研究院等
文章封面
2609.30249 具身智能与机器人

给英伟达MIT机器人看一遍就会写代码,8项真机任务成功率75.9%

MIT联合英伟达、新加坡国立大学、宾夕法尼亚大学提出RAPID。机器人只需看一遍人类的视觉演示,就能自动生成、验证并精化自己的控制程序,8项接触丰富的真机任务平均成功率达75.9%。机器人新技能的部署有望不再依赖工程师逐行写代码。

MIT、英伟达、新加坡国立大学、宾夕法尼亚大学等
文章封面
2609.27308 具身智能与机器人

编程Agent开始教机器人,字节Seed把代码解法变训练数据

字节跳动Seed、耶鲁大学、普林斯顿大学、卡内基梅隆大学等机构提出EmbodiedSWE,让编程智能体先在仿真中为长时序机器人任务写出可验证解法,再将单个解法扩展成多样训练轨迹。仅用这些仿真示范微调的VLA最终完成了一项真机长时序任务。

字节跳动Seed、耶鲁大学、普林斯顿大学、卡内基梅隆大学等
文章封面
2609.28393 具身智能与机器人

机器人先在脑中试错:一个模型同时管硬物、布和绳

明尼苏达大学提出PointCast,用同一种3D点集表示预测刚体、布料、绳索和多关节柜体在机器人动作后的变化。架构只有19.8M参数,在仿真四类体系中三类排名第一、刚体排名第二,并能冻结后放进模型预测控制器中规划动作。

明尼苏达大学等
文章封面
2609.28175 具身智能与机器人

清华让人形机器人只看深度图踢球,直接25自由度

Noetix Robotics、清华大学提出DAVIS,让人形机器人仅根据头戴深度图、本体历史和任务指令,直接输出25自由度关节目标。系统在仿真与Noetix E1真机上展示了定向射门和盘带,运行时不需要额外的视觉检测或路径规划模块。

Noetix Robotics、清华大学等
文章封面
2609.28314 具身智能与机器人

机器人不会再求助,斯坦福把人工示范效率提2.9倍

斯坦福大学、普林斯顿大学提出TANDEM,让任务与运动规划器先做掉熟悉步骤,只在能力缺口处请人遥操。在一项代表性长时序任务中,相同人工介入时间能采集2.9倍示范;每项20条示范微调后,五项任务平均成功率从0%升至60%。

斯坦福大学、普林斯顿大学等
文章封面
2609.28339 具身智能与机器人

不预测未来画面,机器人训练反而快1.8倍

香港大学、香港科技大学、普林斯顿大学、加州大学圣迭戈分校提出NowWAM:不再让生成模型预测未来画面,而是在当前画面的去噪过程中直接学动作。它把训练视觉token从784减至392,单步耗时从2.85秒降至1.63秒,同时在LIBERO-P

香港大学、香港科技大学、普林斯顿大学、加州大学圣迭戈分校等
文章封面
2609.28258 具身智能与机器人

英伟达让机器人首见零件就会插,成功率从7%拉到56%

英伟达、加州大学圣迭戈分校、南加州大学做出了一套通用机器人插装世界模型。它用90种几何形状不同的零件训练,面对没见过的测试零件时,零样本成功率达56%,无模型基线只有7%。这类能力直接对应高混线上频繁换件的应用难题。

英伟达、加州大学圣迭戈分校、南加州大学等
文章封面
↑