arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

机器人感知、动作、操作与具身学习。

2608.08814 Agent

东大把秋叶原85条街搬进360CityArena,Gemini导航得分仅17.1%

东京大学团队提出360CityArena,用602段360度视频重建东京秋叶原的85条街道,为具身Agent准备了175项城市探索任务。环境保留商店招牌、路口、楼宇和密集街景,不是用简化3D模型搭的规整迷宫。

东京大学等
文章封面
2608.09771 具身智能与机器人

清华&北智院等提出SLIM-0.5B:小模型操控机器人,推理延迟压到60.6毫秒

复旦大学、北京智源人工智能研究院、清华大学和中国人民大学提出SLIM,一个只有0.47B参数的机器人操作策略。它不用大型多模态骨干每个控制步都重做开放域理解,而是学习与动作和状态变化紧密相关的紧凑潜表示。

复旦大学、清华大学、中国人民大学等
文章封面
2608.07045 具身智能与机器人

南大&中国移动提出C2Dex,一段人类视频教灵巧手稳定抓物

人类视频数量巨大,但把其中的手部动作直接复制给机械手,常因手指数量、关节长度和运动范围不同而失败。南京大学与中国移动研究院提出C2Dex,从单目人类视频中提取稳定的物体接触关系,再把它迁移到机器人灵巧手。在DexYCB任务上,其宽松标准成功

南京大学、中国移动研究院等
人类操作与机器人灵巧手复现动作的文章封面
2608.06827 具身智能与机器人

小鹏机器人R2S-EGO让宇树G1学坐下,实机成功率从10%升至82.5%

让人形机器人学会一个动作,麻烦的往往不是动作本身,而是要把机器人搬到不同房间、不同位置反复采集真机画面。小鹏机器人与香港理工大学提出R2S-EGO:只用6次真实采集、共48个第一视角观测,再让生成模型补出策略可能遇到的画面,宇树G1的实机坐

小鹏机器人、香港理工大学等
宇树G1在不同场景执行坐下任务的文章封面
2608.05579 具身智能与机器人

摄像头一挪机器人就失手,ARGUS先把画面统一到同一机位

训练时摄像头在桌面左侧,部署时换到右侧,机器人可能把图像坐标误当成任务空间位置。伊利诺伊大学厄巴纳-香槟分校与哈佛大学提出ARGUS,先把任意视角转换成标准机位,再交给现有视觉动作策略。

伊利诺伊大学厄巴纳-香槟分校、哈佛大学等
摄像头一挪机器人就失手,ARGUS先把画面统一到同一机位文章封面
2608.04196 具身智能与机器人

机器人训练不再盲目堆视频:筛掉95%数据,成功率反而升至61.1%

东京大学、字节跳动Seed、香港大学、上海交通大学和清华大学团队发布SiMDex。它没有扩大机器人模型,也没有增加训练数据量,而是从约3200万段人类第一视角视频中筛出约149万段与目标动作相近的样本,再用于视觉—语言—动作模型后训练。

东京大学、香港大学、上海交通大学、清华大学等
机器人训练不再盲目堆视频:筛掉95%数据,成功率反而升至61.1%文章封面
2608.03727 具身智能与机器人

让机器人先学会看懂动作后的3D变化,实机成功率提高25个百分点

浙江大学、上海交通大学和上海创新研究院等团队提出Track4Action,把机器人演示视频中的3D场景变化变成训练监督。传统模仿学习通常只学习“下一步执行什么命令”,动作让物体、遮挡和相机视角发生了什么变化,并没有被直接写进标签;新方法在四

浙江大学、上海交通大学、上海创新研究院等
让机器人先学会看懂动作后的3D变化,实机成功率提高25个百分点文章封面
2608.01452 具身智能与机器人

斯坦福中大让机器人看一次静态示范,学习抓移动物体

中山大学、斯坦福大学和东南大学团队发布DynamicManip,只用一次静态任务示范生成多种动态操作训练数据。与对照方法相比,系统在论文任务上的平均成功率提高18.4个百分点,策略查询延迟降低32.9%。

中山大学、斯坦福大学、东南大学等
斯坦福中大让机器人看一次静态示范,学习抓移动物体文章封面
2608.02580 具身智能与机器人

阿里通义把人类视频变成18561小时机器人训练数据

阿里巴巴通义千问、中国人民大学、上海科技大学、北京通用人工智能研究院和北京航空航天大学团队发布Ego2Robot,把人类佩戴相机拍下的第一视角操作视频转换为机器人训练数据。整套数据达到18561小时,覆盖15种机器人形态。

上海科技大学、北京通用人工智能研究院、北京航空航天大学等
阿里通义把人类视频变成18561小时机器人训练数据文章封面
2607.29172 具身智能与机器人

Gemini Robotics微调两轮,宇树G1三项任务最高成功率100%

加州大学伯克利分校、Google DeepMind和英伟达研究人员把Gemini Robotics On-Device部署到宇树Unitree G1上,只通过托管微调接口完成两轮闭环训练。三项实机操作的成功率分别升至100%、98%和96%

加州大学伯克利分校等
Gemini Robotics微调两轮,宇树G1三项任务最高成功率100%文章封面
2607.28623 具身智能与机器人

加州理工让宇树G1躲避球,20次投掷躲过19次

加州理工学院研究团队把一套名为PAC-MAN的控制方法部署到宇树Unitree G1上。研究人员从正面向机器人手掷20次球,G1躲过19次,没有摔倒,实机成功率为95%。

加州理工学院等
加州理工让宇树G1躲避球,20次投掷躲过19次文章封面
2607.28625 具身智能与机器人

南洋理工等把真实家庭变成录制棚,150小时多模态数据给具身智能当燃料

机器人要学会做家务,先得看懂人是怎么做家务的。可现有数据要么来自脚本化的实验室演示,要么是网络上没有动作真值的视频,规模与真实感很难兼得。南洋理工大学 S-Lab 与 ACE Robotics 给出的思路,是把真实公寓直接改造成录制棚:一套

南洋理工大学、ACE Robotics等
文章封面
2607.28243 具身智能与机器人

上交、阿里等提出EgoGenesis,合成第一视角视频把双臂机器人成功率拉到70%

机器人学操作,最值钱的画面来自它"自己的眼睛":第一视角相机离夹爪和桌面最近,手与物体的接触关系看得最清楚。但这种数据恰恰最难收集——每条轨迹都要真机执行、人工重置、全程看护,失败还可能撞坏硬件。上海交通大学、阿里巴巴、天机芯智(Tianj

上海交通大学、阿里巴巴、天机芯智、香港科技大学等
文章封面
2607.23784 具身智能与机器人

华盛顿大学&微软让LLM写代码控制机器人:失败可定位、指令可纠错

华盛顿大学、微软研究院和MIT的研究团队提出了ARCHITECT,把机器人策略获取当成一个交互式程序合成任务:LLM编码智能体合成模块化的机器人程序,调用一套感知与控制工具来操作真实机械臂。在Franka Panda机器人上的8个真机任务、

华盛顿大学、微软研究院、MIT等
封面
2607.22535 具身智能与机器人

首尔大学先把机器人画进视频再预测未来,世界模型能适配未见过的机械臂

机器人世界模型通常直接接收关节或末端动作向量,再预测未来画面。换一台机械臂,向量含义和运动学关系都可能变化。首尔大学、RLWRLD团队提出RoFacto:先让控制器把命令变成名义轨迹,再把机器人几何渲染进相机画面,视频模型只学习物体如何响应

首尔大学、RLWRLD等
文章封面
2607.22530 具身智能与机器人

上海科技大学让机器人提前预演触觉,插接和剥离也能生成训练轨迹

机械臂把物体插进狭窄接口时,相机可能看不到接触点,真正决定成败的是压力、摩擦和细微位移。上海科技大学、InstAdapt团队提出ViTacWorld,让世界模型根据机器人动作同时预测未来画面和触觉反馈,再用生成轨迹扩充插接、剥离等任务的训练

上海科技大学、InstAdapt等
文章封面
2607.22434 具身智能与机器人

杜克大学让机器人学会玩影子:21自由度机械手能做手语和动物表演

一只机械手在灯前摆动,墙上的影子可以拼出手势字母,也能模仿鹿、孔雀、鸭子和狼的动作。杜克大学团队让21自由度灵巧手学习“自己的关节怎么改变影子”,再从目标图片或视频反推机械手动作,把影子变成机器人的表达媒介。

杜克大学等
文章封面
↑