arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

机器人感知、动作、操作与具身学习。

2609.15570 具身智能与机器人

机器人预测未来只用一步,DIDO在LIBERO成功率做到99%

中科院自动化所、智源研究院、西安交通大学和亚马逊提出DIDO,把多步视频世界动作模型压缩成一次去噪。它在LIBERO平均成功率达到99.0%,LIBERO-Plus为76.6%,RoboTwin为92.0%;99%是仿真基准成绩,真实机器人

中科院自动化所、智源研究院、西安交通大学、亚马逊等
文章封面
2609.14156 具身智能与机器人

UCLA把触觉画进画面,机器人实机成功率平均提升30个百分点

加州大学洛杉矶分校提出Visible Touch,把接触位置渲染成机器人视觉策略能直接读取的画面标记,不必另建触觉编码器。接上团队自制的低成本磁传感器后,π0.5在四项真实接触任务中的成功率平均提高30个百分点;这个结果只对应论文测试的任务

加州大学洛杉矶分校等
文章封面
2609.12081 具身智能与机器人

清华等让机器人边走边拿,四项实机任务成功率76.3%

清华大学、Xspark AI、香港科技大学(广州)、香港大学提出MoPA,让移动机器人不必停稳后再伸手,而是在行进中持续观察和操作。四项真机任务平均完整成功率76.3%,比最强基线高12.5个百分点;实验仍是室内受控任务,尚未证明在人群和开

清华大学、Xspark AI、香港科技大学(广州)、香港大学等
文章封面
2609.12433 具身智能与机器人

北大&银河通用让机器人学叠衣,纯合成训练实机成功率超90%

北大前沿计算研究中心、银河通用机器人提出FoldNet++,让双臂机器人只看合成演示就学会展开和折叠T恤,真机端到端成功率超过90%。这意味着难采、慢采的真实机器人数据有机会被大规模仿真替代;不过实验集中在T恤和受控桌面,不能直接外推到所有

北大前沿计算研究中心、银河通用机器人等
文章封面
2609.11382 具身智能与机器人

6架无人机高速互避,EPFL、港科大公开整套集群软硬件

洛桑联邦理工学院、香港科技大学提出SwarmNxt,把无人机硬件组装、批量软件部署、ROS 2导航、规划和深度估计整理成开放平台。6架无人机完成高速互避,4架在障碍环境集体飞行;两组实验都在8×8×4米室内运动捕捉场地进行。

洛桑联邦理工学院、香港科技大学等
文章封面
2609.11775 具身智能与机器人

不用强化学习,ETH灵巧手18秒学会指内握笔,误差0.6毫米

苏黎世联邦理工学院软体机器人实验室提出一套实时控制方法,让灵巧手只靠手指转动握住的笔,不用强化学习、仿真训练或预采集演示。控制器在笔记本CPU上约18秒完成初始化,实体手多次书写的平均平面误差为0.6毫米;速度提高后误差会明显变大。

苏黎世联邦理工学院等
文章封面
2609.10915 具身智能与机器人

机器人不再走走停停:IMLE-VLA把动作推理从15Hz拉到55Hz

西蒙菲莎大学、宾夕法尼亚大学、阿尔伯塔机器智能研究院提出IMLE-VLA,把机器人动作头从10次迭代采样改成一次生成,推理频率由15Hz升至55Hz。它在LIBERO平均成功率98.0%,真机也更顺更快;98.0%属于仿真基准,真机只验证4

西蒙菲莎大学、宾夕法尼亚大学、阿尔伯塔机器智能研究院等
文章封面
2609.10050 具身智能与机器人

伯克利把1500段AI视频变成灵巧手训练动作

加州大学伯克利分校、Sharpa Robotics、香港大学等机构提出GALATEA:先让视频模型生成手与物体的动作,再把画面重建成仿真可执行轨迹。团队落地超过1500段生成视频,仿真训练成功率较基线高出25个百分点以上,并做了真机闭环演示

加州大学伯克利分校、Sharpa Robotics、香港大学等
文章封面
2609.10137 具身智能与机器人

机器人一只手拧瓶盖,3种装配任务直接上真机

香港大学、香港科技大学(广州)、苏黎世联邦理工学院等机构的研究团队让一只灵巧手独立完成瓶子、注射器和马克笔三种双零件装配,策略只在仿真中训练,随后直接迁移到真机。它不借助第二机械臂或外部夹具,但实验对象都是刚性零件,距离杂乱工位上的通用装配

香港大学、香港科技大学(广州)、苏黎世联邦理工学院等
文章封面
2609.06009 具身智能与机器人

机械手学会预判人类会喊停的动作,抓取成功率做到96.7%

香港科技大学(广州)、意大利技术研究院、浙江大学联合提出WHIRL,让机械手把人类接管动作当成风险信号,提前避开操作者可能喊停的状态。16自由度LEAP Hand在指定复杂抓取任务中做到96.7%成功率,按操作步数计算的人工干预最多减少84

香港科技大学(广州)、意大利技术研究院、浙江大学等
文章封面
2609.06251 具身智能与机器人

北大等让宇树G1边走边干活,完整任务成功率提高10个百分点

北京大学、华南理工大学、新加坡国立大学联合提出MobileVLA-R1 2.0,让移动机器人先理解指令和环境,再输出能执行的导航与操作命令。宇树G1在论文设定的真实移动操作任务中,完整任务成功率比上一版提高10个百分点。它回答的是机器人怎样

北京大学、华南理工大学、新加坡国立大学等
文章封面
2609.04802 具身智能与机器人

24小时视频压缩26.1倍,南大华为让机器人记住物体去向

南京大学、华为、天津大学与不列颠哥伦比亚大学团队提出语言轨迹编码LTE,把长视频中的物体位置、状态与语义压成可查询记忆。论文报告8.7至26.1倍压缩,24小时视频查询低于1秒;但在SMB上的两类成功率只有45.3%和48.7%,长时记忆远

南京大学、华为、天津大学、不列颠哥伦比亚大学等
文章封面
2609.04355 具身智能与机器人

机器人练45.8分钟做到98.3%,中科大等团队攻克精密操作

中国科学技术大学、北京航空航天大学、中关村学院与合肥星旋科技团队提出VLA-Precision,让机器人直接在真实设备上在线练习高精度化学操作。论文在四种机器人、九项任务上报告98.3%平均成功率,每项平均训练45.8分钟;这些数字来自受控

中国科学技术大学、北京航空航天大学、中关村学院、合肥星旋科技等
文章封面
2609.03889 具身智能与机器人

浙大等让轮腿机器人不用力传感器也会擦白板、开带闭门器的门

浙江大学、上海人工智能实验室、清华大学、云深处科技等机构提出FWBC-VLA,让轮腿机器人无需加装力传感器,也能估计接触强度并调整全身动作。系统用5000余条数据训练,在实机上完成擦白板和开启带闭门器的门;验证只覆盖这两类接触任务。

浙江大学、上海人工智能实验室、清华大学、云深处科技等
文章封面
2609.04193 具身智能与机器人

清华、中科院等给机器人视觉补上物理结构,零样本成功率最高87.8%

中国科学院自动化研究所、清华大学、复旦大学、新加坡国立大学等机构提出GIFT,训练机器人策略时强制中间视觉特征保留几何、可操作区域和目标位置。三种配置在LIBERO-Plus零样本迁移中最高达到87.8%;实机结果覆盖论文设置的单臂、双臂操

中国科学院自动化研究所、清华大学、复旦大学、新加坡国立大学等
文章封面
2609.02653 具身智能与机器人

浙大让机器人少想多做:只在关键节点推理,也能守住长流程意图

浙江大学、上海交通大学、诺埃马特里斯、无尽人工智能等机构联合提出HINT,让机器人只在操作阶段切换时重新理解指令,随后用多视角定位和跟踪维持目标。框架在3项长流程任务、2种基础策略及多类未见变化中提高任务进展和端到端成功率;证据仍来自指定分

浙江大学、上海交通大学、诺埃马特里斯、无尽人工智能等
文章封面
2609.02546 具身智能与机器人

智元机器人等测14种机型:只加5%目标数据,迁移进展升13.4点

智元机器人、北京大学、中国人民大学、香港大学等机构联合提出ZETA,用14种保留机型研究视觉语言动作模型能否跨机器人迁移。仅在预训练中加入5%目标机型数据,平均任务进展就提高13.4个百分点,说明“完全没见过”和“预训练见过少量”必须分开报

智元机器人、北京大学、中国人民大学、香港大学等
文章封面
2609.01961 具身智能与机器人

伯克利让达芬奇机器人双臂清创:成功率92%,每小时处理473个碎片

加州大学伯克利分校、直觉外科公司等机构联合提出MACAW,让达芬奇研究机器人用视觉伺服对准碎片,再以单目图像控制抓取深度。双臂设置在物理实验中达到92%成功率,平均7秒处理一个碎片、折合每小时473个;实验使用研究平台和仿真组织碎片,不能视

加州大学伯克利分校、直觉外科公司等
文章封面
2609.01518 具身智能与机器人

人形机器人34秒推门、45秒分球,行为还能现场改

佛罗里达人机认知研究所、西佛罗里达大学提出一套可在机器人运行时编辑的行为系统。Unitree H1-2和自研Alex人形机器人完成六类真实任务,其中推门穿越用时34秒,在人为干扰下分拣六个彩球用时45秒。

佛罗里达人机认知研究所、西佛罗里达大学等
文章封面
2609.01596 具身智能与机器人

南洋理工让机器人装电脑,五项亚毫米任务成功率82%

南洋理工大学团队提出Facet-0,让机器人在电脑部件装配中同时预测动作和接触后果。系统在五项亚毫米任务上的平均成功率达到82%,论文报告的最强匹配基线为15%,放置精度为0.5毫米,命令延迟为50毫秒。

南洋理工大学等
文章封面
↑