arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

机器人感知、动作、操作与具身学习。

2608.20735 具身智能与机器人

清华&上海AI实验室等让机械臂预判传送带,抓取完成数从23次增至44次

传送带上的物体不会等机械臂想清楚再进入抓取区。清华大学、上海AI实验室、哈尔滨工业大学和云深处科技联合提出ForeTime-VLA,把世界动作模型看到的未来压缩成训练信号,部署时只看过去八帧。三档速度的实机测试中,它完成44/90次抓取,π

清华大学、上海AI实验室、哈尔滨工业大学、云深处科技等
文章封面
2608.21204 具身智能与机器人

佐治亚理工让机器人从失败中学习,叠杯成功率从40%升到90%

机器人模仿人类示范学会叠杯后,第一次操作失败通常不会让它自动变聪明:失败动作不能直接拿来继续模仿。佐治亚理工提出Q-Planning,冻结原有的数十亿参数行为克隆策略,只训练一个约10亿参数的价值函数。五轮实机自我改进后,叠杯成功率从40%

佐治亚理工等
文章封面
2608.21355 具身智能与机器人

小米机器人学会先掂量再抓,陌生物体成功率达到83.4%

同样是纸杯,空杯需要轻捏,装满后又要增加抓力;外观相近的易拉罐,也可能因为重量不同而滑落。小米机器人团队提出ViTacPhys,让机械手在抓取时显式判断物体的质量等级、刚度和接触摩擦等级,再据此调整动作。真实抓取中,它在训练分布内物体上的总

小米机器人等
文章封面
2608.20087 具身智能与机器人

人形机器人学会职业网球动作,上海AI实验室等让1.7米Atom实机发球

人形机器人把球打出去不算难,既保持职业网球动作风格,又在真实硬件上稳定击球更难。上海人工智能实验室、上海交通大学、诺亦腾机器人、越疆机器人等机构提出AdaPT,从转播视频学习发球与回合动作,并把策略部署到宇树G1和1.7米越疆Atom。

上海人工智能实验室、上海交通大学、诺亦腾机器人、越疆机器人等
文章封面
2608.20114 具身智能与机器人

清华、上海AI实验室等提出DECOWAM,四足机器人动作误差降21.7%

四足机器人装上机械臂后,摄像头会随底盘移动,手臂动作也会改变画面。清华大学、上海人工智能实验室、哈尔滨工业大学、云深处科技等机构提出DECOWAM,分别建模相机自运动、底盘和机械臂动作,再联合预测未来视频与控制。

清华大学、上海人工智能实验室、哈尔滨工业大学、云深处科技等
文章封面
2608.19613 具身智能与机器人

小米汽车、复旦等实测41种方案:机器人隐式动作到底什么最重要

机器人视频很多,带精确动作标签的数据却很少。小米汽车、复旦大学、清华大学、武汉大学等机构联合发表这项系统实证研究:在统一框架中比较41种隐式动作模型设计,追踪哪些选择真正改善下游操作,而不只让视频重建指标更漂亮。

小米汽车、复旦大学、清华大学、武汉大学等
文章封面
2608.18701 具身智能与机器人

清华等做了4000条视触觉演示,让机器人分清软面包和硬物体

机器人把面包放到目标位置,并不代表任务真的成功:抓得太松会滑落,抓得太紧会把软物体压坏,外部相机有时看不出两者差别。拓境智能、清华大学、卡内基梅隆大学等机构提出SoftVTBench,收集4000条视触觉演示,专门评估可变形物体操作中的形变

拓境智能、清华大学、卡内基梅隆大学等
文章封面
2608.18234 具身智能与机器人

人形机器人踩空也能站稳:GigaBrain跌倒恢复率99.3%

人形机器人按着坐椅指令下蹲时,椅子可能已经被移走;踢腿动作也可能让自己的四肢互相碰撞。GigaBrain-WBC-0.5把动作、下一时刻身体状态和下一条可行动作分布放进同一个因果Transformer里,让控制器在执行前识别不合理指令并收回

论文公开页面未披露作者机构
文章封面
2608.19182 具身智能与机器人

英伟达ADEPT训练灵巧手:五次实验全部闯到最高难度

五指机械手要完成插销,得先找到物体、抓稳、在手中调整方向,再把它对准孔位。英伟达、密歇根大学提出ADEPT:先用通用“物体重定向”任务预训练,再用一套稳定后训练方案学习具体操作。论文的Kuka-Allegro插销实验中,五个随机种子全部训练

英伟达、密歇根大学等
文章封面
2608.17027 具身智能与机器人

UCLA等让人形机器人边走边抓:15万条仿真轨迹训练,实机成功率73.3%

让人形机器人走到陌生目标前、保持平衡并伸手抓取,需要把视觉导航、全身控制和操作连在一起。加州大学洛杉矶分校、艾伦人工智能研究所、华盛顿大学等机构提出FetchMan,在超过15万个仿真场景中训练,并把策略零样本部署到真实宇树G1。

加州大学洛杉矶分校、艾伦人工智能研究所、华盛顿大学等
文章封面
2608.18077 具身智能与机器人

英伟达等提出Hydra-0:把机器人动作变成像素流,运动误差降低90.4%

机器人换一副机械臂,原有世界模型往往就要重新学习动作含义。英伟达、布朗大学、哥伦比亚大学、哈佛大学等机构提出Hydra-0,把关节角、末端位姿等机器人专属命令转换成画面中的像素运动轨迹,让不同形态的机器人共享一种视觉动作接口。

英伟达、布朗大学、哥伦比亚大学、哈佛大学等
文章封面
2608.15917 具身智能与机器人

斯坦福MIT等用VR一周采集75小时数据,灵巧手只需1—2小时真机示范

斯坦福大学、麻省理工学院和Scale AI联合提出SPD,把灵巧手的大规模操作数据采集放进VR仿真。5名操作者在一周内积累75小时多任务轨迹,模型预训练后,只用1—2小时真实演示微调,就能迁移到56自由度的双手灵巧机器人上。

斯坦福大学、麻省理工学院、Scale AI等
SPD从VR仿真预训练迁移到真实灵巧手操作
2608.16885 具身智能与机器人

智元等提出τ0-VLA:用40115小时真实数据训练,机器人遇到难题可先多想几步

上海创新研究院、智元Finch和香港中文大学联合提出τ0-VLA,让机器人在决定下一项子任务时按难度分配推理计算:简单步骤直接执行,困难或后果重要的步骤先生成多个候选,再借助世界模型比较。模型使用40115小时异构真实世界数据训练,并在多种

上海创新研究院、智元Finch、香港中文大学等
τ0-VLA执行长流程机器人操作任务
2608.14379 具身智能与机器人

上交提出ReflexVLA:机器人学会预判运动轨迹,专攻6项高速动态任务

静态桌面上慢慢抓取,模型多想半秒未必出事;面对滚动、摆动或即将离开的目标,等图像编码和动作生成完成,机会已经过去。上海交通大学团队提出ReflexVLA,把未来运动预测、多帧视觉融合和低延迟推理放进同一策略,并发布包含6类高速动态任务的Re

上海交通大学等
ReflexVLA机器人预测动态目标并快速操作的封面
2608.14047 具身智能与机器人

星尘智能&清华等提出ART:机器人现场调用视觉工具,成功率提升20%

机器人遇到昏暗环境、透明物体或精细几何关系时,不一定要让一个大模型硬扛所有视觉难题。星尘智能、清华大学、香港中文大学等团队提出ART,让视觉—语言—动作模型在执行过程中按需调用分割、深度等外部视觉工具。基于3万条工具增强轨迹训练后,ART在

清华大学、香港中文大学等
ART机器人调用视觉工具完成复杂操作的封面
2608.11605 具身智能与机器人

机器人不用生成视频也能预演未来:交大等提出ForeWAM,LIBERO成功率超96%

机器人在抓杯子、开抽屉前,如果能预测“动作之后场景会怎样变化”,通常更容易规划下一步。上海交通大学、ACE Robotics和南洋理工大学提出ForeWAM,让动作模型获得未来动态,却不在部署时真正生成未来视频;标准版和加速版在LIBERO

上海交通大学、南洋理工大学等
文章封面
2608.07887 具身智能与机器人

日本团队给机器人装上软硬仿生指尖,贴桌硬币也能抓起6种日元

日本电气通信大学团队设计了一种混合硬度仿生指尖,中央指肚使用软硅胶,两侧换成更硬的材料,内部保留类似指甲的刚性结构。机器人不用先把硬币推到桌边,也不需要在底部留缝,就能从硬平面上抬起硬币。

电气通信大学等
文章封面
↑