arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

机器人感知、动作、操作与具身学习。

2608.30821 视觉与生成

字节Seed把真实房间变成可编辑仿真场景,F-Score升至0.924

字节跳动Seed、北京大学和浙江大学联合提出Lucida,把一段真实室内视频转成仿真可用的场景副本:房间里的物体不仅被重建,还能作为独立3D资产移动和编辑。论文报告其场景F-Score由SAM3D的0.794提高到0.924。

字节跳动Seed、北京大学、浙江大学等
真实室内空间被还原成可编辑仿真场景
2608.29242 具身智能与机器人

小鹏机器人把一段人类视频变成多种机器人训练经验

南洋理工大学、新加坡科技研究局、小鹏机器人和浙江大学等机构提出AnyWorld:不用成对拍摄人类与机器人示范,就能把一段第一视角人类交互重组为不同机器人本体、相机视角和场景下的机器人原生视频。生成数据随后用于RoboCasa GR1桌面基准

南洋理工大学、新加坡科技研究局、小鹏机器人、浙江大学等
人类交互视频被重组为机器人训练经验
2608.28693 具身智能与机器人

清华等让宇树G1边听边做手势,数据集覆盖300多类动作

清华大学、Galbot、北京大学和上海期智研究院等机构联合提出RoboGesture,让宇树G1人形机器人在听取语音时实时生成与内容相符的手势。团队同时建设了覆盖300多类动作的数据集,并把语音理解、流式动作生成和实体安全控制接成一套完整系

清华大学、Galbot、北京大学、上海期智研究院等
宇树G1根据语音实时生成手势的论文封面
2608.28140 具身智能与机器人

四足机器人不抓也能搬椅子,接触引导让它先学会怎么碰

没有机械臂和夹爪,四足机器人也能用肩部、机身或腿接触椅子,把它推到指定位置。比萨大学、苏黎世联邦理工学院、英伟达等机构提出接触引导的多评论家强化学习方法,覆盖推箱、搬椅和开洗碗机三类非抓取移动操作任务。

比萨大学、苏黎世联邦理工学院、英伟达等
文章封面
2608.28578 具身智能与机器人

314美元的五指机器人手来了,Aero Hand把真机和仿真一起开放

一只五指机器人手,16个转动关节由7个电机通过腱绳驱动,论文给出的整手重量为374克、物料成本为314美元。Chestnut Robotics、加州理工学院等机构推出Aero Hand Open,并把机械设计、仿真模型、强化学习环境和真机部

Chestnut Robotics、加州理工学院等
文章封面
2608.27550 具身智能与机器人

机器人只用20%数据反超全量基线,VLAct让新本体更快学会操作

一个机器人模型换到预训练阶段从未见过的人形本体,只用20%的下游轨迹就拿到49.5%的任务成功率,高于GR00T-N1.6使用全部下游数据时的47.6%。这项结果来自VLAct,一套把持续预训练重点从“继续堆机器人数据”转向“先把表示学好”

香港中文大学、上海人工智能实验室等等
文章封面
2608.26583 具身智能与机器人

中科大等让人形机器人走完1.5公里:SOLO零样本穿越户外复杂地形

人形机器人走几级台阶并不罕见,难的是在长距离中持续处理台阶、斜坡、窄落脚点和感知噪声。中国科学技术大学、X-Humanoid、清华大学等机构提出SOLO,仅用胸前深度相机和本体感知零样本部署,完成1.5公里连续户外路线。

中国科学技术大学、X-Humanoid、清华大学等
文章封面
2608.27371 具身智能与机器人

北理工提出ESRP:让机器人只看第一视角重排5400组房间

给机器人一张目标房间的俯视布局,它需要从第一视角找到家具、抓起、搬运并摆到正确位置。北京理工大学提出具身场景重排规划ESRP,并构建ESRP-Bench,包含超过5400组初始—目标场景和8200个物体。

北京理工大学等
文章封面
2608.27456 Agent

美团&上交等打造UrbanGround:把AI智能体放进真实尺度城市

看懂一张街景,并不等于能沿着街道走到目的地。上海交通大学、美团、新加坡国立大学等机构提出UrbanGround,把真实尺度城市地理数据装进可交互的Unity环境,专门检验多模态大模型在连续移动中能否认路、记路并调整路线。

上海交通大学、美团、新加坡国立大学等
文章封面
2608.25872 具身智能与机器人

清华、南科大等让机器人看夹爪形变感知接触,抓取、拧盖和书法均获验证

拧瓶盖时,摄像头能看到机械臂位置,却很难判断软夹爪是否已经压紧;力和触觉传感器又会增加布线、标定和成本。清华大学、南方科技大学、哈尔滨工业大学提出VISTA-Policy,从合规夹爪的三维形变场中提取接触反馈。

清华大学、南方科技大学、哈尔滨工业大学等
文章封面
2608.25659 具身智能与机器人

图灵智新、中科院自动化所等让机器人训练时学3D世界,实机成功率升至52.5%

机器人只模仿动作,可能学会在训练画面里伸手,却没有形成稳定的三维结构与物体运动表示。图灵智新、中科院自动化所、清华大学等机构提出GaussianDream++,训练时要求视觉语言动作模型重建当前3D世界并预测未来,部署时再移除重建头。

图灵智新、中科院自动化所、清华大学等
文章封面
2608.26058 具身智能与机器人

小米、澳门大学让一个模型控制多种机器人,LIBERO成功率98.3%

同一个“把面包拿起来”任务,单臂机器人、双臂机器人和人手使用的关节、控制器与动作维度完全不同。小米具身智能团队、澳门大学提出UCAG-P,把这些动作先换算成相机能观察到的手腕、末端执行器和抓取中心轨迹,再交给不同机器人的运动学模块执行。

小米具身智能团队、澳门大学等
文章封面
2608.24882 具身智能与机器人

清华等让机器人把“未来画面”压成潜动作,延迟降低42.9%

机器人世界动作模型常在执行动作前生成未来画面,用视觉预测帮助控制,但完整视频分支会拉高推理延迟。清华大学、中科院自动化所、TARS Robotics、复旦大学等机构提出LAWA,把未来变化压缩成离散潜动作,推理时不再重建未来像素。

清华大学、中科院自动化所、TARS Robotics、复旦大学等
文章封面
2608.24724 具身智能与机器人

斯坦福、交大、清华给水下机器人装上“海豹胡须”,20次辨路成功17次

鱼游过后,水中会留下持续一段时间的涡流。海豹能用胡须读取这些尾流,在黑暗或浑浊水体里追踪目标。斯坦福大学、上海交通大学、清华大学把这一机制做成光纤布拉格光栅触须,并装到小型水下机器人前端。

斯坦福大学、上海交通大学、清华大学等
文章封面
2608.24572 更多前沿

Meta做了一只光纤传感手套,60Hz捕捉手势、指尖误差4.9毫米

手指被杯子、工具或另一只手挡住时,摄像头很容易丢点;依赖惯性或磁场的传感手套又会遇到漂移和干扰。Meta、西北大学提出一套光纤传感手套,用沿手指铺设的多芯形状传感光纤直接恢复三维曲线,再以60Hz重建完整手部姿态。

Meta、西北大学等
文章封面
2608.22906 视觉与生成

浙大&上海AI实验室等用单目视频实时重建水下,定位误差降低13.2%

水下单目视频不仅缺少尺度信息,还会被光线衰减、散射和颜色偏移干扰。浙江大学、上海人工智能实验室、上海交通大学、清华大学等机构提出AquaFlow,让系统一边接收视频,一边估计相机轨迹并更新3D高斯场景。62条水下轨迹上,平均定位误差比Wat

浙江大学、上海人工智能实验室、上海交通大学、清华大学等
文章封面
2608.23478 具身智能与机器人

浦项科大让机器人先理解动作目的,GR00T成功率从64.3%升至84.7%

行为克隆告诉机器人“这个时刻手臂该怎么动”,却不直接说明这段动作要完成什么局部目标。浦项科技大学提出INDI,用教师视觉语言模型从执行视频中提炼行为意图,再监督VLA动作解码器。SimplerEnv-Bridge上,GR00T-N1.7平均

浦项科技大学等
文章封面
2608.22419 具身智能与机器人

浙大&上交等给机器人训练时遮住部分信息,双臂任务成功率提升超30%

双臂机器人同时读取多个相机画面和语言指令时,更多信息不一定带来更稳定的动作。上海创新研究院、浙江大学、上海交通大学、中国科学技术大学等机构提出M3:训练时随机遮掉部分模态通道,不改模型结构,也不增加大规模机器人预训练。三项真实长程任务中,平

上海创新研究院、浙江大学、上海交通大学、中国科学技术大学等
文章封面
2608.20720 具身智能与机器人

同济&中科院让机器人看一张照片就找把手,覆盖473类物体

“拿住杯把”“按下按钮”“握住喷嘴”都要求机器人把一句自然语言落到物体的具体3D区域。以往方法常假设已经有完整点云和固定动作类别。同济大学与中国科学院提出AffordAny,从一张RGB图片出发重建物体,再根据自由文本定位可操作部位。自动管

同济大学、中国科学院等
文章封面
↑