arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-01-09 至 2026-01-09 共收录 1 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 动作表示与策略 1 篇

2410.24164 2026-01-09 cs.LG cs.RO 81%

$π_0$: A Vision-Language-Action Flow Model for General Robot Control

π₀:一种面向通用机器人控制的视觉-语言-动作流模型

Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn, Niccolo Fusai, Lachy Groom, Karol Hausman, Brian Ichter, Szymon Jakubczak, Tim Jones, Liyiming Ke, Sergey Levine, Adrian Li-Bell, Mohith Mothukuri, Suraj Nair, Karl Pertsch, Lucy Xiaoyang Shi, James Tanner, Quan Vuong, Anna Walling, Haohuan Wang, Ury Zhilinsky

机构 * Physical Intelligence

专题命中 动作表示与策略 :vision-language-action(title);robot foundation model(abstract);分类 cs.RO、cs.LG

AI总结 本文提出了一种基于预训练视觉-语言模型的流匹配架构,用于通用机器人控制,通过零样本学习和微调实现多样任务的执行。

Comments See project website for videos: https://physicalintelligence.company/blog/pi0 Published in RSS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏