arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AXIS:用于可扩展机器人操作的可增长社区驱动数据引擎

AXIS: A Growable Community-Driven Data Engine for Scalable Robot Manipulation

Mengfei Zhao, Dihong Huang, Yikai Tang, Peihao Li, Mingxuan Yan, Ruiqi Zhuang, Yanjia Huang, Jie Wang, Hai Zhai, Tony Zhou, Rui Zhang, Zhexi Luo, Yuchen Huang, Jianfei Yang, Jiachen Li

arXiv 2607.21588首次发表:更新:

发表机构

Axis Robotics; University of California, Berkeley; Georgia Institute of Technology; Texas A&M University; Johns Hopkins University; University of Pennsylvania; University of Michigan; National University of Singapore; Nanyang Technological University(轴机器人公司; 加州大学伯克利分校; 佐治亚理工学院; 德州农工大学; 约翰·霍普金斯大学; 宾夕法尼亚大学; 密歇根大学; 新加坡国立大学; 南洋理工大学)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

研究针对机器人操作策略学习中数据管道难扩展的问题,提出AXIS这一可增长社区驱动数据引擎,它能收集、处理数据并组织成任务快照,通过实验表明其能提升模型性能且随数据量增加有一致扩展性。

AI 中文摘要

学习有效的机器人操作策略需要多样、高质量的演示,但现有数据管道因依赖专业硬件、集中式操作员或固定任务套件而难以扩展。我们提出了AXIS,一个用于可扩展机器人学习的可增长社区驱动数据引擎和基准。它支持基于浏览器的远程操作以收集大规模演示,自动生成并验证新操作任务,通过自动成功检查、质量过滤等将社区收集的演示转化为可训练数据。AXIS数据集目前包含207个不同任务和50K+轨迹,还将数据组织成任务快照并通过系统的留出协议评估策略。我们在统一的AXIS评估套件下比较视觉-语言-动作(VLA)策略并分析不同数据量下的扩展行为。在AXIS上持续预训练大幅提高了π0.5的总体成功率,比在RoboCasa365上预训练的模型性能优37.3%,且随着数据量增加呈现一致的扩展性。

英文摘要

Learning effective robot manipulation policies requires diverse, high-quality demonstrations, yet existing data pipelines are often difficult to scale because they rely on specialized hardware, centralized operators, or fixed task suites. We present AXIS, a growable community-driven data engine and benchmark for scalable robot learning, which enables browser-based teleoperation for large-scale demonstration collection, automatically generates and validates new manipulation tasks, and transforms community-collected demonstrations into training-ready data through automated success checking, quality filtering, trajectory smoothing, and visual and physics-based augmentation. The AXIS dataset currently contains 207 diverse tasks and 50K+ trajectories. Meanwhile, AXIS organizes data into task snapshots and evaluates policies with a systematic held-out protocol. We compare vision-language-action (VLA) policies under a unified AXIS evaluation suite and analyze scaling behavior across different data volumes. Continual pretraining on AXIS substantially improves the overall success rate of $π_{0.5}$ by 5.8%, outperforms the model pretrained on RoboCasa365 by 37.3%, and exhibits consistent scaling with increasing data volume, with the largest gains observed under layout, sensor-noise, and camera perturbations.

CommentsProject Website: https://axisaiorg.github.io/AXIS-V1/

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑