arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

不用专用数据也能操纵机械臂!清华腾讯用单样本让VLM成功率飙至73.6%

作者:arXivDaily编辑部 arXiv 2609.22966 cs · cs.RO

论文导读

利用通用多模态大模型控制机械臂通常需要收集成千上万条昂贵的机器人专业轨迹进行专门微调。清华大学联合腾讯混元等机构研发了免微调离散动作映射架构RoboDawn。该系统仅凭单次自然动作示范与原生指令接口,便将现成大模型在物理机械臂上的操作成功率由不足20%大幅跃升至73.6%。

核心背景与数字实体迁移

视觉语言大模型虽然在理解现实图景与复杂日常常识方面展现了卓越的天赋,但如何将其认知智能无缝释放到物理机器人机械臂中一直是业界攻坚难关。以往主流思路往往需要针对特定机械臂型号采集数万次实机遥操数据进行重度微调,不仅训练成本高昂,且一旦机械臂结构或安装位姿微调,模型便彻底失效。清华大学与腾讯混元的研究团队联合提出了名为RoboDawn的全新即插即用控制架构,彻底打破了通用基础模型与物理实体控制之间的壁垒。

RoboDawn的设计哲学在于保持通用大模型原有权重完全冻结,避免宝贵的通用推理常识在专用机械臂微调中发生灾难性遗忘。系统设计了一套符合人类直觉的离散空间动作语言接口,将机械臂的末端平移、轴向旋转与夹爪开合编码为通用大模型最擅长处理的结构化文本指令。

图:将通用视觉语言模型的推理能力映射为离散机械臂控制指令的系统全貌

直觉指令接口与单样本示范

在此基础上,研究团队创新性地引入了上下文单样本动作示范机制。在面对积木堆叠、文具归纳或杯具摆放等新任务时,用户只需在多模态提示词中附带单次成功的操作分解示范,大模型即可结合当前相机视角进行自主类比推理与航点生成。下层轻量逆运动学解算器则负责将离散动作序列转化为平滑连续的关节力矩轨迹,实现了高频稳定的物理闭环追踪。

图:单次动作示范引导下大模型自主完成抓取对准与平稳放置

真实环境操作与精度表现

在覆盖机械拼装、日常收纳与多步工具使用的丰富实机评测中,原本未经具身训练的通用大模型展现出了令人瞩目的操控飞跃。在完全未提供实机微调权重的情况下,系统仅靠单样本提示便将任务平均成功率由基线的20.7%大幅推升至73.6%,超越了众多经过海量数据专门训练的专用具身模型。

图:多类复杂操作任务中的执行成功率与逆向动力学跟踪表现

未来应用与落地展望

这一范式的确立极大地降低了各行各业引入机械臂自主自动化的技术门槛。未来在柔性智能制造、桌面办公助理与商业零售理货等场景中,普通工作人员只需像教实习生一样演示一次,机器人便能立刻上手高效作业。

参考资料

https://arxiv.org/abs/2609.22966

https://github.com/Tencent/RoboDawn