论文导读
东京大学、纽约大学、Google DeepMind和日本理化学研究所等团队做出WetRobo:实验人员只需用自然语言下任务,Codex便观察现场、改写并执行机械臂程序。它在真实实验室完成三项任务,瓶盖任务还跨两个实验室成功;但这些仍是受控设备上的验证,不能等同于通用湿实验自动化。
不是再训练一个模型,而是让智能体现场改程序
传统路线常把遥操作示范收集到本地,再微调视觉—语言—动作模型。实验室一换,桌面、相机和设备位置都可能变化,原策略就可能失效。WetRobo把机械臂、培养箱、试剂瓶、培养皿、已有控制代码、任务示范和通用Skill打成一套可迁移套件。实验人员描述目标后,编码智能体读取现场图像和代码,调用工具完成标定,再生成可执行程序。
图1:WetRobo机械臂执行培养皿开盖,素材来自论文源码。
这里的关键不是让大模型直接输出每个关节动作,而是把它放在软件层:感知环境、选择已有模块、修改参数与控制流程,再观察执行结果。这样更容易利用传统机器人学中成熟的定位、运动规划和安全约束,也能留下可复查的程序。
三项任务都落到真机,瓶盖任务专门做了跨实验室对比
论文报告了提起培养皿盖、移除试剂瓶盖和打开培养箱门三项成功任务。以瓶盖为例,程序会先检查场景和标定,再接近、对齐、尝试抓取,必要时后退并重新定向,最后旋转和抬起。操作时间线显示,智能体并非一次性“猜”出动作,而是把长任务拆成多个可检查阶段。
图2:瓶盖任务包含检查、标定、接近、抓取尝试、重定向和抬起等阶段。
更有意义的是迁移实验:在Lab X示范上微调的VLA能在原实验室工作,却没能迁移到Lab Y;Codex则在两个实验室都完成瓶盖任务。这个结果支持“分发机器人套件、让代码智能体本地适配”的思路,但论文没有给出大规模重复次数,不能据此断言它已全面优于VLA。
下一步:从三项演示走向可审查的实验自动化
培养箱开门展示了系统对新设备位置和视角的适应。机械臂成功抓住把手并拉开门,说明程序层适配可以覆盖部分场景差异。
图3:机械臂在真实实验室完成培养箱开门。
但目前任务对象固定、环境受控,且仍依赖已有代码、示范和工具。真正的生物实验还涉及液体污染、耗材差异、失败恢复与实验安全。WetRobo的贡献更像是提供一个可复现接口:把编码智能体放进机器人软件栈,让跨实验室适配从“重新训练模型”变成“审查并修改程序”。下一步要看它能否在更多设备、更长流程和严格安全约束下保持稳定。若要进入日常实验,系统还需记录每次代码变更、动作日志和人工接管点,并为开盖、加样等高风险动作设置独立权限,让可迁移与可追责同时成立。
参考资料
https://arxiv.org/abs/2609.18435