arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

人和动物共用一个动作模型,14.6万段动作跨过骨骼差异

作者:arXivDaily编辑部 arXiv 2609.12342 cs · cs.CV · cs.GR

论文导读

澳大利亚国立大学、阿德莱德大学、西湖大学、香港科技大学(广州)提出UniMo,用统一表示学习人和动物动作。配套UniML3D包含145907段动作与433388条描述,动物规模约为AnimalML3D的102倍;数据主要来自既有与合成资源,生成质量不能等同于真实生物运动学验证。

人形骨架规则,到了动物身上就失效

文字生成人体动作已经能处理“向前跑并挥手”,因为多数人体数据共享相近的关节数量和连接方式。动物差异大得多:四足、鸟类和爬行动物的骨骼拓扑不同,同一个关节编号没有统一含义。传统方法往往为每类骨架训练一套模型,数据和能力难以共享。

UniMo不强迫所有物种套进人体骨架,而是把每一帧表示成带语义的三维点集合。模型关注点在哪里、如何运动以及点之间的关系,从而减少对固定关节表的依赖。

论文图:同一模型根据文字生成多种人类与动物动作,展示跨骨骼结构的统一表示。

先抹平格式,再保留结构差异

统一表示并不意味着忽略骨骼。方法为每个点加入局部结构和物种条件,让模型知道哪些点属于同一肢体、运动范围有何不同。训练时,人类与动物动作进入同一个生成框架,公共的速度、节奏和方向知识可以共享,特定结构则由条件信息区分。

文字描述也被统一整理。比如“熊向前奔跑”和“人向前奔跑”都包含前进与节奏信息,但四肢摆动方式不同。模型可以共享语言中的动作概念,再生成符合目标骨骼的轨迹。

论文图:UniML3D汇集不同骨骼与物种的动作,并与既有动作数据集比较规模。

14.6万段动作扩大跨物种训练

UniML3D共含145907段动作和433388条文字描述。论文报告,动物动作与描述规模超过AnimalML3D约102倍。更大的覆盖让研究者能在同一设置下训练和比较人类、四足及其他动物,而不是依赖零散的小数据集。

实验考察文字与动作匹配、动作自然度和多样性。统一模型能够跨骨骼生成,并在论文给出的基线上取得有竞争力的结果;用户研究也用于补充自动指标,因为一个轨迹数值合理,不一定在人眼看来像真实动物。

论文图:不同骨骼的动作先编码为点云表征,再结合骨骼模板解码回对应的人或动物动作。

数据规模不等于生物真实性。部分动作经过重定向或合成,不同物种的关节限制和肌肉动力学也未被完整建模。因此它更适合动画与生成研究,不能直接当作机器人控制或动物行为学依据。

下一步是让动作真正接触环境

统一动作模型可降低游戏、影视和虚拟世界为每个物种单独制作数据的成本。下一步应加入地面接触、碰撞、体型和动力学约束,让奔跑不打滑、跳跃能落地,也让动作能适应坡地和障碍。

另一条路线是支持用户给出参考视频或少量关键帧,在保持骨骼合法的前提下迁移动作。只有从“看起来像”走向“与环境相互作用也合理”,跨物种生成才能进入高质量制作流程。

参考资料

https://arxiv.org/abs/2609.12342

https://arxiv.org/html/2609.12342