论文导读
悉尼大学、北京大学、中国科学院大学联合提出ReMoMask-2,让文本生成动作时直接检索模型内部的动作表示,省掉旧版完整两阶段流程。单个掩码Transformer阶段就在HumanML3D、KIT-ML和SnapMoGen实验中超过旧版,并取得论文比较中的最快推理。结果评价的是人体动作基准,不等于真实机器人执行质量。
先找相似动作,再生成新动作
给出“向前走几步后蹲下”这样的文本,动作生成模型要同时理解先后顺序、身体部位和持续时间。检索增强方法会先从动作库找相似示例,再以示例帮助生成。难点是,检索器常用便于比较语义的向量,生成器却在另一套内部表示里工作;同一段动作跨过两套表示后,细节可能丢失。
旧版ReMoMask还会分别处理身体层级和时空关系。它把动作拆成手臂、腿、躯干等部分,检索文本—动作对,再用结构化掩码逼迫模型根据未遮挡部位和文字补出完整动作。效果提高了,但检索结果进入生成器前仍需转换。
图1:论文Figure 1对比旧版跨表征检索和ReMoMask-2在生成器内部潜在表示中直接建库的路径。
把动作库搬进生成器内部
ReMoMask-2用冻结的动作编码器把每段训练动作转成生成器量化前的潜在网格,再汇总成检索键。文本查询由一个轻量投影器映射到同一空间,余弦相似度找到的参考动作已经是生成器能直接读取的格式。
图2:论文Figure 3展示潜在动作库、文本查询投影、拓扑结构掩码和语义时空注意力的连接。
这样做省去把外部语义向量再翻译成生成表示的步骤,参考动作可直接进入掩码Transformer的值通路。原有的身体拓扑掩码和时空注意力继续保留,用来控制哪些身体部位、哪些时间片需要根据文本和参考动作补全。
少一个阶段,FID和速度反而更好
论文在HumanML3D、KIT-ML和SnapMoGen三套数据上测试。检索器在准确率比较中达到作者报告的最佳水平;ReMoMask-2在KIT-ML和SnapMoGen取得最低FID。更有传播力的结果是,单个掩码Transformer阶段已经超过ReMoMask完整两阶段管线,同时获得比较方法中的最快推理。
图3:论文Figure 9把ReMoMask-2与ReMoMask、MoGenTS、TMR等方法生成的动作序列按文本提示并排比较。
FID衡量生成动作分布与真实数据的距离,不直接判断每个动作是否满足物理约束。图中的人体是动作轨迹可视化,不是真人视频,也没有机器人动力学、碰撞和接触反馈。更快的推理说明生成管线变短,不代表输出可直接下发给实体机器人。
从骨架动画走向可控角色与机器人
游戏和虚拟角色可先受益于更快的文本动作生成,尤其是需要批量生成、再由动画师挑选和修改的工作流。后续研究可以把接触点、地面约束和角色骨骼差异加入同一检索空间,让参考动作不仅语义相近,也在速度、方向和身体条件上匹配。若用于机器人,还要经过动作重定向、动力学验证和安全控制,不能把人体骨架基准成绩直接当成机器人成功率。
参考资料
https://arxiv.org/abs/2609.08365