论文导读
伊利诺伊大学厄巴纳-香槟分校、宾夕法尼亚大学、斯坦福大学、剑桥大学等机构联合提出Kirin,从野外视频重建四足动物3D动作,再按文字和图片生成可直接驱动网格的动画。项目展示了多物种动作和基线对比,降低动物动作采集门槛;效果仍受视频遮挡、重建质量和输入3D模型约束。
动物动作很难像人类一样进棚采集
人类动作可以穿戴标记点,在固定摄影棚中反复表演。多数动物无法按脚本配合,体型和骨架差异也更大,因此现有动物动作数据往往规模小、物种单一,动画模型缺少可复用的运动先验。
Kirin把大量野外视频变成训练材料。项目主视觉把斑马、牛、犀牛等真实画面与生成的3D动物并列,动作由文字和参考图共同控制,参考图负责告诉模型是哪种身体结构,文字描述要做什么动作。
图:项目主视觉展示参考动物图、文字动作描述和生成网格动画。
视频、文字和3D动作对齐成AiM3D
系统先用现成四足动物重建方法估计关节运动,再用三维跟踪恢复动物在场景中的整体位移。局部关节和全局移动分开求解后合并,并对抖动和尺度做修正,得到可以跨视频使用的运动序列。
每段动作再配上文字描述和原视频帧,组成AiM3D的视频—文本—动作三元组。数据示例能看到同一行里的自然视频、重建骨架与动作描述,便于检查重建是否真的跟上动物,而不是只保留一个粗略类别标签。
图:项目数据图把文字描述、野外视频帧和对应3D动作放在同一行。
一张图决定骨架,文字决定怎么动
生成模型同时接收文字和动物图片。文字给出行走、转头或奔跑等动作意图,图片约束物种、比例和骨架形态。论文对比显示,只用文字的基线可能出现动作不符或骨架形状不稳定,图像条件能让不同动物呈现更合适的步态。
图:项目图展示初始重建、关键点与平滑修正以及全局位移恢复。
生成动作随后被绑定到图生3D得到的网格,形成可渲染动画。对比案例中,基线在部分输入上动作很小,Kirin生成的网格出现更明显且符合文字的运动;这些是可视化案例,不能说明每个物种和复杂动作都稳定成功。
图:项目页比较相同文字和图片条件下Kirin与Puppeteer的网格动作。
向动画制作和行为研究扩展
动画制作可以把这类模型用于快速制作动物预演,再由动画师修正脚底滑动、碰撞和重心。行为研究则更关心重建轨迹是否保留真实速度、步态周期和转向,不能直接使用追求观感的生成结果替代测量数据。
下一步需要公开按物种、视角、遮挡和运动速度划分的误差,并测试长动作拼接。自动绑定还应报告网格穿插、脚掌接地和骨架失败率,才能判断从一张图片到最终动画中,错误主要来自重建、生成还是绑定。