arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

Adobe等让视频新物体动起来,交互编辑得分提高43.9%

作者:arXivDaily编辑部 arXiv 2610.08779 cs · cs.CV

论文导读

Adobe研究院、罗切斯特大学提出ALIVE,让后加进视频的物体跟着原有动作参与互动。用户改好第一帧,再写出物体名称,模型就能生成拿杯子、戴耳机、打开电脑等效果。在128例交互编辑测试中,它的综合得分由对比方法的60.24提高到86.71,新物体更能接上原片中的手部动作。

新添的杯子,要真的跟手走

给视频加一只杯子,难点在后面的动作。手伸过来时,杯子应当被握住;手抬起来时,杯子要一起移动;放回桌面后,它又要保持稳定。只让一个物体持续出现在画面里,还远远不够。

ALIVE把目标放在这些接触关系上。它接收原始视频、已经加入物体的第一帧,以及只说明物体身份的文字。第一帧给出杯子长什么样、放在哪里,后续怎样行动则要从原视频推断。论文展示的新增物体包括杯子、耳机、笔记本电脑和面团,分别涉及拿起、佩戴、打开和切割。

这类编辑还必须保住原片的其他内容。手的运动、背景和原有物体不能为了配合新道具随意改变,否则用户得到的就不再是对原片的局部编辑。

图:杯子、耳机、电脑与面团的原片、首帧编辑及不同方法后续帧对照。

先把有物体、没物体的视频配成对

团队准备了35800组编辑对,让每组视频围绕目标物体是否存在形成对照,同时尽量保留周围动作。数据来自三维渲染、模型生成、真实视频和一般编辑素材,分别有14362、5896、8542和7000组。

训练时,模型同时看原片和目标画面的信息,改好的第一帧保持不变。它学习怎样把一个物体接入已有动作,而不是仅凭一段文字重新拍一条视频。论文中的实现基于LTX-2.5,新增物体的外观和初始位置由图像条件约束。

团队还训练了一个看图读视频的模型,为不同时间段补出交互提示。比如先握住杯子,再抬起,最后放下。这些提示由与基础编辑器相同的输入预测,用户不用逐帧补写动作说明。

图:原视频与目标帧信息进入编辑器,右侧杯子展示抓取、抬起和放下。

交互测试提升大,一般插入提升较小

128例交互基准中,ALIVE的综合得分为86.71,最好的被测对比方法为60.24,相差26.47分,按原始表格口径相对提升约43.9%。运动与传播得分也从对比方法的36.52提高到86.13。论文里的书本搬动和篮子携带案例,展示了新增物体能随手的位置变化移动。

额外加入模型预测的分段提示后,交互综合得分达到87.66,比基础版本多0.95分。但在103例一般物体插入测试中,基础版本是92.28,增加提示的版本为91.71,分段指导并非每次都更好。

这些综合分由视觉语言模型评判,不能换算成真人使用满意率或任务成功率。论文还测了图文匹配和时间一致性等自动指标,图片中的个别示例则只说明可观察的编辑效果。

图:搬书和提篮子的三时刻帧并排展示,行间对应不同编辑方法。

下一步处理更复杂的接触变化

这种编辑适合原片已经提供了清楚动作、用户希望替换或补充道具的任务。后加物体参与互动,可以减少逐帧修补位置和姿态的工作。

论文指出,复杂形变和快速大角度旋转仍然难处理,错误的自动提示也会带偏结果。当前编辑器需要双向视频上下文,不支持边看边生成的流式方式。继续扩展交互数据、提高自动提示的可靠性,是把这些演示用于更复杂视频的具体方向。

参考资料

https://arxiv.org/abs/2610.08779

https://real-time-video-research.github.io/alive/

↑