arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

视频里多个主角总串脸?阿里、北大把身份相似度拉高31.2%

作者:arXivDaily编辑部 arXiv 2609.11507 cs · cs.CV

论文导读

阿里巴巴、北京大学提出DIAL,从视频扩散模型内部找出能定位参考主体的注意力图,用它在推理时调节保真强度,并在训练时自动构造偏好样本。Kaleido骨干上的FaceSim从43.80%升至57.46%,相对提高31.2%;评测基于180条提示词,强保真会带来动作幅度取舍。

多个参考主体进入视频后,容易互换特征或直接消失

单人参考图生成视频已经会遇到脸变、衣服变和背景粘连。多个主体同时出现时,模型还要区分“谁是谁”,并让身份在连续帧里稳定。现有方法通常固定保真强度:太弱会丢身份,太强又像把参考图硬贴进视频,动作变僵。

论文把这类错误分成主体属性漂移、不同主体特征混合和主体缺失。它们在首帧可能不明显,视频运动后逐渐放大。DIAL没有再训练一个外部定位器,而是先检查扩散Transformer自己的注意力层。

图1:固定保真强度和多主体语义漂移会造成复制感、属性错误或主体消失。

模型内部已经有一张“谁在哪里”的定位图

团队发现部分注意力块会自然形成Intrinsic Spatial Grounding Map。参考主体与视频区域之间的注意力在特定层出现峰值,可以近似指出每个主体的位置。DIAL把这张图用于两个阶段。

低噪声推理阶段,定位图只在主体区域加强参考特征,背景不必跟着被拉向参考图。用户还能调节参数γ改变保真强度。高噪声训练阶段,团队用定位质量自动判断两次随机生成哪个更好,构成偏好对,再用强化学习减少主体漂移。

图2:不同注意力层对参考主体的响应不同,特定层形成清楚的空间定位图。

FaceSim提高31.2%,动作自然度仍需权衡

OpenS2V-Eval包含180条提示词,覆盖人脸、全身、实体、多主体和人与物体互动。DIAL接入Kaleido骨干时,γ从2提高到8,FaceSim从43.80%升至57.46%,相对增长31.2%;自然度没有显著下降,但更高γ会继续压缩动作幅度。

图6:参考主体与多种基线、DIAL生成帧的定性对比。

从γ=0到16的样例能看到身份逐渐靠近参考图。这个旋钮解决的是“保真强度能不能调”,不是自动找到所有场景的最佳值。人物快速运动、严重遮挡和参考图质量差时,身份指标仍可能不稳。

图10:提高γ后,生成主体与参考图的身份相似度逐步上升。

下一步要让每个主体拥有独立强度

当前实现对同一视频中的所有主体共享γ。实际创作中,主角可能需要高保真,背景人物只需保持大致外观。下一步可以为不同主体设置独立强度,并结合遮挡、镜头距离和动作速度自动调整。

项目落地还要验证长视频、多镜头和身份授权。论文证明模型内部注意力可以被重新利用,减少额外标注和偏好数据成本;它没有证明所有人物视频都能无漂移生成,也没有覆盖商业接口的稳定性。

参考资料

https://arxiv.org/abs/2609.11507

https://arxiv.org/html/2609.11507