arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

腾讯优图上交等发布PersonaShot:AI视频画面再漂亮,也会在切镜后忘记人物状态

arXiv 2608.16717 cs.CV

上海交通大学、腾讯优图实验室和浙江大学联合发布PersonaShot,专门评估人物在多镜头AI视频中的叙事连续性。基准包含约1000个多镜头片段和16项指标。团队发现,高观感画质并不保证切镜后的物理状态、情绪变化和镜头关系保持连贯。

现有视频评测更常检查单个片段清晰度、人物长相或文字指令匹配。进入广告、短剧和电影预演后,问题会跨镜头出现:人物上一镜拿着物品,下一镜物品回到原位;表情突然重置;正反打的视线方向和空间位置互相冲突。单镜头分数看不到这些错误。

连续性被拆成三个时间尺度

PersonaShot从镜头内部、镜头转换和整段序列三个层次检查人物状态。指标覆盖物体与身体的物理连续性、情绪轨迹,以及视线、空间布局和剪辑关系等电影语法,不再把所有问题压进一个总分。

PersonaShot的数据来源覆盖多种人物叙事和多镜头场景

PersonaShot的数据来源覆盖多种人物叙事和多镜头场景。

这种拆分可以区分“人物脸没变”和“故事状态没变”。同一个角色即使五官和衣服稳定,手里的杯子、身体朝向和情绪也可能在切镜后跳回早期状态。对内容创作者而言,后者往往比轻微纹理差异更容易破坏观看体验。

不同指标交给不同的轻量评估器

物理状态、面部情绪和镜头关系需要的证据不同。团队先让大型多模态教师模型输出带理由的判断,再把能力蒸馏到针对具体指标的轻量评估器,并用专家人工判断校准,而不是让一个通用模型给所有维度打分。

PersonaShot针对物理连续性、情绪动态和电影关系构建专用评估器

PersonaShot针对物理连续性、情绪动态和电影关系构建专用评估器。

专用评估器必须引用相应的视觉、时间或关系证据。例如情绪变化需要观察跨帧表情轨迹,物体状态则要比较切镜前后的持有关系。论文的人类研究显示,这些评估器与专家判断具有较强一致性,但它们仍是自动指标,不能完全代替制作人员审片。

画面漂亮和故事连贯是两套能力

系统评测多种先进视频生成模型后,得到的能力画像并不一致。有些模型单镜头观感较强,却频繁重置人物的物理状态;有些能保持外观,却在情绪弧线和正反打关系上出错。这说明提升感知质量不会自动修复跨镜头叙事。

多种视频模型在PersonaShot不同连续性维度上的表现分布

多种视频模型在PersonaShot不同连续性维度上的表现分布。

失败样例包括物品位置跳变、人物表情无过渡变化、视线不匹配和不合适切镜。基准评估的是指定多镜头片段和16项连续性指标,不应被解读为各模型总体画质排行榜,也不能覆盖所有类型的长视频叙事。

这套指标的实用之处,在于把创作者常说的“穿帮”转成可以定位的机器问题。物品持有关系错误可能需要更强的物理状态记忆,情绪跳变可能需要显式人物弧线,视线与空间冲突则涉及镜头调度。不同失败对应不同修复策略,单一总体分数很难给出这种信息。

但自动评估也可能继承教师模型的偏好。例如实验性剪辑会故意打破连续性,喜剧和梦境片段也可能用跳变制造效果。如果指标机械地把这些创作选择判为错误,就会限制风格。因此PersonaShot更适合作为质量检查和模型诊断工具,而不是替代导演或剪辑师的审美判断。

项目页归纳的物体状态、情绪、空间与剪辑连续性失败案例

项目页归纳的物体状态、情绪、空间与剪辑连续性失败案例。

下一步是让生成模型显式保存叙事状态

当前多镜头系统常把人物参考图或上一镜画面作为条件,却缺少结构化的故事状态。下一步可以把人物持有什么、位于哪里、情绪处于哪个阶段等信息写入跨镜头记忆,让生成器在创建新镜头前先检查状态变化是否合法。

制作工具也可以在生成后运行PersonaShot式检查,自动标出可能穿帮的切点,交给创作者确认。要进入真实影视流程,评测还需扩展更长剧情、多人互动和复杂场面调度,并验证自动指标对不同文化叙事和剪辑风格是否稳定。

参考资料

https://arxiv.org/abs/2608.16717

https://rain152.github.io/PersonaShot/