arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

上交清华破解AI视频造假难题:不仅能揪出伪造像素,还能把破绽讲明白

作者:arXivDaily编辑部 arXiv 2609.30934 cs · cs.CV

论文导读

上海交通大学、清华大学、上海人工智能实验室、北京邮电大学等机构提出ManiVid,让视频取证从“判断真假”进一步走向“标出哪里被改、说明为什么可疑”。研究团队构建约3.8万段带标注的篡改视频,并在专门测试中提升篡改区域定位和异常解释成绩。面对只改了车牌、背包或人脸局部的视频,审核者由此有机会看到更具体的证据,而不只是一个真假标签。

假视频不一定整段都是假的

如今的视频编辑工具可以保留原来的场景、动作和镜头运动,只把一小块内容换掉。比如把汽车车牌改成另一串字符,或在墙上添一只时钟,观看者可能觉得整体画面很自然。这样的局部篡改比整段生成的视频更难查:大部分像素都是真实的,问题只藏在边缘、光照、纹理或连续帧的一点不协调里。

团队首先把问题拆成三个可检查的答案:这段视频是否被改过;被改的是哪些像素区域;判断的依据是什么。ManiVid-38K覆盖移除、替换、变色、添加、材质变化和人像编辑等操作,同时配有原片与编辑片、像素掩码和文字解释。图中气球被移走、车牌被替换、背包变色等例子,显示了“真实背景加局部改动”的实际难度。

图:样例分别展示移除、替换、变色、人像编辑等局部视频改动及标注位置。

让模型一边找位置,一边说理由

ManiVidLens将视觉取证线索与语言模型的说明能力结合。它先从连续视频帧中提取可疑边界和局部细节,再把这些线索交给能够生成文字分析的模块;另一路负责把可疑区域定位到画面上。对读者而言,结果更像一份简短的检查报告:不是笼统说“假”,而是指出车牌边界异常、反光与周围光照不一致,或者某些纹理在相邻帧中闪动。

这种设计并不表示模型能自动证明视频的真实来源。它分析的是画面中可见的篡改迹象,结论仍需结合原文件、拍摄链路和其他核验资料。论文的框架图中也能看出,真假分类、文字解释与区域掩码来自不同但相互配合的输出,三者不能混为同一个指标。

图:ManiVidLens示意视频证据提取、文字解释与篡改区域定位三种输出。

这次提升具体在哪里

在ManiVidBench的测试口径下,论文报告区域定位取得0.407 mIoU和0.422 J&F,分别比所比较的此前方法提高约21.1%和21.3%。异常原因解释的ROUGE-L为0.583,相对基线提高131.3%;视频真假分类准确率为0.914。这些数字分别对应“圈得准不准”“说得像不像参考解释”和“判真假对不对”,不能把解释指标的涨幅直接当作识假准确率的涨幅。

下图给出蛋糕颜色、汽车方向盘和人像中新增时钟等编辑案例。可以看到,改变往往只占视频画面的一小部分,因此取证模型需要比“整段氛围不对”更细的定位能力。它对真实世界所有伪造手法的适用范围,仍有待在更复杂的来源和压缩条件下验证。

图:蛋糕配色、方向盘替换和画面新增时钟等局部编辑的前后对照。

下一步,视频审核可以多一步

对平台审核、媒体核查或安全团队来说,可解释取证的价值是让人工复核有具体落点:先看模型圈出的区域,再检查对应帧的边缘、阴影和时间连续性。ManiVid展示了把数据集、定位与文字说明一起评估的做法,也提醒我们,不应把任何单一检测分数理解成“看一眼就能判定所有视频真假”。下一步更值得关注的是不同生成工具、二次传播压缩和真实拍摄噪声下,这些可见线索还能否稳定保留。

参考资料

https://arxiv.org/abs/2609.30934

https://arxiv.org/html/2609.30934

↑