arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

华为&清华等发布HUG-VIS:8400段视频同时测情绪、生成、克隆与抠像

作者:arXivDaily编辑部 arXiv 2608.26517 cs · cs.CV

同一个人物视频,既可以用来识别情绪,也可以测试视频生成、声音克隆和人物抠像。深圳大学、中科院自动化所、清华大学、华为等机构推出HUG-VIS,用8400段同步视频、音频、文本和透明度蒙版,把四类任务放在同一套受控素材上比较。

数据由30名专业演员完成,每人执行相同的280组“情绪—动作—提示词”组合。统一素材让研究者能追问:一个模型在情绪识别上难的样本,是否也会让视频生成或抠像变难;自动指标与人工评分是否会给出同样排序。

30名演员重复同一套280组任务

录制在普通话演播室完成,演员以坐姿半身出镜,按照静止—表演—静止的顺序执行动作并同步说话。视频、降噪音频、提示词、转写文本和逐帧Alpha蒙版保持时间对齐。

这种网格化设计允许一次只改变一个因素。研究者可以固定演员与情绪、只替换动作;也能固定动作、比较不同演员。样本差异因此更容易归因,而不是来自完全不同的拍摄环境。

图1:同一演员、情绪或动作可被单独固定,形成可对照的多模态样本。

一套素材横跨理解与生成四项任务

情绪识别要求模型判断演员状态;视频生成分别使用音频或视觉动作驱动人物;声音克隆考察音色和内容;视频抠像则要从动态画面中恢复人物透明度边界。所有模型采用统一零样本协议,并同时报告自动指标和针对任务的主观平均意见分。

数据构建分为共享组合设计、同步采集、资产打包和统一评测四个阶段。研究者还做跨任务分析,比较同一情绪、演员和片段在不同指标上的难度关联。

图2:同步RGB、音频、文本与Alpha蒙版支撑理解、生成、克隆和抠像四项评测。

文本最能帮助识别情绪,纯视觉最弱

实验显示,语言内容对当前情绪识别贡献最大,只有视觉信号时表现最弱。这个结果来自受控表演:演员的台词与情绪任务高度对应,因此不能直接外推到无台词的自然交流。

视频生成和声音克隆中,自动指标与人工判断总体方向一致,但对最佳模型的选择并不总相同。只看像素或声学距离,可能漏掉手部畸变、口型不自然和情绪表达不足等人类容易察觉的问题。

图3:同一愤怒动作序列驱动多个模型,便于逐帧比较人物、动作与手部细节。

运动中的边界仍是人物抠像难点

人物抠像的主要错误集中在运动边缘。手臂、头发和衣物快速移动时,模型更容易把前景切掉或把绿色背景带进Alpha蒙版。论文用参考蒙版和误差着色展示九种模型在同一序列上的差别。

图4:七个时间点上的参考Alpha与模型预测,红色区域标出运动边缘误差。

数据也显示,不同情绪在各项任务中的难度并不一致。某种情绪容易识别,不代表对应动作容易生成;跨任务相关性可以帮助研究者定位模型依赖的是台词、表情还是动作幅度。

扩展到开放环境与更广泛人群

HUG-VIS适合做统一回归测试:模型升级后,可以同时检查它是否改善情绪理解、人物生成、声音和边缘处理。数据与结果已公开,后续还可加入更多语言、全身动作、多人互动和非演播室背景。

当前8400段视频来自30名专业演员和受控普通话流程,不能代表开放环境中的自然行为,也不宜用于推断更广泛人群的情绪规律。产品部署仍需在真实用户、不同设备和复杂背景上重新评估,并明确声音与肖像数据的授权边界。

统一素材还适合做多任务模型诊断。如果一个模型升级后声音更像目标人物,却让口型同步或抠像边缘退化,四项结果能在同一批样本上直接暴露取舍。后续版本若保留相同采集协议,也能形成可复现的年度回归测试。

参考资料

https://arxiv.org/abs/2608.26517

https://github.com/GML-MMGroup/HUG-VIS