南洋理工大学、剑桥大学、新加坡管理大学和CentraleSupélec团队发布CultureVidBench,用1000条提示测试7款文本生成视频模型。结果显示,模型能生成语义相符、画质不错的视频,却常把服饰、文字、仪式步骤和声音线索做错。
基准覆盖12个国家、6个大洲、8个文化区域和14类文化要素。评测同时使用人工用户研究和多模态大模型裁判,避免只用单一自动分数判断文化是否准确。
论文图1:画面在视觉上成立,但特定文化物件、动作或仪式细节出现偏差。
考题不只检查画面里有什么
现有视频基准多关注清晰度、物理合理性和文字—视频对齐。CultureVidBench把文化内容拆成物质文化、社会实践与表演、仪式与典礼三组,包含饮食、服装、舞蹈、节庆和宗教仪式等动态场景。
视频比静态图片多了时间和声音维度。评测会检查人物是否按正确顺序完成仪式、互动关系是否合适、画面中的文字是否正确、音频是否匹配场景。模型只生成一个“看起来像”的单帧无法拿到高分。
论文图2:文化元素被整理为视频提示,再由人工与多模态模型从四个维度评分。
语义对上了,细节仍会错
7款代表性模型在语义遵循和感知质量上整体较强,文化忠实度与多模态呈现得分较弱。常见错误包括招牌文字乱码、服装部件混搭、仪式动作顺序不对,以及音频缺少应有的文化线索。
论文图4:不同模型在文化忠实度、语义遵循和视觉质量上的排名并不一致。
代表性不足的区域、复杂仪式和需要文字或声音配合的提示更容易失败。高画质分数无法替代文化评测:一个视频可以清晰、流畅、完全围绕提示主题,同时在具体文化上不准确。
自动裁判也需要接受检查
团队让多模态大模型参与大规模评分,并用人工研究比较结果。自动评测提高了1000条提示的执行效率,但裁判模型可能携带同类地域偏差,对少数文化的判断也未必可靠。
论文图7:错误集中在可见文字、文化物件和仪式动作等可核查细节。
12个国家也只是全球文化的一小部分,同一国家内部存在地域、族群和时代差异。CultureVidBench适合暴露“画得像但做得不对”的问题,不能给模型的全球文化理解能力下总评。项目页公开了基准与示例,后续比较仍要看提示覆盖和本地文化专家参与程度。