阿里通义、上海科技大学、香港科技大学等团队提出AVA-Encoder,把视频编码成知识图谱,再从图谱重建回视频。图中的文本节点记录镜头层级、状态和剧情信息,资产层链接图像、音频与视频,Agent可以查询人物、定位片段或修改关系,而不必每次重新扫描完整像素序列。
现有视频编码器擅长压缩视觉信息,但潜变量主要供神经网络读取,创作Agent很难直接解释和编辑。纯文本摘要容易丢掉镜头、声音和角色细节,也无法准确指回对应素材。AVA-Encoder要建立的是一份既保留内容、又能被Agent操作的视频表示。
用知识图谱保存镜头状态和多媒体资产
AVA-Encoder把视频组织成层级与状态节点。结构化文本描述场景、镜头、人物和事件,带类型的边记录节点间关系;图像、音频和视频片段保存在关联资产层。文本提供可检索的语义,资产保留无法压进文字的视觉与听觉细节。
AVA-Encoder与外部基线的视频重建结果对比。
这种表示支持更精确的编辑。Agent可以找到某个角色出现的镜头,改写动作或替换关联资产,再沿图结构重建相关片段。操作对象是明确节点和边,而非要求模型用一条超长提示重新生成整部视频。
重建差异被翻译成自然语言梯度
编码是否可靠,最终要看图谱能否重建原视频。团队比较原视频与重建结果,把差异表达成自然语言更新方向,形成“文本梯度”。外层循环用这些反馈做数据无关的编码策略伪训练,逐步改进Agent如何拆解一段新视频。
视频知识图谱的层级、节点、边和资产组织方式。
测试时还可以启用数据相关的知识图谱细化,针对当前视频修正遗漏人物、错误关系或不准确镜头描述。一个优化通用编码策略,一个精修具体样本,两层过程都以Agent能理解的文字方向驱动。
重建在这里相当于一场闭卷检查。知识图谱如果漏掉关键人物、镜头顺序或声音事件,解码结果就无法还原原片;评价器再把差异写成具体修改意见。编码策略由此获得比“摘要是否流畅”更严格的反馈。
重建表现提升20.7个百分点
论文实验显示,AVA-Encoder比最强外部基线提高20.7个百分点。在只比较编码策略的受控设置中,经过伪训练的镜头级策略超过人工仔细调节的策略,同时系统提示词Token减少74.3%。团队还发布完整框架、视频重建基准及高质量电影知识图谱数据集。
Agent在图谱编辑界面中查看视频节点和关系。
这些结果针对论文定义的表征与重建任务,不能直接解读为自动剪辑成片质量提高20.7%。知识图谱仍会受上游视觉识别、角色一致性和文本描述精度影响,涉及长电影时还要处理图规模与跨镜头指代。
电影片段经知识图谱编码后的重建案例。
从电影记忆扩展到可控视频创作
结构化表示可以成为视频Agent的长期记忆。用户询问“主角第一次拿到某件物品在哪个镜头”,系统可沿人物、物品和事件边查询;需要修改某段剧情时,也能先定位相关节点,再调用生成模型处理有限片段。
下一步可把版权信息、素材来源和编辑历史也写入图谱,使每次生成和替换都有记录。AVA-Encoder目前是研究框架,不是已上线剪辑产品;它已经验证视频可在像素与Agent可读结构之间往返,为后续查询、重组和协同创作提供了基础格式。
长片还需要解决同一角色换装、跨场景物品延续和对白指代。若这些关系能稳定写入图谱,Agent就可以在修改早期镜头后自动找到受影响的后续节点,再提醒创作者检查连续性。发布的数据集为这类长程视频记忆提供了统一实验起点。
图谱也可以记录每个结论对应的原始时间码。用户询问剧情或要求编辑时,Agent能返回可播放证据,创作者不必只相信文字摘要;重建失败的节点则可被标为待人工复核。