MLLM-Guided Semantic Correction for Text-to-Video Generation
基于多模态大语言模型(MLLM)的文本到视频生成语义修正
机构 * Zhejiang University(浙江大学) ; Huawei Cloud Computing Technology Co., Ltd.(华为云计算技术有限公司)
AI总结 该研究提出一种无需训练的MLLM引导文本到视频生成语义修正框架,通过两个关键模块在生成中修正语义偏差,提升了生成内容的语义对齐度等性能,经多基准实验验证有效。