From Dense Prediction to Visual Editing: Structured Supervision for Unified Image and Video Creation
从密集预测到视觉编辑:用于统一图像与视频创作的结构化监督
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Celia Research HK ; City University of Hong Kong(香港城市大学)
AI总结 该研究提出基于深度与表面法向量预测的结构化视觉监督框架,共享MMDiT主干实现统一图像视频创作,提升了相关基准任务分数,证明密集监督对下游创作的结构知识迁移价值。