Visual-Aware CoT: Achieving High-Fidelity Visual Consistency in Unified Models
视觉感知的CoT:在统一模型中实现高保真的视觉一致性
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队)
AI总结 本文提出视觉感知的CoT方法,通过自适应视觉规划和迭代视觉修正提升统一模型的多模态生成能力,实现更高的视觉一致性。
Comments Project Page: https://zixuan-ye.github.io/VACoT/