Auteur: Language-Driven Cinematographic Framing for Human-Centric Video Generation
Auteur: 以语言驱动的电影化取景实现以人为中心的视频生成
机构 * Koç University(科克大学) ; University College London(伦敦大学学院) ; Adobe(Adobe公司) ; Hacettepe University(哈切特佩大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 提出Auteur方法,通过将相机运动参数化为以人为中心的取景(包括镜头尺寸、角度和构图),并利用领域特定语言(DSL)和微调的多模态大语言模型,实现语言驱动的电影化取景,在人类中心视频生成中优于现有方法。
Comments Project Page: https://cyberiada.github.io/Auteur/