SCoPE: Sightline-Coordinate Positional Encoding for Video Diffusion Transformers
RayPE: 用于3D感知视频生成的射线空间位置编码
机构 * The University of Hong Kong(香港大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; ARC Lab, Tencent(腾讯ARC Lab)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 提出RayPE,通过向自注意力注入6D Plücker坐标编码射线几何关系,提升视频扩散Transformer的3D一致性和相机可控性。
Comments Project page: https://visual-ai.github.io/scope/