2604.09201
2026-04-13
cs.CV
CT-1: Vision-Language-Camera Models Transfer Spatial Reasoning Knowledge to Camera-Controllable Video Generation
CT-1:视觉-语言-相机模型将空间推理知识转移到相机可控的视频生成
Haoyu Zhao, Zihao Zhang, Jiaxi Gu, Haoran Chen, Qingping Zheng, Pin Tang, Yeyin Jin, Yuang Zhang, Junqi Cheng, Zenghui Lu, Peng Shu, Zuxuan Wu, Yu-Gang Jiang
机构
*
Fudan University(复旦大学)
;
Tencent(腾讯)
;
Xiamen University(厦门大学)
;
Shanghai Jiao Tong University(上海交通大学)
AI总结
本文提出CT-1模型,通过准确估计相机轨迹将空间推理知识转移到视频生成中,利用小波正则化损失和视频扩散模型提升相机控制精度,实验显示其生成的视频质量高且控制准确率提升25.7%。