When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models
当数字说话:在文本到视频扩散模型中对齐文本数字和视觉实例
机构 * Huazhong University of Science and Technology(华中科技大学) ; Zhejiang University(浙江大学) ; Afari Intelligent Drive(阿法里智能驾驶)
AI总结 本文提出NUMINA框架,通过识别和引导提升文本到视频扩散模型中数字对齐的准确性,实验显示在不同模型规模上均提升了计数精度,并保持了CLIP对齐和时间一致性。
Comments Accepted by CVPR 2026. Project page: https://h-embodvis.github.io/NUMINA