VideoUFO: A Million-Scale User-Focused Dataset for Text-to-Video Generation
机构 * University of Technology Sydney(悉尼技术大学) ; Zhejiang University(浙江大学)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
机构 * University of Technology Sydney(悉尼技术大学) ; Zhejiang University(浙江大学)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
Comments accepted by CVPR2025, Project website: https://whynothaha.github.io/Prompt_optimizer/RAPO.html
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
Comments Website: https://video-msg.github.io; The first three authors contributed equally
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);long video(title);分类 cs.CV
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
Comments Project page: https://wileewang.github.io/TransPixar/
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
Comments 22 pages, 14 figures, 11 tables
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
Comments Accepted at NeurIPS 2024, code available at https://github.com/PR-Ryan/DEMO
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
Comments (NeurIPS 2024 Spotlight) Project page at https://jianzongwu.github.io/projects/motionbooth
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
Comments Preprint
机构 * Apple(苹果公司) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);long video(abstract);分类 cs.CV、cs.MM
机构 * DAMO Academy, Alibaba Group(阿里达摩院) ; Hupan Lab(华盘实验室) ; INSAIT ; Zhejiang University(浙江大学)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV、eess.IV
Comments Project page: https://jingyunliang.github.io/RealisMotion
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV、eess.IV
Comments CVPR 2025 (poster); project page: https://motionprompt.github.io/
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV、eess.IV
Comments technical report
专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);long video(abstract);分类 cs.CV
Comments Homepage: https://www.amd.com/en/developer/resources/technical-articles/amd-hummingbird-0-9b-text-to-video-diffusion-model-with-4-step-inferencing.html| GitHub: https://github.com/AMD-AIG-AIMA/AMD-Hummingbird-T2V
SCMAPR: 自校正多智能体提示精修用于复杂场景文本到视频生成
机构 * HiThink Research(HiThink研究院) ; East China Normal University(华东师范大学) ; Guangzhou University(广州大学) ; Tsinghua University(清华大学)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title)
AI总结 本文提出SCMAPR框架,通过多智能体分阶段精修提升复杂场景下的文本到视频生成质量,实验表明在VBench和EvalCrafter等基准上平均得分提升显著。
机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新技术实验室,自动化研究所,中国科学院(CASIA)) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Kuaishou Technology(快手科技) ; Nanjing University(南京大学)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title)
Comments Accepted to Findings of ACL 2025
SQuad:用于高效视频生成的次二次注意力蒸馏
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 针对视频扩散Transformer自注意力的二次复杂度瓶颈,提出SQuad次二次注意力蒸馏框架,通过两阶段蒸馏适配预训练模型,在保持生成质量的同时大幅提升效率。
用于快速图像和视频生成的并行解码蒸馏
机构 * NVIDIA(英伟达) ; Weizmann Institute of Science(魏茨曼科学研究所)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 针对视频扩散或流模型生成计算昂贵问题,提出并行解码蒸馏方法PDD,兼容预训练模型,通过预测多去噪步骤加速生成,在多个数据集上达SOTA性能,提升视频多样性。
Ms. Forcing:通过多尺度分块和注意力实现高效流视频生成
机构 * Brown University(布朗大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Meta
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);long video(abstract);分类 cs.CV
AI总结 研究针对流视频生成中传统方法的不足,提出Ms. Forcing范式,通过多尺度分块和注意力调整空间粒度,引入均匀噪声水平DMD减少不匹配,该方法提升了效率,在单个H200 GPU上性能显著优于Rolling Forcing。
用于快速视频生成的过渡匹配蒸馏
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 研究针对大型视频模型多步采样低效问题,提出过渡匹配蒸馏框架TMD,将扩散模型多步去噪轨迹与少步概率过渡过程匹配,分解扩散主干为组件,经实验验证TMD在速度和质量权衡上表现出色,优于现有蒸馏模型。
Journal ref Proc. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 4645-4655
追踪噪声,移动世界:用于可控视频生成的3D地面运动一致噪声
机构 * Qualcomm AI Research(高通人工智能研究中心) ; Trinity College Dublin(都柏林三一学院)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 研究如何在视频生成中实现对物体和相机运动的精确统一控制。核心方法是构建统一框架UniCaMo,直接构造扩散模型输入噪声。主要贡献是在视频质量和运动可控性上取得先进成果,且无需对基础模型做大改动。
Comments Project Page: https://phongnhhn.info/Unicamo/
数据强制蒸馏:恢复少步视频生成中的多样性和保真度
机构 * University of Michigan(密歇根大学) ; NVIDIA(英伟达) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 针对分布匹配蒸馏(DMD)在少步视频生成中出现的模式坍塌和过饱和问题,提出数据强制蒸馏(DFD)框架,通过教师评分差异引导学生接近真实数据分布,仅需一行代码修改即可恢复多样性和保真度。
UniTemp: 通过双向蒸馏实现任意时间顺序的视频生成
机构 * University of Wisconsin Madison(威斯康星大学麦迪逊分校) ; Adobe Research(Adobe 研究院) ; University of California Los Angeles(加利福尼亚大学洛杉矶分校) ; University of California Davis(加利福尼亚大学戴维斯分校)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);long video(abstract);分类 cs.CV
AI总结 提出UniTemp框架,通过双向蒸馏训练单个自回归模型,支持任意时间方向(前向、后向、中间插值)的视频生成,解决因果3D VAE在后向生成中的不连续性,提升可控性。