Prompt-A-Video: Prompt Your Video Diffusion Model via Preference-Aligned LLM
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM
Comments CVPR 2024; Project page: https://trip-i2v.github.io/TRIP/
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM
Comments Project page: https://instructvideo.github.io/
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(title)
Comments Project page: https://kimgeonung.github.io/VideoFrom3D/
SPADE:用于快速视频扩散模型推理的输入自适应稀疏注意力引擎
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 针对视频扩散Transformer推理开销过高的问题,提出无训练的SPADE稀疏注意力引擎,通过三部分设计实现注意力2.26x-3.40x、端到端推理1.49x-1.80x的加速且保持生成质量。
Comments Published in the 63rd ACM/IEEE Design Automation Conference (DAC '26). 7 pages, 6 figures, 3 tables
Journal ref 63rd ACM/IEEE Design Automation Conference (DAC '26), 2026, 7 pages
HyperVAttention:用于视频扩散的具有时空聚类的高效稀疏注意力
机构 * KAIST(韩国科学技术院) ; Google Research(谷歌研究院)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 针对视频扩散中自注意力机制的二次复杂度问题,提出HyperVAttention框架,通过3D局部窗口聚类等方法解决聚类开销大及CTA利用率低的瓶颈,提升视频扩散中无训练稀疏注意力的质量和速度。
Comments 21 pages, 8 figures
Pulling The REINS: 通过表示引导实现视频扩散模型的无训练安全对齐
机构 * University of California, Riverside(加州大学河滨分校) ; YouTube (Google)(YouTube(谷歌))
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 提出REINS方法,在推理时通过线性方向引导视频扩散模型的内部表示,实现无训练的安全对齐,避免有害内容生成,且不降低通用能力。
Pusa V1.0: 通过向量化时间步长适应解锁预训练视频扩散模型中的时间控制
机构 * City University of Hong Kong(香港城市大学) ; The Chinese University of Hong Kong(香港中文大学) ; Huawei Research(华为研究) ; Great Bay University(大湾大学) ; AI Technology Center, Tencent PCG(腾讯AI技术中心) ; Lingnan University(岭南大学) ; Hong Kong Centre for Cerebro-Cardiovascular Health Engineering(香港脑心血管健康工程中心)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 提出向量化时间步长适应(VTA)方法,在统一视频扩散框架中实现细粒度时间控制,零样本完成图像到视频生成、起止帧控制等任务,且不破坏基础模型能力。
Comments Code is open-sourced at https://github.com/Yaofang-Liu/Pusa-VidGen
局部关注,线性记忆:线性注意力作为跨帧记忆用于自回归视频扩散
机构 * Institute of Artificial Intelligence, University of Central Florida(中央佛罗里达大学人工智能研究所)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);long video(abstract);分类 cs.CV
AI总结 本文提出了一种名为ARL2的混合注意力模块,通过将二次跨帧注意力替换为固定大小的递归状态,解决了自回归视频扩散模型在长视频生成中的可扩展性瓶颈问题,实现了线性时间复杂度和常数内存消耗,同时提升了时间一致性。
TeDiO:基于时间对角优化的训练自由一致视频扩散
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; Futurewei Technologies Inc(未来科技有限公司) ; UCSD(加州大学圣迭戈分校)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 TeDiO通过优化内部注意力模式提升视频生成的时序一致性,无需训练或外部监督,实现更流畅的动态表现。
Comments CVPR'26 Workshop on Agentic AI for Visual Media
实时可控的自回归视频扩散
机构 * Nanyang Technological University(南洋理工大学) ; Xmax.AI Ltd(Xmax.AI有限公司) ; Zhejiang University(浙江大学) ; Singapore Management University(新加坡国立大学)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 AR-Drag是一种基于强化学习的实时图像到视频生成模型,通过自回归机制和轨迹奖励模型实现高效运动控制,提升视频生成质量和效率。
从偏好到偏见:对齐调谐在视频扩散模型中塑造社会偏见的作用
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California, San Diego(加州大学圣地亚哥分校) ; University of California, Santa Barbara(加州大学圣巴巴拉分校) ; Microsoft(微软公司)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 本文研究了对齐调谐在视频扩散模型中如何塑造社会偏见,提出VideoBiasEval框架以评估和缓解偏见,揭示了对齐调谐使偏见更稳定且刻板化的现象。
Comments TMLR
OnlineVPO: 对齐视频扩散模型与在线视频中心偏好优化
机构 * The University of Hong Kong(香港大学) ; ByteDance Project Page(字节跳动项目)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 OnlineVPO通过改进反馈源和调节方法,提出一种针对视频扩散模型的高效偏好学习框架,提升视频生成质量与可扩展性。
LiveTalk: 通过改进的在线策略蒸馏实现实时多模态交互视频扩散
机构 * SII SJTU GAIR
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 本文提出LiveTalk系统,通过改进的在线策略蒸馏实现实时多模态交互视频生成,显著提升效率和质量。
具有时间推理的上下文微调用于视频扩散模型的多功能控制
机构 * KAIST AI(韩国科学技术院人工智能研究中心)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 TIC-FT通过时间推理实现视频扩散模型的多功能控制,无需架构修改,仅需少量样本即可实现高质量视频生成。
Comments project page: https://kinam0252.github.io/TIC-FT/
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);video understanding(abstract);分类 cs.CV
Comments Accepted by AAAI 2026. Our project page: https://tele-ai.github.io/OmniVDiff/
机构 * Zhejiang University(浙江大学) ; Manycore Tech Inc.(Manycore科技公司)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);long video(abstract);分类 cs.CV
机构 * The University of Tokyo(东京大学) ; Google DeepMind(谷歌DeepMind)
专题命中 视频扩散模型 :text-to-video(title,abstract);video generation(abstract);video diffusion(abstract);分类 cs.CV
Comments Accepted to NeurIPS2025. Website: https://sites.google.com/view/t2v-dlbs and Code: https://github.com/shim0114/T2V-Diffusion-Search
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Qizhi Institute(上海启智研究院) ; Huawei Technologies Co.,Ltd(华为技术有限公司)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV
机构 * University of the Arts London(伦敦艺术大学)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.MM
Comments 3rd international workshop on eXplainable AI for the Arts (XAIxArts) at the ACM Creativity and Cognition Conference June 2025
机构 * Dept. of Comp. Sci. \& Tech., BNRist Center, THU-Bosch ML Center, Tsinghua University. ; The University of Texas at Austin. ; Gaoling School of Artificial Intelligence Renmin University of China Beijing, China. ; Beijing Key Laboratory of Research on Large Models ; Engineering Research Center of Next-Generation Intelligent Search ; Pazhou Laboratory (Huangpu)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);long video(abstract);分类 cs.CV
Comments ICML 2025. Project page: https://riflex-video.github.io/
机构 * MIT(麻省理工学院) ; Harvard University(哈佛大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);long video(abstract);分类 cs.CV
Comments ICML 2025. Project website: https://boyuan.space/history-guidance
机构 * Department of Computer Vision Technology(VIS), Baidu Inc.(计算机视觉技术系(VIS),百度公司)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);long video(abstract);分类 cs.CV
Comments Technical report, 12 pages
机构 * Fudan University(复旦大学) ; StepFun ; The Chinese University of Hong Kong(香港中文大学) ; Imperial College London(伦敦帝国理工学院)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);long video(abstract);分类 cs.CV
机构 * Stony Brook University(石溪大学) ; Adobe Research(Adobe研究)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);long video(abstract);分类 cs.CV
Comments 15 pages, 7 figures. Code and video results are available at https://desaixie.github.io/pa-vdm/. v2: Accepted to CVPRW 2025. Updated figures, tables, notations, and text in all sections. Added comparison with more baseline methods, FVD metric results, user study, and discussion on parallel works
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; Snap Inc.(Snap公司)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV
Comments CVPR 2025; Project Page: https://snap-research.github.io/ac3d/
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV
Comments ICLR 2025; Project Page: https://snap-research.github.io/vd3d/
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV
Comments Codes and Supplementary Material: http://github.com/PaddlePaddle/PaddleMIX/tree/develop/ppdiffusers/examples/ppvctrl
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.MM