Realizing a quantum generative adversarial network using a programmable superconducting processor
专题命中 视频生成 :video generation(abstract)
Journal ref npj Quantum Inf 7, 165 (2021)
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频生成 :video generation(abstract)
Journal ref npj Quantum Inf 7, 165 (2021)
专题命中 视频生成 :video generation(abstract)
Comments ICLR 2021
专题命中 视频生成 :video generation(abstract)
专题命中 视频生成 :video generation(abstract)
Comments 5 pages, 4 figures, Comments are welcome
Journal ref Sci. Adv. 5, eaav2761 (2019)
专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);long video(title,abstract);text-to-video(abstract)
Comments Project Page: https://yingqinghe.github.io/LVDM/ Github: https://github.com/YingqingHe/LVDM
面向鲁棒文本到视频生成的潜变量视频扩散模型腐蚀感知训练
机构 * William & Mary(威廉与玛丽学院) ; Carnegie Mellon University(卡内基梅隆大学) ; The University of Hong Kong(香港大学)
专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);text-to-video(title);video understanding(abstract)
AI总结 本文提出CAT-LVDM框架,通过结构化噪声注入提升视频扩散模型的鲁棒性,实验显示其在多个数据集上优于传统方法,且能扩展至自回归生成和多模态视频理解模型。
Comments ICLR 2026 ReALM-GEN
专题命中 视频扩散模型 :video diffusion(title,abstract);long video(title,abstract);video generation(abstract);text-to-video(abstract)
专题命中 视频扩散模型 :video diffusion(title,abstract);long video(title,abstract);video generation(abstract);分类 cs.CV、cs.MM
Comments This paper is accepted by CVPR 2025
专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);video generation(abstract);分类 cs.CV、cs.MM
SKeDA:一种面向文本到视频扩散模型的生成水印框架
机构 * School of Electronic and Information Engineering, Anhui University(安徽大学电子与信息工程学院) ; Anhui Province Key Laboratory of Digital Security and the CAS Key Laboratory of Electromagnetic Space Information, University of Science and Technology of China(安徽省数字安全重点实验室和中国科学院电磁空间信息重点实验室,中国科学技术大学) ; School of Computing, National University of Singapore(新加坡国立大学计算机学院)
专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);video generation(abstract);分类 cs.CV
AI总结 SKeDA是一种专为文本到视频扩散模型设计的生成水印框架,通过分布保持采样和差分注意机制提升水印的鲁棒性和可靠性。
Comments 11 pages, 6 figures
MagicMirror: 视频扩散变换器中的身份保留视频生成
专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV
AI总结 MagicMirror通过双分支特征提取器和两阶段训练策略,在视频扩散变换器中实现高质量身份保留视频生成,优于现有方法。
Comments ICCV 2025, It is best viewed in Acrobat. Project Page: https://julianjuaner.github.io/projects/MagicMirror/
专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);video generation(abstract);分类 cs.CV
专题命中 视频扩散模型 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV
专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);video generation(abstract);分类 cs.CV
Comments Accepted to TMLR | Project Page: https://unified-attention-control.github.io/
专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);video generation(abstract);分类 cs.CV
Comments Accepted by NeurIPS 2024 (Datasets and Benchmarks Track)
专题命中 视频扩散模型 :video diffusion(title,abstract);long video(title,abstract);video generation(abstract);分类 cs.CV
Comments 21 pages
专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV
Comments arXiv admin note: text overlap with arXiv:2307.04725 by other authors
专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);video generation(abstract);long video(abstract)
Comments CVPR 2024
专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);video generation(abstract);分类 cs.CV
Comments Project page: https://video-motion-customization.github.io
专题命中 视频扩散模型 :video diffusion(title,abstract);long video(title,abstract);video generation(abstract);分类 cs.CV
Comments Project page: https://vchitect.github.io/SEINE-project/
专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);video generation(abstract);分类 cs.CV
Comments Project Page: https://showlab.github.io/MotionDirector/
专题命中 视频扩散模型 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV
Comments The code is available at https://github.com/G-U-N/Gen-L-Video
基于回退误差的时间集中:文本到视频扩散的隐式偏好优化
机构 * Tsinghua University(清华大学) ; Kuaishou Technology(快手科技) ; Sun Yat-sen University(中山大学)
专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title);video generation(abstract);分类 cs.CV
AI总结 针对文本到视频扩散模型的时间稀疏伪影问题,本文提出集中式隐式偏好优化(cIPO)框架,通过回退误差推导隐式偏好信号,将优化集中于高误差片段,有效提升了视频的真实性与时间连贯性。
Comments project page: https://henglin-liu.github.io/cIPO_vis/
TPD:用于文本到视频扩散模型的时间先验解耦
专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV
AI总结 该研究针对文本到视频扩散模型的时间先验抑制问题,提出无需训练的TPD框架,通过帧选择性下界约束恢复被抑制的后期片段信号,提升后期概念实现效果且与骨干无关。
面向大规模文生视频扩散Transformer的边界保护W8A8 HiFloat8量化
机构 * Yiming Zhao(赵毅铭)
专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV
AI总结 针对Wan2.1-T2V-14B模型,提出一种边界保护策略的W8A8 HiF8后训练量化方法,通过保留首尾边界块为BF16而量化中间块,在VBench五个维度上匹配或略优于BF16基线。
Comments 6 pages, 5 figures. Accepted to ICME 2026 Grand Challenge
LVSA:长视频扩散的无训练稀疏注意力
机构 * Distributed Parallel Technology Laboratory, Paris Research Center, Huawei Technologies France(华为法国巴黎研究中心分布式并行技术实验室) ; AI Framework and Data Technology Lab, Huawei Technologies Co., Ltd.(华为技术有限公司人工智能框架与数据技术实验室)
专题命中 视频扩散模型 :video diffusion(title,abstract);long video(title,abstract);分类 cs.CV
AI总结 提出一种无需训练、模型无关的块稀疏注意力方法LVSA,通过结构化窗口模式与旋转全局锚点结合,在降低长视频扩散推理计算成本的同时消除固定网格偏差,支持超训练时域的视频生成。
Comments 10 pages, 5 figures, 4 tables. Code: https://github.com/JiusiServe/LongVideoSparseAttention
概念擦除应发生在何处:文本到视频扩散模型中的概念-层对齐
机构 * The School of Artificial Intelligence and Automation, Huazhong University of Science and Technology, Wuhan 430074, China(人工智能与自动化学院,华中科技大学,武汉430074,中国) ; Department of Computer Science and Engineering, University of Nevada, Reno, NV, USA(计算机科学与工程系,内华达大学里诺分校,内华达州,美国)
专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV
AI总结 本文通过识别概念-层拓扑对齐瓶颈,提出基于可分离性优化的CLEAR框架,在文本到视频扩散模型中实现精确的概念擦除并保持生成质量。
Comments Accepted by ICML 2026
当数字说话:在文本到视频扩散模型中对齐文本数字和视觉实例
机构 * Huazhong University of Science and Technology(华中科技大学) ; Zhejiang University(浙江大学) ; Afari Intelligent Drive(阿法里智能驾驶)
专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV
AI总结 本文提出NUMINA框架,通过识别和引导提升文本到视频扩散模型中数字对齐的准确性,实验显示在不同模型规模上均提升了计数精度,并保持了CLIP对齐和时间一致性。
Comments Accepted by CVPR 2026. Project page: https://h-embodvis.github.io/NUMINA
增强草图动画:带有时间一致性和刚性约束的文本到视频扩散模型
机构 * Graphics Research Group, Indraprastha Institute of Information Technology Delhi(印度普拉斯塔信息技术研究所图形研究组)
专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV
AI总结 本文提出了一种基于文本到视频扩散模型的草图动画方法,通过引入时间一致性和刚性约束,提升了动画的平滑度和形状保持性。
FAIRT2V:无需训练的文本到视频扩散模型去偏框架
机构 * School of Computer Science and Engineering, University of New South Wales, Australia.(新南威尔士大学计算机科学与工程学院,澳大利亚) ; State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室,中国)
专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);video generation(abstract);分类 cs.CV
AI总结 FAIRT2V通过无需训练的去偏框架减少文本到视频扩散模型中的性别偏见,通过中和提示嵌入和动态去噪计划实现,有效降低偏见同时保持视频质量。