arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6840 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2171 篇

2602.15287 2026-06-08 cs.CV 版本更新 83%

Consistency-Preserving Diverse Video Generation

保持一致性的多样化视频生成

Xinshuang Liu, Runfa Blark Li, Truong Nguyen

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出一种联合采样框架,在保持时间一致性的同时提高文本到视频生成中批次内视频的多样性,通过轻量级潜在空间模型避免视频解码和反向传播。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04432 2026-06-04 cs.CV 83%

DSA: Dynamic Step Allocation for Fast Autoregressive Video Generation

DSA: 用于快速自回归视频生成的动态步数分配

Thanh-Tung Le, Yunhan Zhao, Menglei Chai, Zhengyang Shen, Zhe Cao, Danhang Tang, Xiaohui Xie, Deying Kong

机构 * University of California, Irvine(加州大学尔湾分校) Google(谷歌) Google DeepMind(谷歌DeepMind)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出一种置信度引导的自适应计算框架DSA,通过轻量级置信度头动态调整每帧去噪步数,在保持视频质量的同时实现实时自回归视频生成。

Comments CVPR2026, Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01285 2026-06-02 cs.CV cs.AI 83%

Knowledge-Intensive Video Generation

知识密集型视频生成

Chenxu Wang, Mingda Chen

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 针对文本到视频生成在事实性和实用性方面的不足,提出知识密集型视频生成(KIVI)任务,构建KIVI-Bench基准和自动评估指标,实验表明现有模型在视觉属性、操作过程和信息呈现上落后于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02214 2026-06-02 cs.CV 83%

Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation

因果强迫:自回归扩散蒸馏的正确方法,用于高质量实时交互式视频生成

Hongzhou Zhu, Min Zhao, Guande He, Hang Su, Chongxuan Li, Jun Zhu

机构 * Hongzhou Zhu(朱洪洲) Min Zhao(赵敏) Guande He(何冠德) Hang Su(苏hang) Chongxuan Li(李崇轩) Jun Zhu(朱军)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 针对双向扩散模型蒸馏为自回归模型时的架构差距问题,提出因果强迫方法,通过自回归教师进行ODE初始化并应用DMD过程,显著提升视频生成质量。

Comments Project page and the code: \href{https://thu-ml.github.io/CausalForcing.github.io/}{https://thu-ml.github.io/CausalForcing.github.io/}; https://github.com/thu-ml/Causal-Forcing. ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31033 2026-06-01 cs.CV 83%

SlotMemory: Object-Centric KV Memory for Streaming Long-Video Generation

SlotMemory: 面向流式长视频生成的以对象为中心的KV记忆

Weijia Dou, Hui Li, Jiahao Cui, Lei Zhou, Jingdong Wang, Siyu Zhu

机构 * Fudan University(复旦大学) Meta Superintelligence Labs(Meta超智能实验室) Baidu(百度)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出SlotMemory,一种以对象为中心的键值记忆机制,通过将变换器的键值流形分解为离散语义槽,实现实体级持久性和提示感知检索,在60秒交互叙事中动态一致性相对提升22.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30349 2026-05-29 cs.CV 83%

AdaState: Self-Evolving Anchors for Streaming Video Generation

AdaState: 用于流式视频生成的自演化锚点

Yusuf Dalva, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工学院)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 针对自回归视频扩散模型中静态首帧锚点抑制视频动态的问题,提出自适应状态锚点,通过隐变量与内容联合去噪并随时间演化,显著提升运动丰富度和场景自然演进。

Comments Project page: https://adastate.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30317 2026-05-29 cs.CV 83%

VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation

VPG: 视觉前缀引导的自回归图像与视频生成

Xinyao Liao, Qiyuan He, Yicong Li, Jiayin Zhu, Xiaoye Qu, Wei Wei, Angela Yao

机构 * National University of Singapore(新加坡国立大学) Huazhong University of Science & Technology(华中科技大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出VPG,一种无需训练、推理时引导的方法,通过对比生成前缀与损坏前缀下的模型输出来改进自回归图像和视频生成的下一步预测,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26064 2026-05-29 cs.CV cs.LG 83%

Paris 2.0: A Decentralized Diffusion Model for Video Generation

Paris 2.0: 一种去中心化的视频生成扩散模型

Ali Rouzbayani, Bidhan Roy, Marcos Villagra, Zhiying Jiang

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出Paris 2.0,首个通过去中心化计算预训练的视频生成模型,基于Paris 1.0的扩散模型框架,在低分辨率文本到视频任务中相比集中式模型将FVD从561.04降至279.01,提升约2倍,并提高了CLIP文本-视频相似度和美学评分。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21996 2026-05-29 cs.CV cs.AI 83%

VRAG: Learning World Models for Interactive Video Generation

VRAG:面向交互式视频生成的世界模型学习

Taiye Chen, Xun Hu, Zihan Ding, Chi Jin

机构 * Peking University(北京大学) University of Oxford(牛津大学) Princeton University(普林斯顿大学)

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV

AI总结 针对自回归视频生成中累积误差和记忆机制不足的问题,提出视频检索增强生成(VRAG)方法,通过显式全局状态条件降低长期累积误差并提升时空一致性。

Comments Published at NeurIPS 2025. Project page: https://sites.google.com/view/vrag

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28691 2026-05-28 cs.CV 83%

OSP-Next: Efficient High-Quality Video Generation with Sparse Sequence Parallelism, HiF8 Quantization, and Reinforcement Learning

OSP-Next: 结合稀疏序列并行、HiF8量化和强化学习的高效高质量视频生成

Yunyang Ge, Xianyi He, Zezhong Zhang, Bin Lin, Bin Zhu, Xinhua Cheng, Li Yuan

机构 * Peking University(北京大学) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出OSP-Next文本到视频生成模型,通过混合全稀疏注意力架构、稀疏序列并行(SSP)、HiF8量化和混合GRPO后训练,在保持高质量的同时显著提升效率,在NVIDIA H200和Ascend 950PR上实现1.5倍以上加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11564 2026-05-28 cs.CV 83%

LUVE : Latent-Cascaded Ultra-High-Resolution Video Generation with Dual Frequency Experts

LUVE:基于双频专家的潜在级联超高分辨率视频生成

Chen Zhao, Jiawei Chen, Hongyu Li, Zhuoliang Kang, Shilin Lu, Xiaoming Wei, Kai Zhang, Jian Yang, Ying Tai

机构 * Nanjing University(南京大学) Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出LUVE框架,通过三阶段潜在级联架构(低分辨率运动生成、潜在空间上采样、高分辨率内容精炼)结合双频专家,解决超高分辨率视频生成中的运动建模、语义规划和细节合成难题。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26316 2026-05-27 cs.CV cs.AI 83%

E$^3$C: Video Generation with 3D Environmental Memory and Ego-Exo Human Pose Control

E$^3$C: 具有3D环境记忆和自我-外部人体姿态控制的视频生成

Qiao Gu, Lingni Ma, Adam W Harley, Richard Newcombe, Florian Shkurti, Julian Straub

机构 * Meta Reality Labs(Meta现实实验室) University of Toronto(多伦多大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出E$^3$C可控视频扩散框架,通过3D点云记忆和双通道人体控制(自我与外骨骼),实现物理一致的自我中心视频生成。

Comments Preprint. Project Page: https://e3c-videogen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13428 2026-05-27 cs.CV cs.AI 83%

"PhyWorldBench": A Comprehensive Evaluation of Physical Realism in Text-to-Video Models

PhyWorldBench:文本到视频模型中物理真实性的全面评估

Jing Gu, Xian Liu, Yu Zeng, Ashwin Nagarajan, Fangrui Zhu, Daniel Hong, Yue Fan, Qianqi Yan, Kaiwen Zhou, Ming-Yu Liu, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) NVIDIA Research(NVIDIA研究) Northeastern University(东北大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV

AI总结 提出PhyWorldBench基准,通过1050个提示评估12个视频生成模型在物理规律遵循上的表现,并引入反物理类别,利用多模态大语言模型进行零样本评估。

Comments 35 pages, 21 figures

Journal ref ICLR 2026 oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05729 2026-05-27 cs.CV 83%

TAGRPO: Boosting GRPO on Image-to-Video Generation with Direct Trajectory Alignment

TAGRPO: 通过直接轨迹对齐提升图像到视频生成中的GRPO

Jin Wang, Jianxiang Lu, Guangzheng Xu, Comi Chen, Haoyu Yang, Linqing Wang, Peng Chen, Mingtao Chen, Zhichao Hu, Longhuang Wu, Shuai Shao, Qinglin Lu, Ping Luo

机构 * The University of Hong Kong(香港大学) Tencent Hunyuan(腾讯文心)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 针对图像到视频生成中GRPO优化效果不佳的问题,提出基于对比学习的TAGRPO框架,通过中间潜变量对齐高奖励轨迹并远离低奖励轨迹,结合记忆库提升多样性,显著优于DanceGRPO。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14993 2026-05-27 cs.CV cs.AI cs.LG 83%

Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation

Kandinsky 5.0:图像与视频生成的基础模型系列

Vladimir Arkhipkin, Vladimir Korviakov, Nikolai Gerasimenko, Denis Parkhomenko, Viacheslav Vasilev, Alexey Letunovskiy, Nikolai Vaulin, Maria Kovaleva, Ivan Kirillov, Lev Novitskiy, Denis Koposov, Nikita Kiselev, Alexander Varlamov, Dmitrii Mikhailov, Vladimir Polovnikov, Andrey Shutkin, Julia Agafonova, Ilya Vasiliev, Anastasiia Kargapoltseva, Anna Dmitrienko, Anastasia Maltseva, Anna Averchenkova, Olga Kim, Tatiana Nikulina, Denis Dimitrov

机构 * Kandinsky Lab(Kandinsky 实验室)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文介绍Kandinsky 5.0系列模型,通过多阶段训练、自监督微调和强化学习后训练,实现高分辨率图像和10秒视频的高质量生成。

Comments Website: https://kandinskylab.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25266 2026-05-26 cs.CV 83%

DeltaCam: Differential Intrinsic Camera Modeling for Video Generation

DeltaCam: 用于视频生成的差分内参相机建模

Debabrata Mandal, Zhihan Peng, Yujie Wang, Praneeth Chakravarthula

机构 * UNC, Chapel Hill USA(北卡罗来纳大学教堂山分校)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出DeltaCam视频扩散框架,通过差分参数化神经相机适配器学习相对变化,实现焦距、光圈、ISO等内参的平滑可控视频生成,并扩展到真实场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17837 2026-05-22 cs.CV cs.AI 83%

Temporal Aware Pruning for Efficient Diffusion-based Video Generation

具有时间意识的剪枝用于高效扩散式视频生成

Sheng Li, Yang Sui, Junhao Ran, Bo Yuan, Yue Dai, Xulong Tang

机构 * University of Pittsburgh(匹兹堡大学) Illinois Institute of Technology(伊利诺伊理工学院) Rutgers University(罗格斯大学) Rice University(Rice大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出TAPE,一种无需训练的时间感知剪枝方法,用于高效扩散式视频生成,通过时间平滑、层内token重选和时间步预算调度,提升生成效率并保持高质量视觉效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18365 2026-05-19 cs.CV 83%

GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation

GeoFlow: 在视频生成中强制隐式几何一致性

Jan Ackermann, Shengqu Cai, Boyang Deng, Zhengfei Kuang, Songyou Peng, Gordon Wetzstein

机构 * Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

专题命中 视频生成 :video generation(title);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出GeoFlow,一种通过强化学习微调来增强视频生成中几何一致性的方法,通过引入几何一致性奖励,有效减少时间上的几何伪影,同时保持感知质量。

Comments Project Page: https://geometryflow.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14988 2026-05-15 cs.CV 83%

Compositional Video Generation via Inference-Time Guidance

通过推理时间引导进行组合视频生成

Ariel Shaulov, Eitan Shaar, Amit Edenzon, Gal Chechik, Lior Wolf

机构 * Tel-Aviv University(特拉维夫大学) Bar Ilan University(巴伊兰大学) NVIDIA Research(NVIDIA研究)

专题命中 视频生成 :video generation(title);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出CVG方法,通过利用交叉注意力图中的空间时间接地信号,提升冻结文本到视频模型的组合忠实度,无需修改模型结构或微调生成器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01725 2026-05-15 cs.CV cs.AI 83%

Motion-Aware Caching for Efficient Autoregressive Video Generation

面向运动的缓存机制用于高效的自回归视频生成

Jing Xu, Yuexiao Ma, Xuzhe Zheng, Xing Wang, Shiwei Liu, Chenqian Yan, Xiawu Zheng, Rongrong Ji, Fei Chao, Songwei Liu

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,中国教育部,厦门大学) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV

AI总结 本文提出MotionCache,通过利用帧间差异作为轻量级像素运动特征代理,优化自回归视频生成中的缓存重用策略,实现6.28倍和1.64倍的速度提升,同时保持生成质量。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06892 2026-05-11 cs.CV 83%

Not All Tokens Need 40 Steps: Heterogeneous Step Allocation in Diffusion Transformers for Efficient Video Generation

并非所有标记都需要40步:扩散变换器中的异质步分配用于高效视频生成

Ernie Chu, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出HSA算法,通过根据速度动态分配不同时间空间标记的步数预算,提升视频生成效率,实验表明在加速运行时表现优于现有方法。

Comments Project page: https://ernestchu.github.io/hsa

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06667 2026-05-08 cs.CV cs.AI cs.LG 83%

ActCam: Zero-Shot Joint Camera and 3D Motion Control for Video Generation

ActCam: 零样本联合摄像机和3D运动控制用于视频生成

Omar El Khalifi, Thomas Rossi, Oscar Fossey, Thibault Fouque, Ulysse Mizrahi, Philip Torr, Ivan Laptev, Fabio Pizzati, Baptiste Bellot-Gurlet

机构 * University of Oxford(牛津大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 ActCam通过零样本方法实现视频生成中演员动作与摄像机轨迹的联合控制,通过几何一致的条件生成提升摄像机适应性和动作真实性。

Comments SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00658 2026-05-04 cs.CV 83%

UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors

UniVidX:一种基于扩散先验的统一多模态框架,用于 versatile 视频生成

Houyuan Chen, Hong Li, Xianghao Kong, Tianrui Zhu, Shaocong Xu, Weiqing Xiao, Yuwei Guo, Chongjie Ye, Lvmin Zhang, Hao Zhao, Anyi Rao

机构 * Beihang University(北京航空航天大学) Nanjing University(南京大学) Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 UniVidX 提出一种统一多模态框架,通过扩散先验实现 versatile 视频生成,采用随机条件掩码、解耦门控LoRA和跨模态自注意力等设计,提升多模态一致性与生成性能。

Comments Project page: https://houyuanchen111.github.io/UniVidX.github.io/ Accepted to ACM Transactions on Graphics (Proceedings of SIGGRAPH 2026)

Journal ref ACM Trans. Graph. 45, 4, Article 51 (July 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21362 2026-04-24 cs.CV 83%

KD-CVG: A Knowledge-Driven Approach for Creative Video Generation

KD-CVG:一种基于知识的创意视频生成方法

Linkai Liu, Wei Feng, Xi Zhao, Shen Zhang, Xingye Chen, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Yuchen Zhou, Zipeng Guo, Chao Gou

机构 * Sun Yat-sen University(中山大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出KD-CVG方法,通过构建广告创意知识库解决文本到视频模型在语义对齐和运动适应性方面的不足,提升创意视频生成效果。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19720 2026-04-22 cs.CV 83%

ReImagine: Rethinking Controllable High-Quality Human Video Generation via Image-First Synthesis

ReImagine:重新思考通过图像优先合成实现可控高质量人类视频生成

Zhengwentai Sun, Keru Zheng, Chenghong Li, Hongjie Liao, Xihe Yang, Heyuan Li, Yihao Zhi, Shuliang Ning, Shuguang Cui, Xiaoguang Han

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) Future Network of Intelligence Institute, CUHK-Shenzhen, China(CUHK-深圳智能网络研究院)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出通过图像优先合成方法,结合预训练图像模型与SMPL-X运动引导,生成高质量且时间一致的视频,同时释放人类数据集与辅助模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19473 2026-04-22 cs.CV 83%

TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation

TS-Attn:多事件视频生成的时序可分离注意力

Hongyu Zhang, Yufan Deng, Zilin Pan, Peng-Tao Jiang, Bo Li, Qibin Hou, Zhiyang Dou, Zhen Dong, Daquan Zhou

机构 * Peking University(北京大学) Shenzhen Graduate School(深圳研究生院) Zhejiang University(浙江大学) Nankai University(南开大学) Massachusetts Institute of Technology(麻省理工学院) Nanjing University(南京大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出TS-Attn机制,解决多事件视频生成中时序不一致与注意力冲突问题,提升生成质量,实验表明在两个数据集上效果显著。

Comments ICLR 2026, code available at: https://github.com/Hong-yu-Zhang/TS-Attn

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17397 2026-04-21 cs.CV cs.AI 83%

Speculative Decoding for Autoregressive Video Generation

推测解码用于自回归视频生成

Yuezhou Hu, Jintao Zhang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文探讨了推测解码在自回归视频生成中的应用,通过引入SDVG框架,利用图像质量路由替代token验证,实现高效视频生成,同时保持高质量并提升生成速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09721 2026-04-21 cs.CV 83%

FrameDiT: Diffusion Transformer with Matrix Attention for Efficient Video Generation

FrameDiT:基于矩阵注意力的扩散变换器用于高效视频生成

Minh Khoa Le, Kien Do, Duc Thanh Nguyen, Truyen Tran

机构 * Applied Artificial Intelligence Initiative, Deakin University, Australia(德肯大学应用人工智能倡议,澳大利亚) FPT Smart Cloud, Vietnam(越南FPT智能云) Deakin University, Australia(德肯大学,澳大利亚)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Matrix Attention,通过将帧视为矩阵来处理视频生成中的时空动态,结合FrameDiT-G和FrameDiT-H模型,在保持效率的同时提升了视频质量和时间一致性。

Comments Code: https://github.com/minhkhoale/FrameDiT Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12219 2026-04-15 cs.CV cs.AI 83%

Ride the Wave: Precision-Allocated Sparse Attention for Smooth Video Generation

乘风而行:面向平滑视频生成的精确分配稀疏注意力

Wentai Zhang, Ronghui Xi, Shiyao Peng, Jiayu Huang, Haoran Luo, Zichen Tang, Haihong E

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出PASA框架,通过动态预算分配、硬件对齐分组近似和随机选择偏置,实现高效且时间平滑的视频生成,减少视觉闪烁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10030 2026-04-14 cs.CV 83%

Prompt Relay: Inference-Time Temporal Control for Multi-Event Video Generation

提示中继:多事件视频生成的推理时时间控制

Gordon Chen, Ziqi Huang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Prompt Relay方法,通过在交叉注意力机制中引入惩罚项,实现多事件视频生成中的细粒度时间控制,提升文本-视频对齐和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏