arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6840 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2171 篇

2604.12309 2026-04-15 cs.CV 79%

Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors

通过3D基础先验实现逼真且一致的轨道视频生成

Rong Wang, Ruyi Zha, Ziang Cheng, Jiayu Yang, Pulak Purkait, Hongdong Li

机构 * Australian National University(澳大利亚国立大学) Amazon(亚马逊)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出利用3D基础生成模型的丰富形状先验作为辅助约束,以生成几何逼真且一致的轨道视频,通过多尺度latent特征提升生成效率和形状真实感。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12251 2026-04-15 cs.CV 79%

ArtifactWorld: Scaling 3D Gaussian Splatting Artifact Restoration via Video Generation Models

ArtifactWorld: 通过视频生成模型扩展3D高斯散射体修复

Xinliang Wang, Yifeng Shi, Zhenyu Wu

机构 * Ke Holdings Inc.(凯控股公司) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家研究院) Rajiv Gandhi University(拉朱·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 本文提出ArtifactWorld框架,通过系统数据扩展和双模型范式解决3DGS修复问题,利用视频扩散骨干网络和Artifact-Aware Triplet Fusion机制提升稀疏视图合成和3D重建性能。

Comments The second author is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11788 2026-04-14 cs.CV 79%

HDR Video Generation via Latent Alignment with Logarithmic Encoding

通过潜变量对齐与对数编码实现HDR视频生成

Naomi Ken Korem, Mohamed Oumoumad, Harel Cain, Matan Ben Yosef, Urska Jelercic, Ofir Bibi, Yaron Inger, Or Patashnik, Daniel Cohen-Or

机构 * Lightricks Gear Productions Tel Aviv University(特拉维夫大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出通过利用预训练生成模型的视觉先验,采用对数编码实现HDR视频生成,无需重新训练编码器,通过轻量微调即可实现高质量HDR视频生成。

Comments https://HDR-LumiVid.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06964 2026-04-14 cs.CV 79%

Adversarial Video Promotion Against Text-to-Video Retrieval

对抗性视频推广对抗文本到视频检索

Qiwei Tian, Chenhao Lin, Zhengyu Zhao, Qian Li, Shuai Liu, Chao Shen

机构 * Xi'an Jiaotong University(西安交通大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出首个对抗性视频推广攻击,通过改进的模态细化方法提升黑盒转移能力,实验显示在多种场景下攻击效果显著,揭示了文本到视频检索的潜在漏洞。

Comments This paper has been accepted by TIFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08121 2026-04-10 cs.CV cs.AI 79%

Uni-ViGU: Towards Unified Video Generation and Understanding via A Diffusion-Based Video Generator

Uni-ViGU:通过基于扩散的视频生成器实现视频生成与理解的统一

Luozheng Qin, Jia Gong, Qian Qiao, Tianjiao Li, Li Xu, Haoyu Pan, Chao Qu, Zhiyu Tan, Hao Li

机构 * Shanghai Academy of AI for Science(上海人工智能实验室) Fudan University(复旦大学) Independent Researcher(独立研究者) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Uni-ViGU通过基于扩散的视频生成器统一视频生成与理解,引入统一流方法和模态驱动的MoE框架,实现多模态生成与理解的协同优化。

Comments Page and Code: https://fr0zencrane.github.io/uni-vigu-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07310 2026-04-08 cs.CV 79%

MATRIX: Mask Track Alignment for Interaction-aware Video Generation

MATRIX:用于交互感知视频生成的遮罩跟踪对齐

Siyoon Jin, Seongchan Kim, Dahyun Chung, Jaeho Lee, Hyunwook Choi, Jisu Nam, Jiyoung Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能系)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 MATRIX通过引入遮罩跟踪对齐方法,提升视频生成中交互感知能力,增强语义对齐与传播,减少漂移和幻觉。

Comments Project Page is available at: https://cvlab-kaist.github.io/MATRIX/, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04570 2026-04-08 cs.CV cs.CL 79%

Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm

通过视频思考:视频生成作为一种有前途的多模态推理范式

Jingqi Tong, Yurong Mou, Hangcheng Li, Mingzhe Li, Yongzhuo Yang, Ming Zhang, Qiguang Chen, Tianyi Liang, Xiaomeng Hu, Yining Zheng, Xinchi Chen, Jun Zhao, Xuanjing Huang, Xipeng Qiu

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究所) Shanghai Innovation Institute(上海创新研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) The Chinese University of Hong Kong(香港中文大学) Central South University(中南大学) Fudan University(复旦大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出'通过视频思考'范式,利用视频生成模型实现多模态推理,通过VideoThinkBench评估显示Sora-2在视觉和文本任务中均表现出色,证明视频生成模型在统一多模态理解与生成中的潜力。

Comments 34 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24702 2026-04-07 cs.CV 79%

Enhancing Physical Plausibility in Video Generation by Reasoning the Implausibility

通过推理不合理的部分来增强视频生成的物理合理性

Yutong Hao, Chen Chen, Ajmal Saeed Mian, Chang Xu, Daochang Liu

机构 * University of Western Australia(西澳大利亚大学) University of Sydney(悉尼大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出一种无需训练的框架,在推理阶段通过显式推理不合理性来提升视频生成的物理合理性,通过同步解耦引导策略和物理感知推理流程,有效抑制不合理内容,提升物理真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03738 2026-04-07 cs.CV 79%

Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation

重新思考位置嵌入作为多参考和多镜头视频生成的上下文控制器

Binyuan Huang, Yuning Lu, Weinan Jia, Hualiang Wang, Mu Liu, Daiqing Yang

机构 * Wuhan University(武汉大学) University of Science and Technology of China(中国科学技术大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出PoCo方法,通过引入位置嵌入作为额外的上下文控制,解决多参考和多镜头视频生成中参考混淆问题,提升跨镜头一致性和参考保真度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16933 2026-04-06 cs.CV cs.LG 79%

Reward-Forcing: Autoregressive Video Generation with Reward Feedback

基于奖励的强制:利用奖励反馈的自回归视频生成

Jingran Zhang, Ning Li, Yuanhao Ban, Andrew Bai, Justin Cui

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出一种利用奖励信号指导生成的自回归视频生成方法,提升了生成效率和可扩展性,实验表明其性能与现有自回归模型相当,甚至在某些情况下超越了双向模型。

Comments https://openreview.net/forum?id=K8Qjsxxl7y&noteId=K8Qjsxxl7y

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24458 2026-04-03 cs.CV 79%

OmniWeaving: Towards Unified Video Generation with Free-form Composition and Reasoning

OmniWeaving:迈向统一视频生成的自由组合与推理

Kaihang Pan, Qi Tian, Jianwei Zhang, Weijie Kong, Jiangfeng Xiong, Yanxin Long, Shixue Zhang, Haiyi Qiu, Tan Wang, Zheqi Lv, Yue Wu, Liefeng Bo, Siliang Tang, Zhao Zhong

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯混元) Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出OmniWeaving模型,通过大规模预训练数据学习多模态组合与推理能力,引入IntelligentVBench基准测试,展示其在开放源码统一视频生成中的领先性能。

Comments 32 pages, 22 figures. Project Page: https://omniweaving.github.io. Github: https://github.com/Tencent-Hunyuan/OmniWeaving. Model: https://huggingface.co/tencent/HY-OmniWeaving

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22193 2026-04-03 cs.CV 79%

PAM: A Pose-Appearance-Motion Engine for Sim-to-Real HOI Video Generation

PAM:一种用于仿真到现实手-物体互动视频生成的姿态-外观-运动引擎

Mingju Gao, Kaisen Yang, Huan-ang Gao, Bohan Li, Ao Ding, Wenyi Li, Yangcheng Yu, Jinkun Liu, Shaocong Xu, Yike Niu, Haohan Chi, Hao Chen, Hao Tang, Yu Zhang, Li Yi, Hao Zhao

机构 * Peking University(北京大学) Tsinghua University(清华大学) BAAI(北京智源人工智能研究院) SJTU(上海交通大学) Eastern Institute of Technology(东方理工高等研究院) University of Cambridge(剑桥大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出PAM引擎,整合姿态、外观和运动生成可控的HOI视频,通过实验验证其在DexYCB和OAKINK2数据集上的性能优势。

Comments Accepted to CVPR 2026 Code: https://github.com/GasaiYU/PAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08210 2026-04-02 cs.CV 79%

Video2LoRA: Unified Semantic-Controlled Video Generation via Per-Reference-Video LoRA

Video2LoRA:通过每参考视频LoRA实现统一的语义控制视频生成

Zexi Wu, Baolu Li, Jing Dai, Yiming Zhang, Yue Ma, Qinghe Wang, Xu Jia, Hongming Xu

机构 * Dalian University of Technology(大连理工大学) HKUST(香港科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出Video2LoRA框架,通过轻量级超网络预测个性化LoRA权重,实现灵活高效的语义控制视频生成,模型重量小于150MB,具备良好的零样本泛化能力。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29931 2026-04-01 cs.CV 79%

Gloria: Consistent Character Video Generation via Content Anchors

Gloria:通过内容锚点实现一致的字符视频生成

Yuhang Yang, Fan Zhang, Huaijin Pi, Shuai Guo, Guowei Xu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, USTC(教育部类脑智能感知与认知重点实验室,中国科学技术大学) UNSW(新南威尔士大学) HKU(香港大学) UESTC(电子科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本研究提出通过紧凑的锚帧集表示字符视觉属性,结合两种机制提升生成一致性,实现高质量多视角一致的字符视频生成。

Comments Accepted by CVPR2026 Main, project: https://yyvhang.github.io/Gloria_Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06537 2026-04-01 cs.CV cs.AI 79%

ProFashion: Prototype-guided Fashion Video Generation with Multiple Reference Images

ProFashion: 基于多参考图像的原型引导时尚视频生成

Xianghao Kong, Qiaosong Qi, Yuanbin Wang, Biaolong Chen, Aixi Zhang, Anyi Rao

机构 * The Hong Kong University of Science and Technology(香港科技大学) Taobao & Tmall Group(淘宝天猫集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出ProFashion框架,利用多参考图像提升视图一致性和时间一致性,通过姿态感知原型聚合器和流增强原型生成器改进时尚视频生成。

Comments CVPRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27915 2026-03-31 cs.CV 79%

FlashSign: Pose-Free Guidance for Efficient Sign Language Video Generation

FlashSign:无需姿态的高效手语视频生成

Liuzhou Zhang, Zeyu Zhang, Biao Wu, Luyao Tang, Zirui Song, Hongyang He, Renda Han, Guangzhen Yao, Huacan Wang, Ronghao Chen, Xiuying Chen, Guan Huang, Zheng Zhu

机构 * HUST(华中科技大学) GigaAI UTS(悉尼科技大学) HKU(香港大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Warwick(华威大学) TJU(天津大学) NNU(南京师范大学) UCAS(中国科学院大学) UTHealth Houston(德克萨斯大学休斯顿健康科学中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出无需姿态表示的高效手语视频生成框架,通过扩散模型直接映射自然语言文本到手语视频,引入可训练滑动瓷砖注意力机制提升推理效率,实现3.07倍的生成速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09104 2026-03-31 cs.CV 79%

Training-free Motion Factorization for Compositional Video Generation

无需训练的运动因子分解用于组合视频生成

Zixuan Wang, Ziqin Zhou, Feng Chen, Duo Peng, Yixin Hu, Changsheng Li, Yinjie Lei

机构 * Sichuan University(四川大学) The University of Adelaide(阿德莱德大学) Nanyang Technological University(南洋理工大学) Beijing Institute of Technology(北京理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出一种无需训练的运动因子分解框架,将复杂运动分解为静止、刚体和非刚体运动三类,通过规划先于生成的范式,提升视频生成中运动多样性的表现。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03619 2026-03-31 cs.CV 79%

LAMP: Language-Assisted Motion Planning for Controllable Video Generation

LAMP:语言辅助运动规划用于可控视频生成

Muhammed Burak Kizil, Enes Sanli, Niloy J. Mitra, Erkut Erdem, Aykut Erdem, Duygu Ceylan

机构 * Koç University(科奇大学) University College London(伦敦大学学院) Hacettepe University(哈斯特帕大学) Adobe Research(Adobe研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 LAMP通过大语言模型生成3D轨迹,实现基于自然语言的视频生成,提升运动可控性和用户意图对齐。

Comments CVPR 2026. Project Page: https://cyberiada.github.io/LAMP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26610 2026-03-30 cs.CV cs.AI 79%

Think over Trajectories: Leveraging Video Generation to Reconstruct GPS Trajectories from Cellular Signaling

轨迹思考:利用视频生成从蜂窝信号中重建GPS轨迹

Ruixing Zhang, Hanzhang Jiang, Leilei Sun, Liangzhe Han, Jibin Wang, Weifeng Lv

机构 * The State Key Laboratory of Complex and Critical Software Environment, Beihang University(北京航空航天大学复杂与关键软件环境国家重点实验室) H3I, Beihang University(北京航空航天大学H3I) China Mobile Information Technology Center(中国移动信息技术中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出Sig2GPS方法,通过视频生成技术从蜂窝信号中重建高精度GPS轨迹,利用地图视觉域直接生成连续路径,提升轨迹数据挖掘的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25188 2026-03-27 cs.CV 79%

AnyID: Ultra-Fidelity Universal Identity-Preserving Video Generation from Any Visual References

AnyID: 从任意视觉参考生成超保真度的通用身份保持视频

Jiahao Wang, Hualian Sheng, Sijia Cai, Yuxiao Yang, Weizhan Zhang, Caixia Yan, Bing Deng, Jieping Ye

机构 * School of Computer Science and Technology, MOEKLINNS, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院、MOEKLINNS) Alibaba Cloud Computing(阿里云计算有限公司) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 AnyID通过引入可扩展的多参考架构和主参考生成范式,实现从多种异构身份输入生成高保真的视频,通过大规模数据集训练和强化学习微调提升身份保真度和属性可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03334 2026-03-25 cs.CV 79%

UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions

UniAVGen:基于非对称跨模态交互的统一音频视频生成

Guozhen Zhang, Zixiang Zhou, Teng Hu, Ziqiao Peng, Youliang Zhang, Yi Chen, Yuan Zhou, Qinglin Lu, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Tencent Hunyuan(腾讯文英) Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 UniAVGen通过非对称跨模态交互机制和双分支联合合成架构,实现了音频视频的统一生成,提升同步精度和语义一致性,实验表明其在较少训练样本下表现更优。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21872 2026-03-24 cs.CV cs.AI 79%

Manifold-Aware Exploration for Reinforcement Learning in Video Generation

面向流形的探索用于视频生成的强化学习

Mingzhe Zheng, Weijie Kong, Yue Wu, Dengyang Jiang, Yue Ma, Xuanhua He, Bin Lin, Kaixiong Gong, Zhao Zhong, Liefeng Bo, Qifeng Chen, Harry Yang

机构 * Tencent Hunyuan(腾讯文脉)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出SAGE-GRPO方法,通过在微和宏观层面约束探索,确保在视频数据流形附近进行,提升视频生成的质量和奖励估计的可靠性。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11438 2026-03-24 cs.CV cs.AI 79%

Flowception: Temporally Expansive Flow Matching for Video Generation

Flowception:用于视频生成的时序扩展流匹配

Tariq Berrada Ifriqi, John Nguyen, Karteek Alahari, Jakob Verbeek, Ricky T. Q. Chen

机构 * FAIR at Meta Univ.\ Grenoble Alpes, Inria, CNRS, Grenoble INP, LJK, France

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Flowception提出了一种非自回归且可变长度的视频生成框架,通过交替插入离散帧与连续去噪帧学习概率路径,减少误差积累并提升长序列处理效率,实验显示其在FVD和VBench指标上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07901 2026-03-23 cs.CV 79%

Stand-In: A Lightweight and Plug-and-Play Identity Control for Video Generation

Stand-In: 一种轻量级且即插即用的身份控制方法用于视频生成

Bowen Xue, Zheng-Peng Duan, Qixin Yan, Wenjing Wang, Hao Liu, Chun-Le Guo, Chongyi Li, Chen Li, Jing Lyu

机构 * WeChat Vision, Tencent Inc.(腾讯微信视觉实验室) VCIP, CS, Nankai University(南开大学计算机科学与技术学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出Stand-In框架,通过引入条件图像分支和受限自注意力机制,实现轻量级身份控制,仅用1%额外参数和2000训练对即可提升视频质量和身份保持性,并支持多种视频生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18524 2026-03-20 cs.CV 79%

3DreamBooth: High-Fidelity 3D Subject-Driven Video Generation Model

3DreamBooth:高保真3D主体驱动视频生成模型

Hyun-kyu Ko, Jihyeon Park, Younghyun Kim, Dongheok Park, Eunbyung Park

机构 * Yonsei University(延世大学) Sungkyunkwan University(成均馆大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出3DreamBooth和3Dapter框架,通过单帧优化解耦空间几何与时间运动,构建鲁棒3D先验,提升纹理细节并加速收敛,解决3D主体定制中的空间先验不足问题。

Comments Project page: https://ko-lani.github.io/3DreamBooth Code: https://github.com/Ko-Lani/3DreamBooth

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17375 2026-03-19 cs.CV 79%

Stereo World Model: Camera-Guided Stereo Video Generation

立体世界模型:基于摄像头的立体视频生成

Yang-Tian Sun, Zehuan Huang, Yifan Niu, Lin Ma, Yan-Pei Cao, Yuewen Ma, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) VAST ByteDance Pico(字节跳动Pico)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出StereoWorld,一种基于摄像头的立体世界模型,通过联合学习外观和双眼几何实现端到端的立体视频生成。该模型在RGB模态中操作,直接从视差中获取几何信息,通过统一的相机帧RoPE和立体感知注意力分解提升生成效率和一致性。

Comments Project Page: https://sunyangtian.github.io/StereoWorld-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01419 2026-03-19 cs.CV 79%

Towards One-step Causal Video Generation via Adversarial Self-Distillation

基于对抗自蒸馏的单步因果视频生成

Yongqi Yang, Huayang Huang, Xu Peng, Xiaobin Hu, Donghao Luo, Jiangning Zhang, Chengjie Wang, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Tencent YouTu Lab(腾讯优图实验室) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出基于蒸馏的高效因果视频生成框架,通过对抗自蒸馏策略提升生成质量,结合首帧增强策略减少误差传播,实验表明在单步和双步视频生成中优于现有方法。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13506 2026-03-18 cs.CV 79%

LibraGen: Playing a Balance Game in Subject-Driven Video Generation

LibraGen:在以主题驱动的视频生成中进行平衡游戏

Jiahao Zhu, Shanshan Lao, Lijie Liu, Gen Li, Tianhao Qi, Wei Han, Bingchuan Li, Fangfang Liu, Zhuowei Chen, Tianxiang Ma, Qian HE, Yi Zhou, Xiaohua Xie

机构 * Pazhou Laboratory (Huangpu)(黄埔实验室( Pazhou))

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 LibraGen通过平衡视频生成基础模型的内在先验与主题到视频能力,提出了一种新的框架,采用质量优先策略和动态分类器自由引导方案,提升生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14938 2026-03-17 cs.CV 79%

FAR-Drive: Frame-AutoRegressive Video Generation in Closed-Loop Autonomous Driving

FAR-Drive:闭环自动驾驶中的帧自回归视频生成

Yaoru Li, Federico Landi, Marco Godi, Xin Jin, Ruiju Fu, Yufei Ma, Muyang Sun, Heyu Si, Qi Guo

机构 * Zhejiang University(浙江大学) Huawei(华为)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出FAR-Drive,一种用于自动驾驶的帧级自回归视频生成框架,通过多视角扩散变换器实现几何一致的多摄像机生成,解决闭环模拟中的长时程一致性、自回归退化和低延迟问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13438 2026-03-17 cs.CV cs.AI 79%

Draft-and-Target Sampling for Video Generation Policy

视频生成策略的草稿与目标采样

Qikang Zhang, Yingjie Lei, Wei Liu, Daochang Liu

机构 * South China Normal University(华南师范大学) University of Western Australia(西澳大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出一种无训练的扩散推理范式,通过自play去噪方法提升视频生成效率,实验表明在三个基准上实现2.1倍加速,同时保持高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏