arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2158 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2158 篇

2511.22974 2025-12-01 cs.CV 79%

McSc: Motion-Corrective Preference Alignment for Video Generation with Self-Critic Hierarchical Reasoning

McSc: 基于自批评分层推理的视频生成运动校正偏好对齐

Qiushi Yang, Yingjie Chen, Yuan Yao, Yifang Men, Huaizhuo Liu, Miaomiao Cui

机构 * Tongyi Lab, Alibaba Group(阿里集团通义实验室)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

AI总结 McSc通过自批评分层推理框架,提升视频生成中对人类偏好的对齐精度,减少对低运动内容的偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21136 2025-11-27 cs.CV cs.AI 79%

Efficient Training for Human Video Generation with Entropy-Guided Prioritized Progressive Learning

高效训练人类视频生成的熵引导优先级渐进学习

Changlin Li, Jiawei Zhang, Shuhao Liu, Sihao Lin, Zeyi Shi, Zhihui Li, Xiaojun Chang

机构 * Stanford University(斯坦福大学) North China Electric Power University(华北电力大学) University of Adelaide(阿德莱德大学) University of Technology Sydney(悉尼技术大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出熵引导优先级渐进学习方法,通过条件熵膨胀和自适应渐进计划,高效训练扩散模型生成人类视频,实现训练速度提升和内存消耗降低。

Comments Project page: https://github.com/changlin31/Ent-Prog

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18780 2025-11-27 cs.CV cs.AI 79%

ConceptGuard: Proactive Safety in Text-and-Image-to-Video Generation through Multimodal Risk Detection

ConceptGuard:通过多模态风险检测实现文本-图像到视频生成的主动安全

Ruize Ma, Minghong Cai, Yilei Jiang, Jiaming Han, Yi Feng, Yingshui Tan, Xiaoyong Zhu, Bo Zhang, Bo Zheng, Xiangyu Yue

机构 * CUHK MMLab(香港中文大学多模态实验室) Future Lab, Alibaba Group(阿里巴巴集团未来实验室) Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 ConceptGuard通过多模态风险检测实现文本-图像到视频生成的主动安全,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19386 2025-11-27 cs.CV cs.AI 79%

Force Prompting: Video Generation Models Can Learn and Generalize Physics-based Control Signals

力提示:视频生成模型可以学习并泛化基于物理的控制信号

Nate Gillman, Charles Herrmann, Michael Freeman, Daksh Aggarwal, Evan Luo, Deqing Sun, Chen Sun

机构 * Brown University(布朗大学) Google DeepMind(谷歌DeepMind)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出力提示方法,通过物理力信号生成逼真视频,利用视觉和运动先验实现物理控制信号的泛化,提升世界模型的物理真实性。

Comments Camera ready version (NeurIPS 2025). Code and interactive demos at https://force-prompting.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20563 2025-11-26 cs.CV 79%

A Reason-then-Describe Instruction Interpreter for Controllable Video Generation

用于可控视频生成的指令解释器

Shengqiong Wu, Weicai Ye, Yuanxing Zhang, Jiahao Wang, Quande Liu, Xintao Wang, Pengfei Wan, Kun Gai, Hao Fei, Tat-Seng Chua

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 ReaDe通过推理后再描述的方法,将模糊用户指令转化为精确规范,提升可控视频生成的准确性和质量。

Comments 27 pages, 13 figures, 13 tables, Project Page: https://sqwu.top/ReaDe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20280 2025-11-26 cs.CV 79%

Bootstrapping Physics-Grounded Video Generation through VLM-Guided Iterative Self-Refinement

通过VLM引导的迭代自优化提升物理导向的视频生成

Yang Liu, Xilin Zhao, Peisong Wen, Siran Dai, Qingming Huang

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出一种通过VLM引导的迭代自优化方法,提升视频生成的物理一致性,实验显示在PhyIQ基准上得分提升明显。

Comments ICCV 2025 Physics-IQ Challenge Third Place Solution

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20186 2025-11-26 cs.CV 79%

Exo2EgoSyn: Unlocking Foundation Video Generation Models for Exocentric-to-Egocentric Video Synthesis

Exo2EgoSyn: 解锁用于外视图到内视图视频合成的基础视频生成模型

Mohammad Mahdi, Yuqian Fu, Nedko Savov, Jiancheng Pan, Danda Pani Paudel, Luc Van Gool

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Exo2EgoSyn通过三个模块实现从第三人称视角生成高保真内视图视频,提升跨视角视频合成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19835 2025-11-26 cs.CV cs.AI 79%

Rectified SpaAttn: Revisiting Attention Sparsity for Efficient Video Generation

校正SpaAttn:重新审视注意力稀疏性以实现高效的视频生成

Xuewen Liu, Zhikai Li, Jing Zhang, Mengjuan Chen, Qingyi Gu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出Rectified SpaAttn,通过校正注意力分配提升视频生成效率,实现显著速度提升且保持生成质量。

Comments Code at https://github.com/BienLuky/Rectified-SpaAttn

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19049 2025-11-25 cs.CV 79%

Beyond Reward Margin: Rethinking and Resolving Likelihood Displacement in Diffusion Models via Video Generation

超越奖励边际:通过视频生成重新思考和解决扩散模型中的似然位移

Ruojun Xu, Yu Kai, Xuhua Ren, Jiaxiang Cheng, Bing Ma, Tianxiang Zheng, Qinhlin Lu

机构 * Zhejiang University(浙江大学) Tencent(腾讯)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出PG-DPO方法,通过结合ARS和IPR缓解扩散模型中的似然位移问题,提升视频生成任务的偏好对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18684 2025-11-25 cs.CV 79%

Now You See It, Now You Don't - Instant Concept Erasure for Safe Text-to-Image and Video Generation

现在你看见它,现在你又看不见 - 用于安全文本到图像和视频生成的即时概念消除

Shristi Das Biswas, Arani Roy, Kaushik Roy

机构 * Purdue University(普渡大学)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

AI总结 ICE通过无需训练的一次性权重修改方法,实现文本到图像和视频生成中精确且持久的概念消除,无需额外开销,提升安全性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23951 2025-11-25 cs.CV 79%

JointTuner: Appearance-Motion Adaptive Joint Training for Customized Video Generation

JointTuner: 用于定制视频生成的外观-运动自适应联合训练

Fangda Chen, Shanshan Zhao, Chuanfu Xu, Long Lan

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) Alibaba International Digital Commerce(阿里巴巴国际数字商业)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 JointTuner通过联合优化外观和运动组件,提出GLoRA和AiT Loss解决定制视频生成中的外观污染和运动模式学习问题。

Comments Project Page: https://fdchen24.github.io/JointTuner-Website

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18102 2025-11-25 cs.CV 79%

Spotlight: Identifying and Localizing Video Generation Errors Using VLMs

Spotlight: 利用视觉语言模型识别和定位视频生成错误

Aditya Chinchure, Sahithya Ravi, Pushkar Shukla, Vered Shwartz, Leonid Sigal

机构 * The University of British Columbia(不列颠哥伦比亚大学) Vector Institute of AI(向量人工智能研究所) The Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

AI总结 Spotlight任务通过定位和解释视频生成错误,揭示VLMs在错误识别和定位上的不足,并提出改进策略以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17450 2025-11-24 cs.CV cs.AI cs.CL 79%

Planning with Sketch-Guided Verification for Physics-Aware Video Generation

基于草图引导验证的物理感知视频生成规划

Yidong Huang, Zun Wang, Han Lin, Dong-Ki Kim, Shayegan Omidshafiei, Jaehong Yoon, Yue Zhang, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) FieldAI Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 SketchVerify通过草图验证和动态轨迹优化提升物理感知视频生成的效率与质量。

Comments website: https://sketchverify.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03135 2025-11-24 cs.CV cs.RO 79%

Mask2IV: Interaction-Centric Video Generation via Mask Trajectories

Mask2IV: 通过遮罩轨迹实现以交互为中心的视频生成

Gen Li, Bo Zhao, Jianfei Yang, Laura Sevilla-Lara

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Mask2IV通过遮罩轨迹实现以交互为中心的视频生成,提供灵活的交互控制和高真实感的视频生成。

Comments AAAI 2026. Project page: https://reagan1311.github.io/mask2iv

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12371 2025-11-18 cs.CV 79%

Reasoning Text-to-Video Retrieval via Digital Twin Video Representations and Large Language Models

Yiqing Shen, Chenxiao Fan, Chenjia Li, Mathias Unberath

机构 * Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10202 2025-11-17 cs.CL cs.CV 79%

Q2E: Query-to-Event Decomposition for Zero-Shot Multilingual Text-to-Video Retrieval

Shubhashis Roy Dipta, Francis Ferraro

机构 * Department of Computer Science and Electrical Engineering University of Maryland Baltimore County(计算机科学与电气工程系马里兰大学巴尔的摩县)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

Comments Accepted in IJCNLP-AACL 2025 (also presented in MAGMAR 2025 at ACL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01450 2025-11-11 cs.CV cs.AI 79%

Reg-DPO: SFT-Regularized Direct Preference Optimization with GT-Pair for Improving Video Generation

Jie Du, Xinyu Gong, Qingshan Tan, Wen Li, Yangming Cheng, Weitao Wang, Chenlu Zhan, Suhui Wu, Hao Zhang, Jun Zhang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments The paper is withdrawn due to the need for further revision and verification of experimental results. A revised version will be resubmitted once the updates are completed

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20358 2025-11-11 cs.CV 79%

PhysCtrl: Generative Physics for Controllable and Physics-Grounded Video Generation

Chen Wang, Chuhao Chen, Yiming Huang, Zhiyang Dou, Yuan Liu, Jiatao Gu, Lingjie Liu

机构 * University of Pennsylvania(宾夕法尼亚大学) HKU(香港大学) HKUST(香港科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments NeurIPS 2025 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09045 2025-11-06 cs.CV 79%

MagCache: Fast Video Generation with Magnitude-Aware Cache

Zehong Ma, Longhui Wei, Feng Wang, Shiliang Zhang, Qi Tian

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Huawei Inc.(华为公司)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

Comments Project Page: https://zehong-ma.github.io/MagCache Accepted by NeurIPS 2025

Journal ref In Proceedings of NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00107 2025-11-04 cs.CV cs.AI cs.IR 79%

AI Powered High Quality Text to Video Generation with Enhanced Temporal Consistency

Piyushkumar Patel

机构 * Microsoft(微软)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24717 2025-10-29 cs.CV 79%

Uniform Discrete Diffusion with Metric Path for Video Generation

Haoge Deng, Ting Pan, Fan Zhang, Yang Liu, Zhuoyan Luo, Yufeng Cui, Wenxuan Wang, Chunhua Shen, Shiguang Shan, Zhaoxiang Zhang, Xinlong Wang

机构 * National Laboratory of Pattern Recognition, CASIA(中国科学院自动化所模式识别国家实验室) Key Laboratory of Intelligent Information Processing, ICT, CAS(中国科学院信息科技重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13918 2025-10-28 cs.CV cs.AI cs.GR cs.LG 79%

Improving Video Generation with Human Feedback

Jie Liu, Gongye Liu, Jiajun Liang, Ziyang Yuan, Xiaokun Liu, Mingwu Zheng, Xiele Wu, Qiulin Wang, Menghan Xia, Xintao Wang, Xiaohong Liu, Fei Yang, Pengfei Wan, Di Zhang, Kun Gai, Yujiu Yang, Wanli Ouyang

机构 * MMLab, CUHK(CUHK媒体实验室) Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments https://github.com/KwaiVGI/VideoAlign

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11224 2025-10-24 cs.CV cs.GR 79%

GenLit: Reformulating Single-Image Relighting as Video Generation

Shrisha Bharadwaj, Haiwen Feng, Giorgio Becherini, Victoria Fernandez Abrevaya, Michael J. Black

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17519 2025-10-23 cs.CV cs.AI 79%

MUG-V 10B: High-efficiency Training Pipeline for Large Video Generation Models

Yongshun Zhang, Zhongyi Fan, Yonghang Zhang, Zhangzikang Li, Weifeng Chen, Zhongwei Feng, Chaoyue Wang, Peng Hou, Anxiang Zeng

机构 * LLM Team, Shopee Pte. Ltd.(Shopee 股份有限公司语言模型团队)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Technical Report; Project Page: https://github.com/Shopee-MUG/MUG-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14847 2025-10-23 cs.CV 79%

ImagerySearch: Adaptive Test-Time Search for Video Generation Beyond Semantic Dependency Constraints

Meiqi Wu, Jiashu Zhu, Xiaokun Feng, Chubin Chen, Chen Zhu, Bingze Song, Fangyuan Mao, Jiahong Wu, Xiangxiang Chu, Kaiqi Huang

机构 * UCAS(中国科学院大学) AMAP, Alibaba Group(阿里云实验室) CRISE(中国科学院计算技术研究所) THU(清华大学) SEU(上海电子科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18775 2025-10-22 cs.CV 79%

UltraGen: High-Resolution Video Generation with Hierarchical Attention

Teng Hu, Jiangning Zhang, Zihan Su, Ran Yi

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16833 2025-10-21 cs.CV cs.GR 79%

From Mannequin to Human: A Pose-Aware and Identity-Preserving Video Generation Framework for Lifelike Clothing Display

Xiangyu Mu, Dongliang Zhou, Jie Hou, Haijun Zhang, Weili Guan

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14588 2025-10-21 cs.CV cs.AI 79%

STANCE: Motion Coherent Video Generation Via Sparse-to-Dense Anchored Encoding

Zhifei Chen, Tianshuo Xu, Leyi Wu, Luozhou Wang, Dongyu Yan, Zihan You, Wenting Luo, Guo Zhang, Yingcong Chen

机构 * HKUST(GZ)(香港科技大学(珠海)) HKUST(香港科技大学) XMU(厦门大学) MIT(麻省理工学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Code, model, and demos can be found at https://envision-research.github.io/STANCE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17041 2025-10-21 cs.CV cs.AI cs.LG 79%

Free$^2$Guide: Training-Free Text-to-Video Alignment using Image LVLM

Jaemin Kim, Bryan Sangwoo Kim, Jong Chul Ye

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

Comments ICCV 2025 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13809 2025-10-16 cs.CV 79%

PhysMaster: Mastering Physical Representation for Video Generation via Reinforcement Learning

Sihui Ji, Xi Chen, Xin Tao, Pengfei Wan, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project Page: https://sihuiji.github.io/PhysMaster-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏