arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2160 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2160 篇

2509.23279 2026-04-07 cs.CV cs.AI 74%

Vid-Freeze: Protecting Images from Malicious Image-to-Video Generation via Temporal Freezing

Vid-Freeze:通过时间冻结保护图像免受恶意图像到视频生成的侵害

Rohit Chowdhury, Aniruddha Bala, Rohan Jaiswal, Siddharth Roheda

机构 * Samsung(三星)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出Vid-Freeze,通过在生成视频中添加不可察觉的扰动,强制时间冻结,抑制I2V模型中的注意力动态,从而阻止恶意内容生成。

Comments Under Review at ACM-MM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25931 2026-03-30 cs.CV cs.AI 74%

DiReCT: Disentangled Regularization of Contrastive Trajectories for Physics-Refined Video Generation

DiReCT:对比轨迹解耦的对比正则化用于物理精细视频生成

Abolfazl Meyarian, Amin Karimi Monsefi, Rajiv Ramnath, Ser-Nam Lim

机构 * Path Robotics The Ohio State University(俄亥俄州立大学) University of Central Florida(中佛罗里达大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出DiReCT方法,通过解耦对比轨迹正则化提升物理精细视频生成的物理合理性,改进VideoPhy的物理常识评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23132 2026-03-25 cs.CV 74%

InterDyad: Interactive Dyadic Speech-to-Video Generation by Querying Intermediate Visual Guidance

InterDyad:通过查询中间视觉指导实现交互式双人语音到视频生成

Dongwei Pan, Longwei Guo, Jiazhi Guan, Luying Huang, Yiding Li, Haojie Liu, Haocheng Feng, Wei He, Kaisiyuan Wang, Hang Zhou

机构 * Baidu Inc.(百度公司)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出InterDyad框架,通过查询结构运动指导实现自然交互动态合成,解决双人场景中跨个体依赖和精细行为控制问题,提出交互性注入器、元查询模态对齐机制和角色感知双人高斯指导等方法,提升唇形同步和空间一致性。

Comments Project Page: https://interdyad.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21299 2026-03-24 cs.CV 74%

Identity-Consistent Video Generation under Large Facial-Angle Variations

在大面部角度变化下实现身份一致的视频生成

Bin Hu, Zipeng Qi, Guoxi Huang, Zunnan Xu, Ruicheng Zhang, Chongjie Ye, Jun Zhou, Xiu Li, Jingdong Wang

机构 * Tsinghua University(清华大学) Baidu Inc., China(百度公司) University of Bristol(布里斯托大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出Mv²ID框架,通过区域遮蔽训练策略和参考解耦RoPE机制,解决大角度变化下的身份一致性与自然运动平衡问题,并构建大规模数据集和评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16931 2026-03-19 cs.CV cs.AI 74%

Script-to-Slide Grounding: Grounding Script Sentences to Slide Objects for Automatic Instructional Video Generation

脚本到幻灯片接地:将脚本句子接地到幻灯片对象以实现自动教学视频生成

Rena Suzuki, Masato Kikuchi, Tadachika Ozono

机构 * Nagoya Institute of Technology(名古屋技术大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出Script-to-Slide Grounding任务,利用大语言模型实现脚本与幻灯片对象的自动接地,实验显示F1分数达0.924,为自动化幻灯片视频编辑奠定基础。

Comments The 21st International Conference on E-Service and Knowledge Management (ESKM 2025-Winter)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09488 2026-03-12 cs.CV 74%

Streaming Autoregressive Video Generation via Diagonal Distillation

通过对角蒸馏实现流式自回归视频生成

Jinxiu Liu, Xuanming Liu, Kangfu Mei, Yandong Wen, Ming-Hsuan Yang, Weiyang Liu

机构 * South China University of Technology(南方科技大学) Westlake University(西湖大学) Johns Hopkins University(约翰霍普金斯大学) University of California, Merced(加州大学默塞德分校) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出对角蒸馏方法,通过不对称生成策略和隐式光学流建模,在减少计算步骤的同时提升视频生成的运动质量和效率。

Comments ICLR 2026 (31 pages, 10 figures, project page: https://spherelab.ai/diagdistill/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03646 2026-03-05 cs.CV 74%

InfinityStory: Unlimited Video Generation with World Consistency and Character-Aware Shot Transitions

InfinityStory: 无限视频生成与世界一致性及角色感知镜头过渡

Mohamed Elmoghany, Liangbing Zhao, Xiaoqian Shen, Subhojyoti Mukherjee, Yang Zhou, Gang Wu, Viet Dac Lai, Seunghyun Yoon, Ryan Rossi, Abdullah Rashwan, Puneet Mathur, Varun Manjunatha, Daksh Dangi, Chien Nguyen, Nedim Lipka, Trung Bui, Krishna Kumar Singh, Ruiyi Zhang, Xiaolei Huang, Jaemin Cho, Yu Wang, Namyong Park, Zhengzhong Tu, Hongjie Chen, Hoda Eldardiry, Nesreen Ahmed, Thien Nguyen, Dinesh Manocha, Mohamed Elhoseiny, Franck Dernoncourt

机构 * Adobe Research(Adobe研究院) KAUST(卡塔尔科技大学) University of Oregon(俄勒冈大学) University of Memphis(密苏里大学孟菲斯分校) Johns Hopkins University(约翰霍普金斯大学) Meta AI Texas A&M University(德克萨斯农工大学) Dolby Labs(杜比实验室) Virginia Tech(弗吉尼亚理工大学) Cisco(思科) University of Maryland, College Park(马里兰大学学院市分校)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 InfinityStory通过引入背景一致的生成管道和过渡感知的视频合成模块,实现了多主体场景下的长篇视频生成,提升了背景一致性、主体一致性和时间连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18573 2026-03-05 cs.CV cs.AI 74%

Kaleido: Open-Sourced Multi-Subject Reference Video Generation Model

Kaleido:开源多主体参考视频生成模型

Zhenxing Zhang, Jiayan Teng, Zhuoyi Yang, Tiankun Cao, Cheng Wang, Xiaotao Gu, Jie Tang, Dan Guo, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) Tsinghua University(清华大学) Zhipu AI(智谱AI)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 Kaleido通过改进的数据构建和参考旋转位置编码,提升了多主体参考视频生成的一致性、保真度和泛化能力。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07595 2026-02-10 cs.CV cs.AI 74%

TeleBoost: A Systematic Alignment Framework for High-Fidelity, Controllable, and Robust Video Generation

TeleBoost:一种系统对齐框架,用于高保真、可控且稳健的视频生成

Yuanzhi Liang, Xuan'er Wu, Yirui Liu, Yijie Fang, Yizhen Fan, Ke Hao, Rui Li, Ruiying Liu, Ziqi Ni, Peng Yu, Yanbo Wang, Haibin Huang, Qizhen Weng, Chi Zhang, Xuelong Li

机构 * TeleBoost Team(TeleBoost团队)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 TeleBoost提出了一种系统化的训练后框架,通过整合监督策略塑造、奖励驱动强化学习和偏好细化,提升视频生成的保真度、时间连续性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02444 2026-02-04 cs.IR cs.CV 74%

RANKVIDEO: Reasoning Reranking for Text-to-Video Retrieval

RANKVIDEO: 文本到视频检索中的推理重排序

Tyler Skow, Alexander Martin, Benjamin Van Durme, Rama Chellappa, Reno Kriz

机构 * Johns Hopkins University(约翰霍普金斯大学) Human Language Technology Center of Excellence(人机语言技术卓越中心)

专题命中 视频生成 :text-to-video(title);分类 cs.CV

AI总结 RANKVIDEO通过基于视频内容的推理机制,提升了文本到视频检索的重排序性能,实验显示在nDCG@10上平均提升31%,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05241 2026-01-09 cs.CV cs.AI cs.RO 74%

RoboVIP: Multi-View Video Generation with Visual Identity Prompting Augments Robot Manipulation

RoboVIP: 多视角视频生成与视觉身份提示增强机器人操作

Boyang Wang, Haoran Zhang, Shujie Zhang, Jinkun Hao, Mingda Jia, Qi Lv, Yucheng Mao, Zhaoyang Lyu, Jia Zeng, Xudong Xu, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) University of Michigan(密歇根大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 RoboVIP通过引入视觉身份提示和可扩展的视觉身份池,提升机器人操控数据的质量与多样性,从而增强视觉语言-动作和视觉-运动政策模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01352 2026-01-06 cs.CV cs.AI 74%

Slot-ID: Identity-Preserving Video Generation from Reference Videos via Slot-Based Temporal Identity Encoding

Slot-ID: 通过基于槽的时序身份编码从参考视频中生成身份保持的视频

Yixuan Lai, He Wang, Kun Zhou, Tianjia Shao

机构 * State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室) University College London(伦敦大学学院) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 Slot-ID通过基于槽的时序身份编码从参考视频生成身份保持的视频,提升大姿态变化下的身份保留和视觉真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24724 2026-01-01 cs.CV 74%

FlowBlending: Stage-Aware Multi-Model Sampling for Fast and High-Fidelity Video Generation

FlowBlending: 时序感知多模型采样用于快速且高保真的视频生成

Jibin Song, Mingi Kwon, Jaeseok Jeong, Youngjung Uh

机构 * Yonsei University(延世大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 FlowBlending通过时序感知的多模型采样策略,在保持视觉质量的同时,显著提升视频生成的推理速度和效率。

Comments Project page: https://jibin86.github.io/flowblending_project_page

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24979 2025-12-17 cs.CV 74%

Video Generation with Stable Transparency via Shiftable RGB-A Distribution Learner

通过可移动的RGB-A分布学习实现稳定的透明度视频生成

Haotian Dong, Wenjing Wang, Chen Li, Jing Lyu, Di Lin

机构 * Tianjin University(天津大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出了一种通过可移动RGB-A分布学习实现稳定透明度视频生成的方法,提升了视频质量和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14945 2025-12-16 cs.CV 74%

3D Scene Prompting for Scene-Consistent Camera-Controllable Video Generation

用于场景一致的摄像机可控视频生成的3D场景提示

JoungBin Lee, Jaewoo Jung, Jisang Han, Takuya Narihira, Kazumi Fukuda, Junyoung Seo, Sunghwan Hong, Yuki Mitsufuji, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Sony AI(索尼人工智能研究所) ETH Zürich(苏黎世联邦理工学院) Sony Group Corporation(索尼集团)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 3DScenePrompt通过双时空条件化和3D场景记忆实现场景一致且可控的视频生成,提升生成质量与摄像机控制精度。

Comments Project page : https://cvlab-kaist.github.io/3DScenePrompt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05046 2025-12-15 cs.CV 74%

FlowDirector: Training-Free Flow Steering for Precise Text-to-Video Editing

FlowDirector: 无需训练的流引导文本到视频编辑

Guangzhao Li, Yanming Yang, Chenxi Song, Chi Zhang

机构 * AGI Lab, Westlake University(西湖大学AGI实验室) Central South University(中南大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :text-to-video(title);分类 cs.CV

AI总结 FlowDirector通过直接在数据空间中建模编辑过程,无需训练和倒置步骤,实现了更精确的文本到视频编辑。

Comments Project Page is https://flowdirector-edit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08765 2025-12-10 cs.CV 74%

Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance

Wan-Move:通过潜在轨迹引导实现可动视频生成

Ruihang Chu, Yefei He, Zhekai Chen, Shiwei Zhang, Xiaogang Xu, Bin Xia, Dingdong Wang, Hongwei Yi, Xihui Liu, Hengshuang Zhao, Yu Liu, Yingya Zhang, Yujiu Yang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Tsinghua University(清华大学) HKU(香港大学) CUHK(香港中文大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 Wan-Move通过潜在轨迹引导实现视频生成的精确运动控制,无需修改架构即可提升运动可控性。

Comments NeurlPS 2025. Code and data available at https://github.com/ali-vilab/Wan-Move

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08577 2025-12-10 cs.CV cs.AI cs.LG cs.RO 74%

Disturbance-Free Surgical Video Generation from Multi-Camera Shadowless Lamps for Open Surgery

多摄像头无影灯下开放式手术的干扰自由视频生成

Yuna Kato, Shohei Mori, Hideo Saito, Yoshifumi Takatsume, Hiroki Kajita, Mariko Isogawa

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出了一种自动化方法,通过识别照明系统移动并重新对齐视频帧,生成无遮挡的开放式手术视频,提升手术区域的可视化效果和观看舒适度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06723 2025-12-10 cs.CV 74%

Zo3T: Zero-Shot 3D-Aware Trajectory-Guided Image-to-Video Generation via Test-Time Training

Zo3T: 无监督3D感知轨迹引导图像到视频生成 via 测试时间训练

Ruicheng Zhang, Jun Zhou, Zunnan Xu, Zihao Liu, Jiehui Huang, Mingyang Zhang, Yu Sun, Xiu Li

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 Zo3T通过引入3D感知运动投影、轨迹引导测试时间LoRA和指导场校正,提升了轨迹引导图像到视频生成的3D真实感和运动准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01677 2025-12-02 cs.CV 74%

Open-world Hand-Object Interaction Video Generation Based on Structure and Contact-aware Representation

基于结构和接触感知表示的开放世界手-物体交互视频生成

Haodong Yan, Hang Yu, Zhide Zhong, Weilin Yuan, Xin Gong, Zehang Luo, Chengxi Heyu, Junfeng Li, Wenxuan Song, Shunbo Zhou, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出一种结构和接触感知表示,用于生成逼真的手-物体交互视频,通过联合生成范式提升开放世界场景下的交互物理建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21579 2025-12-01 cs.CV 74%

Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergy

Harmony: 通过跨任务协同实现音频和视频生成

Teng Hu, Zhentao Yu, Guozhen Zhang, Zihan Su, Zhengguang Zhou, Youliang Zhang, Yuan Zhou, Qinglin Lu, Ran Yi

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan Project(腾讯文心项目)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 Harmony通过跨任务协同机制和同步增强CFG,实现高效音频视频同步生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25187 2025-11-17 cs.CV 74%

FlashI2V: Fourier-Guided Latent Shifting Prevents Conditional Image Leakage in Image-to-Video Generation

Yunyang Ge, Xinhua Cheng, Chengshu Zhao, Xianyi He, Shenghai Yuan, Bin Lin, Bin Zhu, Li Yuan

机构 * Peking University, Shenzhen Graduate School(北京大学深圳研究生院) Peng Cheng Laboratory(鹏城实验室) Rabbitpre AI

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08536 2025-11-12 cs.CV 74%

3D4D: An Interactive, Editable, 4D World Model via 3D Video Generation

Yunhong He, Zhengqing Yuan, Zhengzhong Tu, Yanfang Ye, Lichao Sun

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments Accepted by AAAI 2026 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21840 2025-10-28 cs.CV cs.GR 74%

Improving the Physics of Video Generation with VJEPA-2 Reward Signal

Jianhao Yuan, Xiaofeng Zhang, Felix Friedrich, Nicolas Beltran-Velez, Melissa Hall, Reyhane Askari-Hemmat, Xiaochuang Han, Nicolas Ballas, Michal Drozdzal, Adriana Romero-Soriano

机构 * FAIR, Meta Superintelligence Labs(FAIR、Meta超智能实验室) University of Oxford(牛津大学) Mila - Québec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Columbia University(哥伦比亚大学) McGill University(麦吉尔大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments 2 pages

Journal ref Winning entry of the ICCV 2025 Physics IQ Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24427 2025-09-30 cs.CV 74%

UI2V-Bench: An Understanding-based Image-to-video Generation Benchmark

Ailing Zhang, Lina Lei, Dehong Kong, Zhixin Wang, Jiaqi Xu, Fenglong Song, Chun-Le Guo, Chang Liu, Fan Li, Jie Chen

机构 * Peking University(北京大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Nankai University(南开大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21119 2025-09-26 cs.CV 74%

MotionFlow:Learning Implicit Motion Flow for Complex Camera Trajectory Control in Video Generation

Guojun Lei, Chi Wang, Yikai Wang, Hong Li, Ying Song, Weiwei Xu

机构 * Zhejiang University(浙江大学) Tsinghua University(清华大学) Beihang University(北航) Zhejiang Gongshang University(浙江工商大学) ShengShu(盛舒)

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments ICME2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15269 2025-09-26 cs.CV cs.AI 74%

Conditional Video Generation for High-Efficiency Video Compression

Fangqiu Yi, Jingyu Xu, Jiawei Shao, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究院)

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17190 2025-09-23 cs.CV cs.AI 74%

Echo-Path: Pathology-Conditioned Echo Video Generation

Kabir Hamzah Muhammad, Marawan Elbatel, Yi Qin, Xiaomeng Li

机构 * Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments 10 pages, 3 figures, MICCAI-AMAI2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20471 2025-08-29 cs.CV 74%

Realistic and Controllable 3D Gaussian-Guided Object Editing for Driving Video Generation

Jiusi Li, Jackson Jiang, Jinyu Miao, Miao Long, Tuopu Wen, Peijin Jia, Shengxiang Liu, Chunlei Yu, Maolin Liu, Yuzhan Cai, Kun Jiang, Mengmeng Yang, Diange Yang

机构 * School of Vehicle and Mobility, and State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(车辆与移动系统学院,智能绿色车辆与移动系统国家重点实验室,清华大学) WUWEN AI PhiGent Robotics

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04631 2025-08-29 cs.CV cs.AI 74%

Puppet-Master: Scaling Interactive Video Generation as a Motion Prior for Part-Level Dynamics

Ruining Li, Chuanxia Zheng, Christian Rupprecht, Andrea Vedaldi

机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组)

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments Accepted at ICCV 2025. Project page: https://vgg-puppetmaster.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏