arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 117 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 117 篇

2604.03118 2026-07-02 cs.CV eess.IV 版本更新 81%

Salt: Self-Consistent Distribution Matching with Cache-Aware Training for Fast Video Generation

Salt:基于缓存感知训练的自一致分布匹配用于快速视频生成

Xingtong Ge, Yi Zhang, Yushi Huang, Dailan He, Xiahong Wang, Bingqi Ma, Guanglu Song, Yu Liu, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Vivix Group Limited(Vivix集团有限公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

AI总结 本文提出Salt方法,通过自一致分布匹配和缓存感知训练,提升低推理预算下的视频生成质量,兼容多种KV缓存机制。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01654 2026-07-02 cs.CV cs.AI cs.MM 版本更新 81%

Moiré Video Authentication: A Physical Signature Against AI Video Generation

摩尔视频认证:一种对抗AI视频生成的物理签名

Yuan Qing, Kunyu Zheng, Lingxiao Li, Boqing Gong, Chang Xiao

机构 * Boston University(波士顿大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出基于物理现象的视频认证方法,利用摩尔效应产生独特的视觉特征,通过分析视频中摩尔条纹的相位和位移关系,区分真实与AI生成视频。

Comments Accepted to ECCV 2026. Project page and code: https://yuanqing-ai.github.io/physical_video_signature/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08048 2026-06-23 cs.CV 版本更新 80%

S^2VG: 3D Stereoscopic and Spatial Video Generation via Denoising Frame Matrix

S^2VG:基于去噪帧矩阵的3D立体与空间视频生成

Peng Dai, Feitong Tan, Qiangeng Xu, Yihua Huang, David Futschik, Ruofei Du, Sean Fanello, Yinda Zhang, Xiaojuan Qi

机构 * Department of Electrical and Electronic Engineering at The University of Hong Kong(香港大学电子与电气工程系) Google(谷歌)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出一种无需姿态和训练的方法,利用现成单目视频生成模型,通过深度图扭曲和帧矩阵修复框架,生成时空一致的3D立体与空间视频。

Comments immersive video generation, 4D scene, spatial video, stereo video

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06010 2026-08-21 cs.CV 版本更新 79%

OmniCamera: A Unified Framework for Multi-task Video Generation with Arbitrary Camera Control

OmniCamera:一个统一的多任务视频生成框架,支持任意相机控制

Yukun Wang, Ruihuang Li, Jiale Tao, Shiyuan Yang, Liyi Chen, Zhantao Yang, Handz, Yulan Guo, Shuai Shao, Qinglin Lu

机构 * Sun Yat-sen University(中山大学) Hunyuan, Tencent(腾讯混元) CityU(香港城市大学) PolyU(香港理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 OmniCamera通过显式解耦场景内容与相机运动,实现灵活的视频生成,提出混合数据集和双阶段课程协同训练策略,提升多任务学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22274 2026-08-20 cs.CV 版本更新 79%

GeCo: Evaluating Geometric Consistency for Video Generation via Motion and Structure

GeCo:通过运动和结构评估视频生成的几何一致性

Leslie Gu, Junhwa Hur, Charles Herrmann, Fangneng Zhan, Todd Zickler, Deqing Sun, Hanspeter Pfister

机构 * Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind) MIT(麻省理工学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 GeCo通过融合残差运动和深度先验,检测静态场景中的几何变形和遮挡不一致问题,并用于评估视频生成模型的性能与缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26154 2026-08-20 cs.CV 版本更新 79%

IPV-Bench: Benchmarking Image Protection Methods under Diverse Image-to-Video Generation Scenarios

IP-Bench:图像到视频生成场景中的图像保护方法基准

Xiaofeng Li, Leyi Sheng, Yifan Zhao, Zhen Sun, Zongmin Zhang, Jiaheng Wei, Xinlei He

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Wuhan University(武汉大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对图像到视频生成场景中图像保护方法缺乏统一评估框架的问题,IP-Bench提出首个系统性基准,评估6种保护方法和5种先进模型的鲁棒性及跨模型转移能力。

Comments 15 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03079 2026-08-20 cs.CV 版本更新 79%

ORV: 4D Occupancy-centric Robot Video Generation

ORV:基于占用的4D机器人视频生成

Xiuyu Yang, Bohan Li, Shaocong Xu, Nan Wang, Chongjie Ye, Zhaoxi Chen, Minghan Qin, Yikang Ding, Zheng Zhu, Xin Jin, Hang Zhao, Hao Zhao

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) IIIS, Tsinghua University(清华大学人工智能研究院) Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology, Ningbo(宁波工程技术院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) S-Lab, Nanyang Technological University(南洋理工大学S实验室) ByteDance(字节跳动) Kling, Kuaishou Technology(Kling,快手科技) GigaAI AIR, Tsinghua University(清华大学人工智能研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 ORV提出一种基于占用的4D机器人视频生成框架,通过结合动作先验与占用视觉先验,提升视频生成质量与可控性,实现多视角一致合成和仿真到现实的迁移。

Comments CVPR 2026. Project page: https://orangesodahub.github.io/ORV/ Code: https://github.com/OrangeSodahub/ORV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02474 2026-08-18 cs.CV 版本更新 79%

EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation

EchoCache:面向高效音频驱动视频生成的能量引导跨模态缓存

Jiayu Chen, Xiaoyu Wu, Rongshan Gao, Maoliang Li, Zihao Zheng, Xinhao Sun, Hailong Zou, Guojie Luo, Xiang Chen

机构 * Peking University(北京大学) Taiyuan University of Technology(太原理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 EchoCache是一种能量引导跨模态缓存框架,通过利用音频时频能量锚点与动态缓存机制,在保持音频驱动视频生成质量的同时,实现了2.46倍的推理加速,优化了延迟-质量权衡。

Comments EchoCache is honored to be accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18736 2026-08-18 cs.CV 版本更新 79%

Spectral Progressive Diffusion for Efficient Image and Video Generation

频域渐进扩散用于高效图像和视频生成

Howard Xiao, Brian Chao, Lior Yariv, Gordon Wetzstein

机构 * Stanford University(斯坦福大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出了一种频域渐进扩散框架,通过在预训练扩散模型的去噪轨迹中逐步提高分辨率,实现高效的图像和视频生成,同时改进了效率和质量。

Comments Project website at https://howardxiao.ca/speed

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10723 2026-08-18 cs.CV cs.AI cs.LG cs.MA 版本更新 79%

AgentMV: A State-Guided Multi-Agent Framework for Budget-Aware Music Video Generation

AllocMV:通过结构化持久状态实现音乐视频生成的最优资源分配

Huimin Wang, Chang Xia, Leilei Ouyang, Yongqi Kang, Yu Fu, Yuqi Ouyang

机构 * College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 AllocMV提出了一种分层框架,将音乐视频合成建模为多重选择背包问题,通过动态规划优化资源分配,确保跨镜头一致性并降低生成成本。

Comments ECCV 2026 AI4VA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13185 2026-08-18 cs.CV cs.GR 版本更新 79%

FlexAM: Flexible Appearance-Motion Decomposition for Versatile Video Generation Control

FlexAM: 一种灵活的外观-运动分解方法用于多功能视频生成控制

Mingzhi Sheng, Zekai Gu, Peng Li, Cheng Lin, Hao-Xiang Guo, Ying-Cong Chen, Yuan Liu

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) MUST(澳门大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 FlexAM通过引入新型3D控制信号,实现外观与运动的解耦,提升视频生成任务的灵活性和生成质量。

Comments Codes: https://github.com/IGL-HKUST/FlexAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02075 2026-08-17 cs.CV 版本更新 79%

HandsOnWorld: Unconstrained Egocentric Video Generation with Camera-Disentangled Hand Control

HandsOnWorld: 无约束的自我中心视频生成,具有相机解耦的手部控制

Yushuo Chen, Xiaoyu Shi, Xiaoshi Wu, Xintao Wang, Pengfei Wan, Yebin Liu

机构 * Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Chinese University of Hong Kong(香港中文大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出HandsOnWorld框架,通过单目重建从无约束视频中学习手部控制,利用Plücker手部映射解耦相机与手部运动,生成高保真自我中心视频。

Comments Project Page: https://shad0wta9.github.io/handsonworld-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17889 2026-08-10 cs.CV 版本更新 79%

Identity as Presence: Towards Appearance and Voice Personalized Joint Audio-Video Generation

身份作为存在:迈向基于外观和声音的联合音频视频生成

Qin Chen, Yingjie Chen, Shilun Lin, Cai Xing, Binxin Yang, Long Zhou, Qixin Yan, Wenjing Wang, Dingming Liu, Hao Liu, Chen Li, Jing Lyu

机构 * Tencent Inc.(腾讯公司) Peking University(北京大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出一个统一的框架,实现身份感知的音频视频生成,通过数据整理管道和灵活的身份注入机制,提升生成内容的高保真度和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03621 2026-08-05 cs.CV 版本更新 79%

ReCamDriving: LiDAR-Free Camera-Controlled Video Synthesis for Novel Trajectories

ReCamDriving:无需LiDAR的相机控制新型轨迹视频生成

Yaokun Li, Shuaixian Wang, Mantang Guo, Jiehui Huang, Taojun Ding, Mu Hu, Kaixuan Wang, Shaojie Shen, Guang Tan

机构 * Sun Yat-sen University(中山大学) ZYT Shenzhen Polytechnic University(深圳职业技术大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 ReCamDriving通过基于3DGS的密集渲染和两阶段训练策略,实现了无需LiDAR的相机可控新型轨迹视频生成,构建了ParaDrive数据集并展示了卓越的生成效果。

Comments Project page: https://recamdriving.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01499 2026-08-03 cs.CV 版本更新 79%

Anti-Prompt: Image Protection against Text-Guided Image-to-Video Generation

Anti-Prompt: 针对文本引导的图像到视频生成的图像保护

Yeonghwan Song, Chanhui Lee, Jinsoo Park, Jeany Son

机构 * GIST(光州科学技术院) POSTECH(浦项科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出Anti-Prompt方法,通过向图像注入不可察觉的扰动,在文本引导的图像到视频生成中引发视觉不一致和结构失败,从而保护版权和隐私。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18046 2026-07-31 cs.CV cs.AI 版本更新 79%

Enhancing Scene Transition Awareness in Video Generation via Post-Training

通过后训练增强视频生成中的场景转换意识

Hanwen Shen, Jiajie Lu, Yupeng Cao, Xiaonan Yang

机构 * Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

AI总结 本文提出TAV数据集,通过后训练提升视频生成中场景转换的理解能力,改善多场景生成效果并保持图像质量。

Journal ref Proceedings of the 14th International Joint Conference on Natural Language Processing and the 4th Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics (2025) 706-721

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20233 2026-07-29 cs.CV 版本更新 79%

Cinematic Compositing Using Character-Environment-Harmonized Video Generation Models

使用角色-环境协调视频生成模型的电影级合成

Tianyi Xiang, Mingming He, Li Ma, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Independent Researcher(独立研究员)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 提出端到端视频扩散框架,通过三掩码引导和RGB-D联合去噪建模角色与环境的双向物理与光照交互,实现高质量动态视频合成。

Comments Project Page: https://cehcomposition.github.io/demo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12304 2026-07-24 cs.SD cs.AI cs.MM eess.AS 版本更新 79%

OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model

OmniCustom: 通过联合音视频生成模型实现同步音视频定制

Maomao Li, Zhen Li, Kaipeng Zhang, Guosheng Yin, Zhifeng Li, Dong Xu

机构 * The University of Hong Kong(香港大学) Shanda AI Research Tokyo(Shanda AI东京研究所) XIntelligence Technology Co., Limited(XIntelligence技术有限公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.MM

AI总结 提出一种基于DiT的零样本音视频定制框架OmniCustom,通过参考图像和音频同步生成保持身份和音色一致性的视频,支持文本指定语音内容。

Comments code: https://github.com/OmniCustom-project/OmniCustom

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03118 2026-07-22 cs.CV cs.LG 版本更新 79%

Vidu S1: A Real-Time Interactive Video Generation Model

Vidu S1:一个实时交互式视频生成模型

Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Yang Luo, Yuji Wang, Dechuang Chen, Jungang Li, Chengyang Ye, Marco Chen, Hongzhou Zhu, Min Zhao, Yuxuan Jiang, Zhengkun Huang, Chendong Xiang, Kaiwen Zheng, Haoxu Wang, Xiaohang Wang, Qi Jia, Xin Chen, Yimin Chen, Youhe Jiang, Fangcheng Fu, Zhijie Deng, Fan Bao, Jianfei Chen, Jun Zhu

机构 * Tsinghua University(清华大学) Shengshu Technology(生数科技)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 介绍实时交互式视频生成模型Vidu S1,支持数字角色语音控制,用户可随时通过语音指令控制视频内容,基于TurboDiffusion和TurboServe构建,能实时生成高质量视频,性能优且满足实时推理需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07649 2026-07-22 cs.CV cs.AI 版本更新 79%

ViMax: Agentic Video Generation

ViMax: 智能体视频生成

Lingxuan Huang, Sizhe He, Hengji Zhou, Liqiang Nie, Lianghao Xia, Chao Huang

机构 * The University of Hong Kong(香港大学) South China University of Technology(华南理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出ViMax框架,通过多智能体协作实现长视频生成,利用分层叙事引擎和视觉一致性机制,保证叙事连贯性和视觉一致性。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24152 2026-07-16 cs.CV cs.LG 版本更新 79%

Autonomous Video Generation with Counterfactual Controllability for Self-Evolving World Models

具有反事实可控性的自主视频生成用于自进化世界模型

Xin Wang, Wenxuan Liu, Tongtong Feng, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出反事实可控性是自进化世界模型的关键,通过自主视频生成实现可控性,使模型能测试动作后果并反馈改进生成。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31946 2026-07-15 cs.CV 版本更新 79%

World Narrative Model for Highly Controllable Video Generation: A Paradigm Shift from Pixel Sampling to Physical World Orchestration

世界叙事模型:从像素采样到物理世界编排的高度可控视频生成范式转变

Ye Chen, Xuanhong Chen, Yupeng Zhu, Liming Tan, Zhewen Wan, Yuxuan Xiong, Tielong Wang, Jinfan Liu, Wuze Zhang, Xiongzhen Zhang, Feifei Li, Xianglin Luo, Zhehan Zhao, Zhifan Zhang, Laisheng Kou, Zhujin Liang, Yugang Chen, Muchun Chen, Xu Miao, Yijing Zhang, Xiaojie Sheng, Qiang Hu, Jialiang Chen, Weimin Zhang, Wenjun Zhang, Bingbing Ni

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出世界叙事模型(WNM),将视频生成解耦为结构化物理叙事与像素渲染,通过协同代理将多模态输入转化为可编辑的4D世界表示,驱动基础模型生成符合创作者意图的视频,大幅提升可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02584 2026-07-14 cs.CV 版本更新 79%

RotateAttention: RoPE-Aware Rotation and Range Rectification for INT4 Quantized Attention in Video Generation

RotateAttention:用于视频生成中INT4量化注意力的RoPE感知旋转与范围校正

Yaofu Liu, Wanli Lan, Jinxi Li, Binhang Yuan, Harry Yang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Independent Researcher(独立研究员)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对基于DiT的视频生成模型中注意力机制的计算瓶颈,提出RotateAttention框架,采用选择性FP16回退,引入RoPE感知旋转和范围优化P量化技术,提升速度并保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20562 2026-06-29 cs.CV 版本更新 79%

PhysChoreo: Physics-Controllable Video Generation with Part-Aware Semantic Grounding

PhysChoreo: 具有部分感知语义基础的物理可控视频生成

Haoze Zhang, Tianyu Huang, Zichen Wan, Xiaowei Jin, Hongzhi Zhang, Hui Li, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出PhysChoreo框架,通过两阶段方法(部分感知物理属性重建与时序指导的可编辑物理模拟)从单张图像生成物理可控且逼真的视频,在多个指标上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11755 2026-06-26 cs.CV 版本更新 79%

Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints

可控的第一人称视角视频生成:基于遮挡感知的稀疏3D手部关节点

Chenyangguang Zhang, Botao Ye, Boqi Chen, Alexandros Delitzas, Fangjinhua Wang, Marc Pollefeys, Xi Wang

机构 * ETH Zurich(苏黎世联邦理工学院) MPI for Informatics(信息研究所) Microsoft(微软)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出利用稀疏3D手部关节点作为显式控制信号,通过遮挡感知特征提取和3D加权机制,实现高保真、3D一致的第一人称手物交互视频生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08674 2026-06-25 cs.CV cs.AI 版本更新 79%

BioVid: Autoregressive Video Generation with Biological Behavior Semantic Comprehension

BioVid: 具有生物行为语义理解的自回归视频生成

Tsung-Wei Pan, Jung-Hua Wang

机构 * Department of Electrical Engineering, National Taiwan Ocean University(国立台湾海洋大学电子工程系) AI research center, National Taiwan Ocean University(国立台湾海洋大学人工智能研究中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出BioVid,一种数据驱动的自回归视频生成框架,通过FSQ-R3GAN分词器和因果Transformer学习生物行为的自然时长分布,无需预设长度约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20183 2026-06-25 cs.CV 版本更新 79%

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation

MSAVBench:面向多镜头音频-视频生成的全面可靠评估

Yujie Wei, Yujin Han, Zhekai Chen, Yongming Li, Kaixun Jiang, Zhihang Liu, Quanhao Li, Zhiwu Qing, Xiang Wang, Zhen Xing, Ruihang Chu, Lingyi Hong, Yefei He, Junjie Zhou, Junqiu Yu, Yang Shi, Difan Zou, Kai Zhu, Shiwei Zhang, Yingya Zhang, Yu Liu, Xihui Liu, Hongming Shan

机构 * Fudan University(复旦大学) The University of Hong Kong(香港大学) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Zhejiang University(浙江大学) Peking University(北京大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出首个多镜头音频-视频生成基准MSAVBench,通过自适应混合评估框架在四个维度上系统评估19个模型,发现当前系统在导演级控制和细粒度音视频同步上仍存在挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03723 2026-06-25 cs.CV 版本更新 79%

SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation

SymphoMotion:相机运动与物体动态的联合控制以实现一致的视频生成

Guiyu Zhang, Yabo Chen, Xunzhi Xiang, Junchao Huang, Zhongyu Wang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiaotong University(上海交通大学) Nanjing University(南京大学) Beihang University(北京航空航天大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 SymphoMotion通过联合控制相机运动和物体动态,提高视频生成的一致性和表达性,其核心方法结合了相机轨迹控制与物体动态控制机制,并引入了RealCOD-25K数据集进行大规模训练和评估,显著提升了视觉保真度和物体运动准确性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17773 2026-06-25 cs.CV 版本更新 79%

LoT-Pass: Long-term-robust Image Watermarking for Image to Video Generation

LoT-Pass: 面向图像到视频生成的长期鲁棒图像水印

Guanjie Wang, Zehua Ma, Han Fang, Weiming Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对图像引导视频生成中源图像追踪缺失的问题,提出跨模态水印框架I2VWM,通过视频模拟噪声层和光流对齐模块增强水印的时间鲁棒性,在开源和商业模型上验证了效果。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16223 2026-06-09 cs.GR cs.AI cs.CV 版本更新 79%

Evaluating Design Video Generation: Metrics for Compositional Fidelity

评估设计视频生成:构成保真度的度量标准

Adrienne Deganutti, Dingning Cao, Jaejung Seol, Elad Hirsch, Purvanshi Mehta

机构 * Lica World(Lica世界) San Francisco, United States of America(美国旧金山) ICML’26 Workshop on Human-AI Co-Creativity, Seoul, South Korea(ICML’26 人类-人工智能协同创作研讨会,韩国首尔)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出一个自动化评估框架,用于评估设计动画中布局、动作正确性、时间质量和内容保真度,以替代主观人类评估,为该领域提供统一基准。

Comments ICML 2026 Workshop on Human-AI Co-Creativity

详情

展开后加载摘要…

URL PDF HTML 收藏