AutoLV: Automatic Lecture Video Generator
专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM
Comments 4 pages, 4 figures, ICIP 2022
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM
Comments 4 pages, 4 figures, ICIP 2022
专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM
专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV
专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM
Comments ACM MM 2021
专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV
Comments 9 pages, 7 tables, 4 figures
专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV
专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV
MAViS:一个用于长序列视频叙事的多智能体框架
机构 * Virginia Tech(弗吉尼亚理工大学) ; Nanyang Technological University(南洋理工大学) ; Eyeline Studios(Eyeline工作室)
专题命中 视频生成 :video generation(abstract,comments);分类 cs.CV
AI总结 MAViS通过多智能体协作框架提升长序列视频生成的辅助能力、视觉质量和表达性,支持多模态输出。
Comments Video Generation Agent
机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) ; ByteDance(字节跳动)
专题命中 视频生成 :video generation(abstract);分类 cs.CV;video understanding(comments)
Comments NeurIPS 2025. (v3: update to include video understanding, OneIG, and more ablation study results)
专题命中 视频生成 :video generation(abstract,comments);分类 cs.CV
Comments This paper should be a refined version of arXiv:2412.02259, "VideoGen-of-Thought: A Collaborative Framework for Multi-Shot Video Generation", but I mistakenly submit it as a new paper
通过分割后再融合的分层视频合成
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Google(谷歌)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 StM通过分割未标注视频并融合动态前景与背景层,提升生成视频合成的控制能力和数据效率。
Comments Project Webpage: https://split-then-merge.github.io
Loopy:通过位置嵌入的锚定循环偏移实现无缝视频生成
机构 * Tianjin University(天津大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 该研究针对现有循环视频生成质量差的问题,提出Loopy框架,通过锚定DiT的位置嵌入偏移策略,实现高质量、支持多格式及高级AIGC功能的循环视频生成,提升了时间一致性与视觉保真度。
Comments 15 pages, 21 figures, accepted by ACM TOG
从生成到模拟:世界模型距离真正的模拟器还有多远?
机构 * Institute of Systems Engineering, Academy of Military Sciences(军事科学院系统工程研究院)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本研究通过系统评估200篇相关成果,分析了潜在动力学等3条技术路线的世界模型在传统模拟器8项能力上的表现,指出其在状态反馈等方面的缺陷并提出6个研究方向。
Comments 42 pages, 23 figures, 2 tables. Project page: https://github.com/AtongWang/world-model-simulators
ShotVerse: 提升文本驱动多镜头视频创作的电影级摄像机控制
机构 * Tencent Video AI Center, PCG, Tencent(腾讯视频AI中心)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 ShotVerse通过'计划然后控制'框架,结合视觉语言模型和摄像机适配器,实现多镜头视频创作中精准的摄像机控制与高保真电影效果。
Comments SIGGRAPH Asia 2026
MotionPhys:基于光流轨迹物理一致性检测AI生成视频
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 MotionPhys是基于光流轨迹物理一致性的轻量可解释框架,可检测AI生成视频的物理运动不一致性,且对不同视频生成器泛化性良好。
Qwen-Video-Edit:通过复用图像编辑模型实现基于指令的视频编辑
机构 * UT Austin(德克萨斯大学奥斯汀分校) ; Reve(Reve公司)
专题命中 视频生成 :video diffusion(abstract);分类 cs.CV
AI总结 该研究提出Qwen-Video-Edit,通过复用Qwen-Image-Edit图像编辑模型,经少量适配实现基于指令的视频编辑,证明图像编辑先验可迁移至视频编辑任务。
Comments Project Page: https://yunpeng1998.github.io/Qwen-Video-Edit-Page Code: https://github.com/yunpeng1998/Qwen-Video-Edit Model: https://huggingface.co/yunpeng1998/Qwen-Video-Edit
Prompt2Effect: 通过LoRA生成实现免训练图像到视频模型特化
机构 * Northeastern University(东北大学) ; Snap Inc.(Snap公司)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 提出Prompt2Effect,一种权重驱动超网络,通过单次前向传播直接合成效果特定的LoRA权重,无需训练,在保持视频质量的同时将计算成本从56 GPU小时降至3.3秒。
Comments Accepted to ECCV 2026, project page: https://xiaomeng-yang.github.io/Prompt2Effect
VSF: 在少步图像生成模型中通过值符号翻转实现简单、高效且有效的负引导
机构 * Department of CMPS University of British Columbia(计算机科学与工程系,不列颠哥伦比亚大学) ; Department of MEOW, Weathon Software(MEOW系,Weathon软件公司)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 VSF通过值符号翻转在少步图像生成模型中实现高效负提示引导,提升生成质量与稳定性。
Journal ref Guo, Wenqi, and Shan Du. "VSF: Simple, Efficient, and Effective Negative Guidance in Few-Step Image Generation Models By Value Sign Flip." In International Conference on Learning Representations, vol. 2026, pp. 83005-83018. 2026
SimWAM:一种用于端到端自动驾驶的简单世界动作模型
机构 * Huazhong University of Science & Technology(华中科技大学) ; Dongfeng Research & Development Institute(东风研发院)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 SimWAM是一种仅将视频生成用作训练信号的简单WAM,通过联合流匹配协同训练视频与动作专家,在NAVSIM上达91.5 PDMS且延迟更低,可零样本迁移至nuScenes,为高效自动驾驶提供可靠基线。
Comments The code and model weights are available at https://github.com/H-EmbodVis/SimWAM/
DrivingWorld:通过视频GPT构建自动驾驶领域的世界模型
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本文提出名为DrivingWorld的自动驾驶GPT风格世界模型,通过时空融合等策略提升视频生成质量与时长,实现更优的可控未来视频生成效果。
Journal ref ICPR 2026
V-RAE:重新思考用于生成的视频隐空间
机构 * National University of Singapore(新加坡国立大学) ; University of Oxford(牛津大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本研究提出V-RAE视频表示自动编码器,基于冻结视觉基础模型构建生成隐空间,在多项视频任务上优于现有模型,还引入tFVD指标,证明冻结语义表示可支持多种视频建模任务。
Comments 26 pages, 8 tables, 13 figures, project page: https://v-rae.github.io/
EvDiff:高质视频与事件相机
机构 * Zhejiang University(浙江大学) ; INSAIT ; UC Merced(加州大学默塞德分校) ; Google DeepMind(谷歌DeepMind)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 EvDiff通过基于事件的扩散模型和替代训练框架,从单色事件流生成高质量彩色视频,提升视频生成的保真度和现实感。
Comments Replacement note: This manuscript has been transferred from the CVPR format to the ECCV 2026 format, with the corresponding title and template updated accordingly. The technical content remains largely unchanged from the previous version. (Current version: 21 pages, 6 figures, and 3 tables.) Accepted by ECCV 2026
VidForensics-M1:用于AI生成视频取证的、具备可验证时间定位的元检测强化学习
机构 * Tsinghua University(清华大学) ; Peking University(北京大学) ; Renmin University of China(中国人民大学) ; Microsoft(微软公司)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 该研究针对AI生成视频检测泛化性不足的问题,首次将元检测引入该领域,提出结合可验证时间证据的VidForensics-M1模型及相关机制,实现了鲁棒可泛化的检测。
Comments 27 pages, 15 figures
数据驱动的自然注视-头部协调头部运动生成
机构 * Institute of Industrial Science, The University of Tokyo(东京大学工业科学研究所)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 提出首个数据驱动方法,通过自动提取自然注视和头部运动,利用条件变分自编码器生成与注视相关的头部运动,并应用于注视控制的视频生成。
通过多视角先验实现可控的视频物体插入
机构 * ShanghaiTech University(上海科技大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本文提出一种通过多视角先验解决视频物体插入中外观不一致和遮挡问题的新方法,采用双路径视图一致条件机制和质量感知加权机制,提升插入物体的稳定性和真实性。
SignVerse-2M:包含55+种手语的两百万片段姿态原生数据集
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本文提出SignVerse-2M,这是一个包含55+种手语、约200万片段的大规模多语言姿态原生手语数据集,适配现代姿态驱动的生成与识别范式,兼具真实场景适配性,可支撑多语言手语姿态建模与评估。
Comments Fix some typos. 13 pages. Project Page at: https://signerx.github.io/SignVerse-2M/
TIDE: 任务隔离扩散模型用于统一视频编辑与生成
机构 * Zhejiang University(浙江大学) ; Bilibili Inc.(哔哩哔哩股份有限公司)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 提出TIDE统一框架,通过逐token任务嵌入和双路径条件机制,实现指令编辑、参考编辑和多参考生成,在多任务渐进训练下达到SOTA性能。
Vorch-Omni:视觉与听觉的多任务编排
专题命中 视频生成 :text-to-video(abstract);分类 cs.CV
AI总结 Vorch-Omni是基于流匹配扩散Transformer的统一多任务视听合成框架,支持10余项视听相关任务,为通用视听生成与操作提供可扩展基础。
Comments Project Page: https://vorch-project.github.io/Vorch-Omni-project/
Vorch-Director:基于噪声感知误差校正的交互式世界故事模型
机构 * Vorch Team(Vorch团队) ; Zhejiang University(浙江大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 Vorch-Director是一种噪声感知残差校正策略,基于LTX-2扩散Transformer,可提升视听长视频生成的稳定性与保真度,支持多镜头、多主体的参考引导生成。
Comments Project page: https://vorch-project.github.io/Vorch-Director-project
UniVVT:用于高保真视频虚拟试穿的统一端到端框架
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 UniVVT是一种统一端到端视频虚拟试穿框架,以多模态大语言模型为核心,采用三阶段渐进训练策略,在多基准上实现了优于主流方法的高保真试穿效果。
Comments 17 pages,21 figures