CPA: Camera-pose-awareness Diffusion Transformer for Video Generation
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);long video(abstract);分类 cs.CV
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);long video(abstract);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);long video(abstract);分类 cs.CV
Comments project: https://ailab-cvc.github.io/VideoGen-Eval/
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);long video(abstract);分类 cs.CV
Comments COLM 2024; Project page: https://videodirectorgpt.github.io
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);long video(abstract);分类 cs.CV
Comments Project page at https://www.shengshu-ai.com/vidu
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.MM
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
Comments Webpage: https://lumiere-video.github.io/ | Video: https://www.youtube.com/watch?v=wxLr02Dz2Sc
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
Comments Project Page: https://rq-wu.github.io/projects/LAMP
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
Comments See accompanying website: https://imagen.research.google/video/
TalkVerse:民主化分钟级音频驱动视频生成
机构 * The Chinese University of Hong Kong(香港中文大学) ; Snap Inc.(Snap公司)
专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV、cs.MM
AI总结 TalkVerse通过大规模开放数据和高效模型,实现了分钟级音频驱动视频生成,降低研究门槛,提升生成质量与效率。
Comments open-sourced single-person full-body talking video generation dataset, training code and checkpoints
惊喜强制:长视频生成中该记住什么、何时跳过
机构 * Alaya Lab(阿莱雅实验室) ; The University of Tokyo(东京大学)
专题命中 视频生成 :video generation(title);long video(title);分类 cs.CV
AI总结 研究长视频生成中资源分配问题,提出惊喜强制框架,含惊喜门控内存库、基于优先级的替换和相关性感知路由,以及惊喜感知去噪,实验证明该框架提高了长时一致性、视觉质量并保持实时流吞吐量。
Comments Technical report
GroundShot: 通过实体锚定镜头调度实现视觉一致的多镜头长视频生成
机构 * Fudan University(复旦大学) ; Baidu(百度)
专题命中 视频生成 :video generation(title);long video(title);分类 cs.CV
AI总结 提出GroundShot框架,通过在线构建实体级视觉记忆并调度镜头生成顺序,无需训练即可提升多镜头视频中实体的一致性。
CineLOG: 一种无需训练的电影长视频生成方法
机构 * Sharif University of Technology(沙斐大学)
专题命中 视频生成 :video generation(title);long video(title);分类 cs.CV
AI总结 CineLOG通过构建高质量、平衡的数据集和创新的生成管道,实现了对电影长视频中摄像机轨迹和类型等属性的精准控制,优于现有端到端模型。
专题命中 视频生成 :video generation(title);text-to-video(title);分类 cs.CV
Comments Project page: https://follow-your-pose.github.io/; Github repository: https://github.com/mayuelala/FollowYourPose
AnyTalk:利用视频生成模型实现任意角色的语音动画
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、cs.MM
AI总结 AnyTalk是一种无需动画数据、利用视频扩散模型的新方法,可生成任意角色的3D语音动画,还能蒸馏出实时版本,降低了人工与数据需求。
Comments accepted to TVCG, Project page at https://serin-yoon.github.io/projects/anytalk/
用于序列动作视频生成的关键帧锚定身份保留
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM
AI总结 针对身份保留文本到视频生成任务中主体身份保持和动作执行的挑战,提出无训练三阶段管道框架,包括动作感知提示优化、身份保留生成和身份感知推理增强,该方法在官方排行榜上排名第三,性能和通用性强。
视频生成中的运动归因
机构 * NVIDIA ; Princeton University(普林斯顿大学) ; MIT(麻省理工学院) ; University of Michigan(密歇根大学) ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM
AI总结 研究视频生成模型中数据对运动影响,提出基于梯度的运动归因框架Motive,通过运动加权损失掩码分离静态外观和时间动态,用于研究微调剪辑对时间动态的影响及指导数据策划,提升视频运动质量。
Comments See the project website at https://research.nvidia.com/labs/sil/projects/MOTIVE/
面向内存高效的自回归视频生成:基于实例特定参数吸收
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; The University of Hong Kong(香港大学) ; AMAP, Alibaba Group(阿里巴巴集团高德地图)
专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV、cs.MM
AI总结 提出ISPA框架,通过将历史上下文吸收到模型权重中,将部分注意力层从全局注意力转换为局部注意力,在保持视觉质量的同时减少50%的KV缓存。
Comments ECCV 2026 Camera Ready
Echo-Infinity: 学习演化记忆用于实时无限视频生成
机构 * The Chinese University of Hong Kong(香港中文大学) ; Joy Future Academy, JD(京东探索研究院) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Tsinghua University(清华大学) ; The University of Hong Kong(香港大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、cs.MM
AI总结 提出Echo-Infinity框架,通过可学习的演化记忆以恒定成本动态过滤、抽象和压缩任意长度历史,结合统一相对RoPE方案,首次实现24小时实时无限视频生成。
Comments Website: https://echo-team-joy-future-academy-jd.github.io/Echo-Infinity/
UniVid:金字塔扩散模型用于高质量视频生成
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM
AI总结 UniVid通过融合文本提示和参考图像,结合时间金字塔交叉帧空间时间注意力模块,提升文本到视频、图像到视频及联合生成任务的时序一致性。
通过文本到骨骼级联实现可控的复杂人类运动视频生成
机构 * Department of Computer Science and Software Engineering, The University of Western Australia(计算机科学与软件工程系,西澳大学) ; Munich Center for Machine Learning (MCML) and Technical University of Munich (TUM)(慕尼黑机器学习中心(MCML)和技术大学慕尼黑(TUM)) ; School of Information Technology, Murdoch University(信息科技学院,墨尔本大学) ; Department of Electrical, Electronics and Computer Engineering, The University of Western Australia(电子、电子与计算机工程系,西澳大学)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、cs.MM
AI总结 本文提出通过文本到骨骼级联框架生成可控复杂人类运动视频,解决文本条件模糊和姿态控制成本高的问题,引入合成数据集并展示模型在多个指标上的优越性能。
EasyAnimate:基于混合窗口注意力和奖励反向传播的高性能视频生成框架
机构 * Alibaba Cloud(阿里云)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、cs.MM
AI总结 EasyAnimate通过混合窗口注意力和奖励反向传播提升视频生成效率与质量,实现高性能视频生成。
Comments 10 pages, 8 figures, ACM MM 2025
LayerT2V: 一个统一的多层视频生成框架
机构 * Shanghai Jiao Tong University(上海交通大学) ; Hong Kong Polytechnic University(香港理工大学) ; OPPO Research Institute(OPPO研究院) ; Nanjing University(南京大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM
AI总结 LayerT2V通过统一的多层视频生成框架,实现了多层输出并提升了视频生成的语义一致性和时间一致性。
Comments Project Page is https://layert2v.github.io/
机构 * Purdue University(普渡大学) ; Baidu USA(百度美国公司) ; University of Rochester(罗切斯特大学)
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM
Comments Accepted by CVPR 2025 AI4CC Workshop
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、cs.MM
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、eess.IV
Comments Project Page: https://snap-research.github.io/SF-V
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、eess.IV
Comments Accepted by ECCV2024. Project page: https://jingyunliang.github.io/MoVideo
专题命中 视频生成 :video generation(title,abstract);video understanding(abstract);分类 cs.CV、cs.MM
Comments 16 pages, 10 figures, 4 tables
FlowDance:基于音乐驱动的并行姿态与RGB流舞蹈视频生成
专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV
AI总结 FlowDance是一种结合并行姿态与RGB流的音乐驱动舞蹈视频生成框架,通过时间步感知姿态注入和持久身份注入优化,构建了高分辨率野外舞蹈数据集,在相关任务上表现优异。