SkyReels-V3 Technique Report
SkyReels-V3 技术报告
机构 * SkyReels Team(SkyReels 团队)
专题命中 视频理解 :video generation(abstract);video understanding(abstract);分类 cs.CV
AI总结 SkyReels-V3 提出三种视频生成范式,通过多模态上下文学习框架实现高质量视频生成,涵盖图像到视频、视频扩展和音频引导生成,达到接近闭源系统的性能。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
SkyReels-V3 技术报告
机构 * SkyReels Team(SkyReels 团队)
专题命中 视频理解 :video generation(abstract);video understanding(abstract);分类 cs.CV
AI总结 SkyReels-V3 提出三种视频生成范式,通过多模态上下文学习框架实现高质量视频生成,涵盖图像到视频、视频扩展和音频引导生成,达到接近闭源系统的性能。
生成回忆,密集重排序:学习多视图语义ID以实现高效的文本到视频检索
机构 * The University of Queensland(昆士兰大学) ; The University of Southern Queensland(南部昆士兰大学)
专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV
AI总结 GRDR通过生成回忆和密集重排序方法,提升文本到视频检索的效率和准确性,减少存储并加速检索过程。
Comments 10 pages
利用几何感知的世界模型学习瞬态对流热传递
机构 * Institute of Mathematics, TU Berlin(柏林技术大学数学研究所) ; Siemens Energy AG(西门子能源有限公司) ; Weierstrass Institute for Applied Analysis and Stochastics(魏尔斯特拉斯应用分析与概率研究所)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本文提出一种几何感知的世界模型架构,用于学习瞬态对流热传递,通过双重条件机制和架构适应性提升物理模拟的可控性和精度。
Comments 36 pages, 18 figures, 2 tables
借助视频扩散模型的零样本视频修复与增强
机构 * School of Electrical and Information Engineering, Tianjin University(电子信息工程学院,天津大学) ; Computer Vision and Pattern Recognition Laboratory, School of Engineering Science, Lappeenranta-Lahti University of Technology LUT(计算机视觉与模式识别实验室,工程科学学院,拉佩兰塔-拉赫蒂技术大学LUT)
专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV
AI总结 本文提出一种无训练的框架,利用视频扩散模型提升零样本视频修复与增强的时序一致性,通过潜在融合与后处理策略增强效果。
VidLaDA:双向扩散大型语言模型用于高效视频理解
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学) ; ZhongguanCun Academy(中关村学院) ; Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
专题命中 视频扩散模型 :video understanding(title);分类 cs.CV
AI总结 VidLaDA通过双向注意力和MARS-Cache技术,提升视频理解效率,实现比现有方法更优的性能与速度
EditYourself: 基于音频驱动的谈话头视频生成与操控的扩散变换器
机构 * Pipio AI ; Amazon(亚马逊)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、cs.MM
AI总结 EditYourself通过音频驱动的视频到视频编辑框架,实现基于脚本的谈话头视频修改,包括内容的添加、删除和重新定时,同时保持唇同步和时间一致性。
Comments Project page: https://edit-yourself.github.io/
GR3EN: 生成式3D环境光照
机构 * Google DeepMind(谷歌DeepMind) ; Google Research(谷歌研究) ; University of Amsterdam(阿姆斯特丹大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 GR3EN通过将视频到视频扩散模型输出蒸馏到3D重建中,实现对房间尺度场景的可控3D光照调整,无需解决逆渲染问题,适用于复杂现实场景。
Comments project page: https://gr3en-relight.github.io/
理解单帧动作预测中的多模态互补性
机构 * Department of Computer Technology, University of Alicante(阿尔瓦雷斯大学计算机技术系) ; Institute of Computer Science, FORTH(福蒂研究所) ; Computer Science Department, University of Crete(克里特大学计算机科学系) ; Department of Management, Science and Technology, Hellenic Mediterranean University(希腊地中海大学管理、科学与技术系)
专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV
AI总结 本研究通过单帧动作预测框架AAG+,探索多模态互补性对动作预测的影响,验证单帧信息在动作预测中的有效性。
基于框架的思考:视觉上下文和测试时扩展如何增强视频推理
机构 * University of Cambridge(剑桥大学) ; Pioneer Center for AI, University of Copenhagen(人工智能先锋中心,哥本哈根大学) ; Hong Kong University of Science(香港科学大学) ; University of California San Diego(加州大学圣地亚哥分校) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Peking University(北京大学)
专题命中 长视频与时序推理 :video reasoning(title);video generation(abstract);分类 cs.CV
AI总结 本文提出通过视频生成模型进行视觉推理,利用视觉上下文和测试时扩展提升视频推理能力,展示了模型在空间和时间复杂任务中的鲁棒零样本泛化能力。
Comments 8 pages, 3 figures, 3 tables (26 pages, 13 figures, 6 tables including references and appendices)