MoFu: Scale-Aware Modulation and Fourier Fusion for Multi-Subject Video Generation
MoFu: 多主体视频生成的尺度感知调制与傅里叶融合
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 MoFu通过尺度感知调制和傅里叶融合解决多主体视频生成中的尺度不一致和排列敏感性问题,提升生成质量。
Comments AAAI 2026
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
MoFu: 多主体视频生成的尺度感知调制与傅里叶融合
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 MoFu通过尺度感知调制和傅里叶融合解决多主体视频生成中的尺度不一致和排列敏感性问题,提升生成质量。
Comments AAAI 2026
DreaMontage:任意帧引导的一次生成视频
机构 * Intelligence Creation Team, ByteDance(字节跳动智能创作团队)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 DreaMontage通过任意帧引导生成技术,实现高效且高质量的一次生成视频,提升电影制作的视觉表现力和内容连贯性。
Comments Project Page: https://dreamontage.github.io/DreaMontage/
HiStream: 通过消除冗余的流式传输实现高效的高分辨率视频生成
机构 * Meta AI ; Nanyang Technological University(南洋理工大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 HiStream通过空间、时间及时间步压缩优化,实现高分辨率视频生成的高效去噪,相比基线模型提升107.5倍速度并保持高质量。
Comments Project Page: http://haonanqiu.com/projects/HiStream.html
X-CoT:基于LLM链式推理的可解释文本到视频检索
机构 * Rochester Institute of Technology(罗切斯特理工学院) ; DEVCOM Army Research Laboratory(陆军研究实验室)
专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV
AI总结 X-CoT通过基于LLM的链式推理实现文本到视频检索的可解释性,提升检索性能并提供详细的推理依据。
Comments 12 pages, 7 figures. Accepted at EMNLP 2025 (Main Conference)
Journal ref Proc. EMNLP 2025, pages 31172-31183, Suzhou, China, Nov. 2025
TiViBench: 用于视频生成模型的视频推理基准测试
专题命中 视频生成 :video reasoning(title);video generation(abstract);分类 cs.CV
AI总结 TiViBench提出用于评估视频生成模型的推理能力,结合VideoTPO提升推理性能,揭示商业与开源模型在推理潜力上的差异。
Comments Project: https://haroldchen19.github.io/TiViBench-Page/
基于可更新空间记忆的视频生成
机构 * The University of Sydney(悉尼大学) ; Microsoft Research(微软研究院) ; HKUST(香港科技大学) ; University of Waterloo(滑铁卢大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 Spatia通过可更新的空间记忆机制,实现视频生成中的长期空间与时间一致性,支持动态实体生成和3D交互编辑。
Comments Project page: https://zhaojingjing713.github.io/Spatia/
训练变换器:加速 naive 4K 视频生成超过 10$\times$
机构 * Youtu Lab, Tencent(腾讯优设实验室) ; Zhejiang University(浙江大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 T3-Video 通过优化全注意力机制,显著提升 4K 视频生成效率,实现性能与速度的双重突破
Comments Project page: https://zhangzjn.github.io/projects/T3-Video
PoseAnything: 通用姿态引导视频生成与部分感知时间一致性
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 PoseAnything是一种通用姿态引导视频生成框架,能够处理人类和非人类角色,通过引入部分感知时间一致性模块和解耦CFG策略,提升了视频生成的精度和泛化能力。
GenieDrive: 向具有物理意识的驾驶世界模型迈进:基于4D占用的视频生成
机构 * The University of Hong Kong(香港大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 GenieDrive通过4D占用引导的视频生成,实现物理意识的驾驶视频生成,提升预测精度和视频质量。
Comments The project page is available at https://huster-yzy.github.io/geniedrive_project_page/
TV2TV:一种用于交错语言和视频生成的统一框架
机构 * Meta FAIR
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 TV2TV通过统一框架实现语言与视频生成的交错过程,提升视频生成的视觉质量和可控性。
Any2Caption:任何条件到字幕以实现可控视频生成
机构 * Kuaishou Technology(快手科技) ; National University of Singapore(新加坡国立大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 Any2Caption通过多模态大语言模型实现任何条件到字幕的可控视频生成,提升视频生成的可控性和质量。
Comments Project Page: https://sqwu.top/Any2Cap/
AlcheMinT:多参考一致视频生成的细粒度时间控制
机构 * Snap Inc. ; UC Merced(加州大学默塞德分校)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 AlcheMinT通过引入显式时间戳条件化,实现了多主体视频生成中的细粒度时间控制,提升了视频生成的精确性和保真度。
Comments Project page: https://snap-research.github.io/Video-AlcheMinT/snap-research.github.io/Video-AlcheMinT
ShotDirector: 电影化可控多镜头视频生成
机构 * Fudan University(复旦大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 ShotDirector通过整合参数级相机控制和分层编辑模式感知提示,实现了电影化可控的多镜头视频生成。
Comments Project Page: https://uknowsth.github.io/ShotDirector/
StereoWorld: 一种基于几何的单目到立体视频生成方法
机构 * Beijing Jiaotong University(北京交通大学) ; Dzine AI ; University of Toronto(多伦多大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 StereoWorld通过几何感知正则化和时空拼接方案,实现高效高质量的单目到立体视频生成。
Video4Spatial: 通过基于场景的视频生成实现视觉空间智能
机构 * Netflix ; Nanyang Technological University(南洋理工大学) ; University of Oxford(牛津大学) ; Eyeline Studios
专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV
AI总结 Video4Spatial通过仅使用视频数据训练的生成模型,实现了复杂空间任务的视觉空间智能,展示了视频生成模型在空间推理中的潜力。
Comments Project page at https://xizaoqu.github.io/video4spatial/
UnityVideo: 一体化多模态多任务学习以增强世界感知视频生成
机构 * HKUST(香港科技大学) ; CUHK(香港中文大学) ; Tsinghua University(清华大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 UnityVideo通过一体化多模态多任务学习提升视频生成的世界感知能力,引入动态噪声化和模态切换器,实现更全面的世界知识表示。
Comments Project Website https://jackailab.github.io/Projects/UnityVideo
WorldReel:基于一致几何和运动建模的4D视频生成
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Adobe Research(Adobe研究) ; University College London(伦敦大学学院)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 WorldReel通过联合生成RGB帧和4D场景表示,实现了动态场景和移动摄像机下的4D一致视频生成,提升了几何一致性与运动一致性。
OneStory: 通过自适应记忆实现连贯的多镜头视频生成
机构 * University of Copenhagen(哥本哈根大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 OneStory通过自适应记忆实现多镜头视频生成,提升叙事连贯性和生成质量。
Comments Project Page: https://zhaochongan.github.io/projects/OneStory
缩放零样本参考到视频生成
机构 * Meta AI ; King's College London
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 Saber通过零样本框架实现高效参考到视频生成,无需显式数据,通过掩码训练和注意力模型提升泛化能力。
Comments Website: https://franciszzj.github.io/Saber/
视频生成中的协作面部专家融合:提升大面部姿态下的身份一致性
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent Youtu Lab(腾讯优图实验室) ; National University of Singapore(新加坡国立大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 本文提出协作面部专家融合方法,通过动态融合身份、语义和细节专家信号,提升大姿态下视频生成的身份一致性,并构建了大规模姿态标注数据集。
Comments Project page: https://rain152.github.io/CoFE/
GeoVideo: 在视频生成模型中引入几何正则化
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; DAMO Academy, Alibaba Group(阿里云达摩院) ; Hupan Lab(鸿篇实验室)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 GeoVideo通过引入几何正则化损失,提升视频生成的时空一致性和几何结构合理性。
Comments Project Page: https://geovideo.github.io/GeoVideo/
GalaxyDiT:通过引导对齐和自适应代理实现高效的视频生成
机构 * Massachusetts Institute of Technology(麻省理工学院) ; NVIDIA(英伟达)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 GalaxyDiT通过引导对齐和自适应代理选择,提升视频生成效率,实现高达2.37倍的速度提升并保持高质量输出
MultiShotMaster: 一种可控的多镜头视频生成框架
机构 * Dalian University of Technology(大连理工大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 MultiShotMaster通过引入两种新型RoPE变体和自动化数据标注管道,实现多镜头视频的灵活生成与可控性。
Comments Project Page: https://qinghew.github.io/MultiShotMaster
基于视频科学基准的视频生成科学理解与推理评估
机构 * University of California, San Diego(加州大学圣地亚哥分校)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 VideoScience-Bench是首个评估视频模型科学理解和推理能力的基准测试,通过200个精心设计的提示评估模型在物理和化学领域的科学推理能力。
YingVideo-MV: 基于音乐的多阶段视频生成
机构 * AI Lab, GiantNetwork(人工智能实验室)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 YingVideo-MV通过整合音频语义分析、时间感知扩散模型和摄像机运动控制模块,实现了基于音乐的高质量视频生成。
Comments 18 pages, 6 figures
通过文本条件视频生成实现渐进式图像修复
机构 * Department of Computer Science, University of Illinois Springfield(伊利诺伊大学斯普林菲尔德分校计算机科学系) ; School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院)
专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV
AI总结 本研究通过微调CogVideo,利用文本条件视频生成实现图像渐进式修复,提升感知度量并展示强泛化能力。
Comments First two authors contributed equally to this work. IEEE ICNC Accepted
SpriteHand: 实时多样的手-物体交互与自回归视频生成
机构 * HKUST (Guangzhou)(香港科技大学(广州)) ; XMax.AI Ltd.(XMax人工智能有限公司) ; Nanyang Technological University(南洋理工大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 SpriteHand通过自回归视频生成框架实现实时高质量手-物体交互视频合成,支持多种物体和运动模式,具有高视觉真实性和物理合理性。
PanFlow:全景视频生成的解耦运动控制
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 PanFlow通过解耦动态摄像机旋转与输入光学流,提升全景视频生成的运动控制精度和质量。
Comments Accepted by AAAI. Code: https://github.com/chengzhag/PanFlow
FreeSwim: 重新审视滑动窗口注意力机制以实现无训练超高清视频生成
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) ; Xi’an Jiaotong University(西安交通大学) ; National University of Singapore(新加坡国立大学)
专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV
AI总结 FreeSwim通过无训练滑动窗口注意力机制实现超高清视频生成,提升效率并保持视觉细节。
Comments 23 pages, 14 figures
AnyTalker: 通过交互细化扩展多人物谈话视频生成
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Video Rebirth(视频重生) ; Zhejiang University(浙江大学) ; Beijing Jiaotong University(北京交通大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 AnyTalker通过引入身份感知注意力机制和高效训练流程,实现了多人物谈话视频生成的高可扩展性和自然交互性。
Comments Homepage: https://hkust-c4g.github.io/AnyTalker-homepage