TV2TV: A Unified Framework for Interleaved Language and Video Generation
TV2TV:一种用于交错语言和视频生成的统一框架
机构 * Meta FAIR
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 TV2TV通过统一框架实现语言与视频生成的交错过程,提升视频生成的视觉质量和可控性。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
TV2TV:一种用于交错语言和视频生成的统一框架
机构 * Meta FAIR
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 TV2TV通过统一框架实现语言与视频生成的交错过程,提升视频生成的视觉质量和可控性。
Any2Caption:任何条件到字幕以实现可控视频生成
机构 * Kuaishou Technology(快手科技) ; National University of Singapore(新加坡国立大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 Any2Caption通过多模态大语言模型实现任何条件到字幕的可控视频生成,提升视频生成的可控性和质量。
Comments Project Page: https://sqwu.top/Any2Cap/
AlcheMinT:多参考一致视频生成的细粒度时间控制
机构 * Snap Inc. ; UC Merced(加州大学默塞德分校)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 AlcheMinT通过引入显式时间戳条件化,实现了多主体视频生成中的细粒度时间控制,提升了视频生成的精确性和保真度。
Comments Project page: https://snap-research.github.io/Video-AlcheMinT/snap-research.github.io/Video-AlcheMinT
ShotDirector: 电影化可控多镜头视频生成
机构 * Fudan University(复旦大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 ShotDirector通过整合参数级相机控制和分层编辑模式感知提示,实现了电影化可控的多镜头视频生成。
Comments Project Page: https://uknowsth.github.io/ShotDirector/
StereoWorld: 一种基于几何的单目到立体视频生成方法
机构 * Beijing Jiaotong University(北京交通大学) ; Dzine AI ; University of Toronto(多伦多大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 StereoWorld通过几何感知正则化和时空拼接方案,实现高效高质量的单目到立体视频生成。
Video4Spatial: 通过基于场景的视频生成实现视觉空间智能
机构 * Netflix ; Nanyang Technological University(南洋理工大学) ; University of Oxford(牛津大学) ; Eyeline Studios
专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV
AI总结 Video4Spatial通过仅使用视频数据训练的生成模型,实现了复杂空间任务的视觉空间智能,展示了视频生成模型在空间推理中的潜力。
Comments Project page at https://xizaoqu.github.io/video4spatial/
UnityVideo: 一体化多模态多任务学习以增强世界感知视频生成
机构 * HKUST(香港科技大学) ; CUHK(香港中文大学) ; Tsinghua University(清华大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 UnityVideo通过一体化多模态多任务学习提升视频生成的世界感知能力,引入动态噪声化和模态切换器,实现更全面的世界知识表示。
Comments Project Website https://jackailab.github.io/Projects/UnityVideo
WorldReel:基于一致几何和运动建模的4D视频生成
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Adobe Research(Adobe研究) ; University College London(伦敦大学学院)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 WorldReel通过联合生成RGB帧和4D场景表示,实现了动态场景和移动摄像机下的4D一致视频生成,提升了几何一致性与运动一致性。
OneStory: 通过自适应记忆实现连贯的多镜头视频生成
机构 * University of Copenhagen(哥本哈根大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 OneStory通过自适应记忆实现多镜头视频生成,提升叙事连贯性和生成质量。
Comments Project Page: https://zhaochongan.github.io/projects/OneStory
缩放零样本参考到视频生成
机构 * Meta AI ; King's College London
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 Saber通过零样本框架实现高效参考到视频生成,无需显式数据,通过掩码训练和注意力模型提升泛化能力。
Comments Website: https://franciszzj.github.io/Saber/
视频生成中的协作面部专家融合:提升大面部姿态下的身份一致性
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent Youtu Lab(腾讯优图实验室) ; National University of Singapore(新加坡国立大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 本文提出协作面部专家融合方法,通过动态融合身份、语义和细节专家信号,提升大姿态下视频生成的身份一致性,并构建了大规模姿态标注数据集。
Comments Project page: https://rain152.github.io/CoFE/
GeoVideo: 在视频生成模型中引入几何正则化
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; DAMO Academy, Alibaba Group(阿里云达摩院) ; Hupan Lab(鸿篇实验室)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 GeoVideo通过引入几何正则化损失,提升视频生成的时空一致性和几何结构合理性。
Comments Project Page: https://geovideo.github.io/GeoVideo/
GalaxyDiT:通过引导对齐和自适应代理实现高效的视频生成
机构 * Massachusetts Institute of Technology(麻省理工学院) ; NVIDIA(英伟达)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 GalaxyDiT通过引导对齐和自适应代理选择,提升视频生成效率,实现高达2.37倍的速度提升并保持高质量输出
MultiShotMaster: 一种可控的多镜头视频生成框架
机构 * Dalian University of Technology(大连理工大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 MultiShotMaster通过引入两种新型RoPE变体和自动化数据标注管道,实现多镜头视频的灵活生成与可控性。
Comments Project Page: https://qinghew.github.io/MultiShotMaster
基于视频科学基准的视频生成科学理解与推理评估
机构 * University of California, San Diego(加州大学圣地亚哥分校)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 VideoScience-Bench是首个评估视频模型科学理解和推理能力的基准测试,通过200个精心设计的提示评估模型在物理和化学领域的科学推理能力。
YingVideo-MV: 基于音乐的多阶段视频生成
机构 * AI Lab, GiantNetwork(人工智能实验室)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 YingVideo-MV通过整合音频语义分析、时间感知扩散模型和摄像机运动控制模块,实现了基于音乐的高质量视频生成。
Comments 18 pages, 6 figures
通过文本条件视频生成实现渐进式图像修复
机构 * Department of Computer Science, University of Illinois Springfield(伊利诺伊大学斯普林菲尔德分校计算机科学系) ; School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院)
专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV
AI总结 本研究通过微调CogVideo,利用文本条件视频生成实现图像渐进式修复,提升感知度量并展示强泛化能力。
Comments First two authors contributed equally to this work. IEEE ICNC Accepted
SpriteHand: 实时多样的手-物体交互与自回归视频生成
机构 * HKUST (Guangzhou)(香港科技大学(广州)) ; XMax.AI Ltd.(XMax人工智能有限公司) ; Nanyang Technological University(南洋理工大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 SpriteHand通过自回归视频生成框架实现实时高质量手-物体交互视频合成,支持多种物体和运动模式,具有高视觉真实性和物理合理性。
PanFlow:全景视频生成的解耦运动控制
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 PanFlow通过解耦动态摄像机旋转与输入光学流,提升全景视频生成的运动控制精度和质量。
Comments Accepted by AAAI. Code: https://github.com/chengzhag/PanFlow
FreeSwim: 重新审视滑动窗口注意力机制以实现无训练超高清视频生成
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) ; Xi’an Jiaotong University(西安交通大学) ; National University of Singapore(新加坡国立大学)
专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV
AI总结 FreeSwim通过无训练滑动窗口注意力机制实现超高清视频生成,提升效率并保持视觉细节。
Comments 23 pages, 14 figures
AnyTalker: 通过交互细化扩展多人物谈话视频生成
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Video Rebirth(视频重生) ; Zhejiang University(浙江大学) ; Beijing Jiaotong University(北京交通大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 AnyTalker通过引入身份感知注意力机制和高效训练流程,实现了多人物谈话视频生成的高可扩展性和自然交互性。
Comments Homepage: https://hkust-c4g.github.io/AnyTalker-homepage
McSc: 基于自批评分层推理的视频生成运动校正偏好对齐
机构 * Tongyi Lab, Alibaba Group(阿里集团通义实验室)
专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV
AI总结 McSc通过自批评分层推理框架,提升视频生成中对人类偏好的对齐精度,减少对低运动内容的偏见。
高效训练人类视频生成的熵引导优先级渐进学习
机构 * Stanford University(斯坦福大学) ; North China Electric Power University(华北电力大学) ; University of Adelaide(阿德莱德大学) ; University of Technology Sydney(悉尼技术大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 本文提出熵引导优先级渐进学习方法,通过条件熵膨胀和自适应渐进计划,高效训练扩散模型生成人类视频,实现训练速度提升和内存消耗降低。
Comments Project page: https://github.com/changlin31/Ent-Prog
ConceptGuard:通过多模态风险检测实现文本-图像到视频生成的主动安全
机构 * CUHK MMLab(香港中文大学多模态实验室) ; Future Lab, Alibaba Group(阿里巴巴集团未来实验室) ; Nanjing University(南京大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 ConceptGuard通过多模态风险检测实现文本-图像到视频生成的主动安全,优于现有方法。
力提示:视频生成模型可以学习并泛化基于物理的控制信号
机构 * Brown University(布朗大学) ; Google DeepMind(谷歌DeepMind)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 本文提出力提示方法,通过物理力信号生成逼真视频,利用视觉和运动先验实现物理控制信号的泛化,提升世界模型的物理真实性。
Comments Camera ready version (NeurIPS 2025). Code and interactive demos at https://force-prompting.github.io/
用于可控视频生成的指令解释器
机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; National University of Singapore(新加坡国立大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 ReaDe通过推理后再描述的方法,将模糊用户指令转化为精确规范,提升可控视频生成的准确性和质量。
Comments 27 pages, 13 figures, 13 tables, Project Page: https://sqwu.top/ReaDe/
通过VLM引导的迭代自优化提升物理导向的视频生成
机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) ; School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 本文提出一种通过VLM引导的迭代自优化方法,提升视频生成的物理一致性,实验显示在PhyIQ基准上得分提升明显。
Comments ICCV 2025 Physics-IQ Challenge Third Place Solution
Exo2EgoSyn: 解锁用于外视图到内视图视频合成的基础视频生成模型
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 Exo2EgoSyn通过三个模块实现从第三人称视角生成高保真内视图视频,提升跨视角视频合成能力。
校正SpaAttn:重新审视注意力稀疏性以实现高效的视频生成
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 本文提出Rectified SpaAttn,通过校正注意力分配提升视频生成效率,实现显著速度提升且保持生成质量。
Comments Code at https://github.com/BienLuky/Rectified-SpaAttn
超越奖励边际:通过视频生成重新思考和解决扩散模型中的似然位移
机构 * Zhejiang University(浙江大学) ; Tencent(腾讯)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 本文提出PG-DPO方法,通过结合ARS和IPR缓解扩散模型中的似然位移问题,提升视频生成任务的偏好对齐性能。