LAViG-FLOW: Latent Autoregressive Video Generation for Fluid Flow Simulations
LAViG-FLOW:用于流体流动模拟的潜在自回归视频生成
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract)
AI总结 LAViG-FLOW通过潜在自回归视频生成框架高效模拟流体流动,实现比传统方法快百倍的饱和度和压力场生成。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
LAViG-FLOW:用于流体流动模拟的潜在自回归视频生成
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract)
AI总结 LAViG-FLOW通过潜在自回归视频生成框架高效模拟流体流动,实现比传统方法快百倍的饱和度和压力场生成。
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract)
Comments 8 pages, 8 figures, 1 table
专题命中 视频生成 :text-to-video(title,abstract);video diffusion(abstract)
Comments Project website https://video-adapter.github.io/. First two authors contributed equally
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV;video diffusion(comments)
Comments 3D stereoscopic video generation, video diffusion, inpainting
KeyID:用于身份保留视频生成的解耦草稿生成与关键帧编辑
机构 * Guangdong University of Technology(广东工业大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 KeyID是无需训练的IPVG框架,通过解耦视频动态合成与身份注入,解决身份一致性问题,在ACM MM 2026 IPVG挑战赛获亚军,可扩展至多主体参考及复杂序列动作生成。
Comments Accepted by ACM MM 2026
Delta Forcing:交互式自回归视频生成中的信任区域引导
机构 * Texas A\&M University(德克萨斯A&M大学) ; University of Washington(华盛顿大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 本文提出Delta Forcing方法,通过约束不可靠的教师监督在适应性信任区域中,以提高自回归视频生成的一致性并保持对新事件的响应性。
Comments preprint
机构 * Technion – Israel Institute of Technology(技术ion – 以色列理工学院) ; NVIDIA(NVIDIA公司)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
Journal ref International Conference on Learning Representations (ICLR), 2026
Talker-T2AV:基于自回归扩散模型的联合说话音频视频生成
机构 * Hong Kong University of Science and Technology(香港科学与技术大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; The Chinese University of Hong Kong(香港中文大学) ; Peking University(北京大学) ; Independent Researcher(独立研究者)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 本文提出Talker-T2AV,通过共享骨干和模态特定解码器实现音频视频联合生成,提升跨模态一致性与生成效率。
视频生成模型作为世界模型:高效的范式、架构和算法
机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) ; Hong Kong Generative AI Research and Development Center(香港生成式人工智能研究与开发中心)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV
AI总结 本文系统回顾了考虑效率的世界模拟视频生成框架,提出三维分类方法,展示提升效率对自动驾驶等应用的重要性,并指出高效视频生成向通用世界模拟器演进的关键性。
Salt:基于缓存感知训练的自一致分布匹配用于快速视频生成
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Vivix Group Limited(Vivix集团有限公司)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV
AI总结 本文提出Salt方法,通过自一致分布匹配和缓存感知训练,提升低推理预算下的视频生成质量,兼容多种KV缓存机制。
Comments Accepted by ECCV 2026
摩尔视频认证:一种对抗AI视频生成的物理签名
机构 * Boston University(波士顿大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 本文提出基于物理现象的视频认证方法,利用摩尔效应产生独特的视觉特征,通过分析视频中摩尔条纹的相位和位移关系,区分真实与AI生成视频。
Comments Accepted to ECCV 2026. Project page and code: https://yuanqing-ai.github.io/physical_video_signature/
AVTok: 用于整体音视频生成的1D统一分词化
机构 * The Hong Kong University of Science and Technology(香港科技大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 提出AVTok统一分词器,采用双流Transformer架构和分层训练策略,将音视频对编码为紧凑的一维潜在表示,在音视频重建及下游生成任务中表现优异。
Comments ECCV 2026
Unison:和谐运动、语音和声音以实现以人为中心的音频视频生成
机构 * DeepMind ; OpenAI
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 Unison通过显式促进运动、语音和声音模态的协调,解决音频视频生成中模态不一致的问题,提升感知质量和跨模态同步性能。
联合音视频生成的推理时缩放
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) ; Luma AI
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 针对联合音视频生成中多目标优化的挑战,提出多验证器框架与自适应奖励加权算法,在无需额外训练的情况下显著提升语义对齐、感知质量和音视频同步。
Comments Accepted by Transactions on Machine Learning Research (TMLR). Project page: https://jung-jaemin.github.io/ITS-AVGen-Proj/
联合音视频生成模型是否理解物理?
机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) ; University of Washington(华盛顿大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 针对联合音视频生成模型,提出AV-Phys Bench基准测试其物理常识,发现所有模型在物理一致性上表现不足,尤其是事件驱动和环境驱动转换场景。
Comments Preprint. Project Page: https://zijuncui.com/AV-Phys/. Full abstract appears in the PDF
PhyWorld: 用于视频生成的物理忠实世界模型
机构 * Northeastern University(东北大学) ; University of Georgia(佐治亚大学) ; Tulane University(路易斯安那大学) ; EmbodyX
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 本文提出PhyWorld,一种通过两阶段训练提升视频生成模型的物理忠实性,以改进世界模拟器的性能,从而更有效地支持物理AI系统。
Omni-Customizer: 用于联合音频-视频生成的端到端多模态定制
机构 * Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 本文提出Omni-Customizer,一种端到端多模态定制框架,旨在实现精确的多模态身份信息绑定和无缝融合,通过引入Omni-Context Fusion模块和Masked TTS Cross-Attention机制,提升多模态定制生成的性能。
Genflow Ad Studio:一种用于品牌一致、自我纠正视频生成的复合AI架构
机构 * Google(谷歌)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 本文提出Genflow Ad Studio,一种复合AI架构,通过品牌DNA提取模块和对抗性多代理质量控制循环,提高了品牌一致的视频生成效率,将合规率从42%提升到89%。
Comments 6 pages, 2 figures, 2 tables. Accepted to the ACM Conference on AI and Agentic Systems (CAIS '26). Includes demo video and code repository links
Journal ref ACM Conference on AI and Agentic Systems (CAIS '26), May 26-29, 2026, San Jose, CA, USA
理解文本到视频检索中的性能平台:全面的实证和语言分析
机构 * Information Technologies Institute(信息科技研究所) ; CERTH-ITI ; School of Computer Science(计算机科学学院) ; Reykjavík University(雷克雅未克大学)
专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV、cs.MM
AI总结 本文通过实证和语言分析,探讨文本到视频检索中模型性能瓶颈,揭示caption特性与模型表现的关系,指出简单清晰的caption提升召回率,而复杂事件仍具挑战性。
Comments Survey, 50 pages, 15 figures, 13 tables, 154 citations
SpA2V: 利用空间听觉线索进行音频驱动的空间感知视频生成
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 SpA2V通过利用空间听觉线索生成与输入音频在语义和空间上一致的视频,改进了现有方法对语义信息的依赖,提出两阶段框架实现视频场景布局生成与生成。
Comments The 33rd ACM Multimedia Conference (MM '25)
Lumos-1:从统一模型视角看基于离散扩散的自回归视频生成
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 Lumos-1提出一种基于LLM的统一模型,通过改进的MM-RoPE和离散扩散机制,在高效生成视频方面超越现有模型,适用于多种视频评估基准。
Comments ICLR 2026 Camera Ready Version. Code and Models: https://github.com/alibaba-damo-academy/Lumos
FlashMotion: 通过轨迹引导的少步可控视频生成
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 FlashMotion通过轨迹引导和蒸馏方法实现了少步可控视频生成,提升了视频质量和轨迹准确性。
Comments Accepted by CVPR2026
FlowPortrait:基于强化学习的音频驱动肖像视频生成
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 FlowPortrait通过强化学习框架结合多模态模型和人类对齐评估系统,提升音频驱动肖像视频生成的质量和表现力。
JavisDiT++:联合音频视频生成的统一建模与优化
机构 * Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; University of Toronto(多伦多大学) ; HiThink Research(HiThink研究) ; University of Rochester(罗切斯特大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 JavisDiT++通过统一建模与优化方法,在联合音频视频生成任务中实现高质量的同步与语义对齐。
Comments Accepted by ICLR 2026. Homepage: https://JavisVerse.github.io/JavisDiT2-page
通过解耦身份和运动实现主体驱动的视频生成
机构 * Seoul National University(首尔国立大学) ; POSTECH ; Microsoft Research Asia(微软亚洲研究院)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV
AI总结 本文提出一种通过解耦身份和运动实现主体驱动视频生成的方法,在零样本条件下优于现有模型。
Comments [v2 updated] Project Page : https://carpedkm.github.io/projects/disentangled_sub/index.html
MM-Sonate: 多模态可控音频视频生成与零样本语音克隆
机构 * Kuaishou Technology(快手科技)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 MM-Sonate通过统一的指令-音素输入实现可控的音频视频联合生成与零样本语音克隆,显著提升唇形同步和语音可懂度,同时保持与专门文本到语音系统的语音克隆保真度。
通过统一导演模型实现想象力与音频视频生成的连接
机构 * Nanyang Technological University(南洋理工大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 UniMAGE通过统一导演模型整合脚本起草与关键帧生成,提升非专业人士制作多镜头电影的能力。
机构 * Yale University(耶鲁大学) ; University of Nottingham(诺丁汉大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Department of Neurosurgery, The First Hospital, Shanxi Medical University(山西医科大学第一医院神经外科部) ; Department of Gastrointestinal Surgery, The Second Qilu Hospital, Shandong University(山东大学第二齐鲁医院胃肠外科部) ; Technical University of Munich(慕尼黑技术大学) ; University of Rochester(罗切斯特大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院) ; Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
Comments Accepted by ICCV 2025
机构 * Hunan University(湖南大学) ; Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV
Comments Accepted to CoRL 2025. The source code and model weights will be publicly available at https://github.com/losehu/QuaDreamer