ConditionVideo: Training-Free Condition-Guided Text-to-Video Generation
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
Comments AAAI 2024
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
Comments AAAI 2024
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
Comments To appear at CVPR 2024 Workshop on AI for Content Creation (AI4CC)
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV
Comments 9 pages, 9 figures
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
Comments The code and demo will be available at https://github.com/KU-CVLAB/DirecT2V
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
Comments Project page: https://showlab.github.io/T2VScore/
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
Comments 8pages, 7 figures
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
Comments Project page: https://wangyanhui666.github.io/MicroCinema.github.io/
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
Comments Project page: https://tf-t2v.github.io/
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
Comments NeurIPS 2023 Datasets and Benchmarks Track
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
Comments Project page: https://higen-t2v.github.io/
专题命中 视频生成 :video generation(title,abstract);text-to-video(title);long video(abstract);分类 cs.CV
Comments 24 pages, 21 figures. Project page at https://warranweng.github.io/art.v
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
Quant VideoGen:通过2位KV缓存量化实现自回归长视频生成
机构 * University of California, Berkeley(加州大学伯克利分校) ; NVIDIA ; Massachusetts Institute of Technology(麻省理工学院) ; Amazon(亚马逊) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 视频生成 :video generation(title,abstract);long video(title);video diffusion(abstract)
AI总结 本文提出Quant VideoGen,通过语义感知平滑和渐进残差量化技术,有效降低KV缓存内存消耗,提升长视频生成质量与效率。
Comments Accepted by ICML 2026. 11 pages, 7 figures
机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) ; Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) ; Serendipity One Inc.(Serendipity One公司)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract)
Comments 9 pages, 6 figures
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract)
机构 * School of Big Data and Software Engineering, Chongqing University(重庆大学大数据与软件学院) ; The Hong Kong University of Science and Technology(香港科技大学) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV、cs.MM
Comments 5 pages,conference
通过智能体增强与语义修复实现身份保留的文本到视频生成
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV
AI总结 针对现有商业视频生成模型的身份漂移等缺陷,提出AESR轻量级框架,含智能体提示增强与视觉语义修复模块,搭配混合专家选择策略,其系统MIPL_Video在ACM MM 2026挑战赛赛道1获第一
CAPE-T2V:面向文本到视频生成中双侧条件对齐的以字幕生成器为锚点的提示增强方法
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
AI总结 该研究针对文本到视频生成中存在的PE-字幕 gap,提出CAPE-T2V框架,通过两步微调PE与DiT,在多个基准数据集上实现了更高的生成综合得分,有效缩小了训练与推理间的条件不匹配。
Comments Includes appendix; 11 figures. Project page: https://github.com/yizzz927/CAPE-T2V
当物理偏好遇到语义约束:用于文本到视频生成的物理和语义直接偏好优化
机构 * University of Nevada, Reno(内华达大学雷诺分校) ; Zhejiang University(浙江大学)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
AI总结 文本到视频生成模型存在物理合理性与语义一致性的矛盾,提出物理和语义直接偏好优化方法(PSDPO),通过调节偏好对贡献,限制语义漂移,实现更可靠平衡,实验验证其在提高物理合理性和保持语义一致性上优于基线和现有方法。
Comments This work is accepted by ACM MM 2026
MAVEN:面向多元文化文本到视频生成的多智能体框架
机构 * Santa Clara University(圣克拉拉大学)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
AI总结 提出MAVEN多智能体提示优化框架,通过并行或串行分解提示为人物、动作、地点维度,提升单文化和跨文化文本到视频生成的文化保真度,并构建包含243个文化提示和972个视频的基准进行评估。
Comments [14] pages, [6] figures, [11] tables, appendix included. Preprint
你的数据流形实际上是一个奖励模型:Shell-LCC 用于文本到视频生成
机构 * Huawei Central Research Institute(华为中央研究院) ; Guangdong University of Technology(广东技术大学)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
AI总结 提出 Shell-LCC 方法,通过建模高质量 SFT 数据的流形结构,提供密集、可微且几乎零成本的奖励信号,以提升文本到视频生成质量,减少低层失真。
Comments ECCV 2026
DomainShuttle: 自由形式开放域主题驱动文本到视频生成
机构 * Hong Kong University of Science and Technology(香港科技大学)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
AI总结 提出DomainShuttle方法,通过Domain-MoT解耦视频与参考特征、Video-Reference DualRoPE实现精确主体空间建模及Cross-Pair Consistent Loss提取本质特征,在开放域视频个性化中同时实现高保真与生成灵活性。
Comments 19 pages, 9 figures
物理问题场景图:文本到视频生成中物理合理性的细粒度评估
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; AI2(艾伦人工智能研究所) ; Johns Hopkins University(约翰霍普金斯大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV
AI总结 提出物理问题场景图(PQSG),一种基于层次化问题的评估流程,通过图结构问题检查视频在对象、动作和物理规律上的忠实度,实现细粒度评估。
Comments ECCV 2026. Code and data: https://github.com/atinpothiraj/pqsg
PhyGDPO: 物理感知的分组直接偏好优化以实现物理一致的文本到视频生成
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; Johns Hopkins University(约翰霍普金斯大学) ; Meta BizAI(Meta商业人工智能)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
AI总结 提出PhyAugPipe构建大规模物理增强数据集PhyVidGen-135K,并设计PhyGDPO框架,利用分组Plackett-Luce模型和物理引导奖励机制,实现物理一致的文本到视频生成。
Comments ECCV 2026