FlowAct-R1: Towards Interactive Humanoid Video Generation
FlowAct-R1: 向交互式人形视频生成迈进
机构 * ByteDance Intelligent Creation(字节跳动智能创作)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 FlowAct-R1通过分块扩散策略和高效优化,实现了实时交互式人形视频生成,具备高保真和低延迟的视频合成能力。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
FlowAct-R1: 向交互式人形视频生成迈进
机构 * ByteDance Intelligent Creation(字节跳动智能创作)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 FlowAct-R1通过分块扩散策略和高效优化,实现了实时交互式人形视频生成,具备高保真和低延迟的视频合成能力。
CoF-T2I: 视频模型作为纯视觉推理器用于文本到图像生成
机构 * Peking University(北京大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; Sun Yat-sen University(中山大学) ; Zhejiang University(浙江大学) ; Nanjing University(南京大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 CoF-T2I通过引入链式帧推理提升文本到图像生成的质量,通过逐步视觉细化和显式推理步骤实现高质量图像生成。
Comments 16 pages, 8 figures
通过链接实体进行空间动态系统的潜在空间建模:LaM-SLidE
机构 * ELLIS Unit, LIT AI Lab, Institute for Machine Learning, JKU Linz(ELLIS单位、LIT AI实验室、机器学习研究所、JKU林茨) ; Department of Engineering Physics and Computation, TUM(工程物理与计算系、技术大学慕尼黑) ; Emmi AI GmbH(Emmi AI公司) ; Clinical Research Institute for Medical AI, JKU Linz(医学人工智能临床研究所、JKU林茨)
专题命中 视频生成 :video generation(abstract)
AI总结 LaM-SLidE通过引入标识符表示,实现对空间动态系统潜在空间的建模,提升轨迹生成的效率与准确性。
Comments Project page: https://ml-jku.github.io/LaM-SLidE/