Atom: Efficient On-Device Video-Language Pipelines Through Modular Reuse
Atom:通过模块化重用实现高效的设备端视频-语言流水线
专题命中 视频理解 :video-language(title,abstract);分类 cs.MM
AI总结 Atom通过模块化重用提升设备端视频-语言流水线效率,实现27-33%的执行速度提升,同时保持性能稳定。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
Atom:通过模块化重用实现高效的设备端视频-语言流水线
专题命中 视频理解 :video-language(title,abstract);分类 cs.MM
AI总结 Atom通过模块化重用提升设备端视频-语言流水线效率,实现27-33%的执行速度提升,同时保持性能稳定。
无限透视作为摄像机控制的鲁棒条件化方法用于摄像机控制的视频生成
机构 * KAIST AI(韩国科学技术院人工智能研究所)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV
AI总结 InfCam通过无限透视变形和数据增强管道,实现高姿态保真度的摄像机控制视频生成,优于现有方法。
Map2Video: 基于街景图像的AI视频生成
专题命中 视频生成 :video generation(title,abstract)
AI总结 Map2Video通过整合现实地理数据和AI视频生成技术,帮助电影制作者更高效地创建空间一致的视频内容。
Comments 15 pages, 19 figures
灯光,摄像机,一致性:一种多阶段管道用于角色稳定的AI视频故事
机构 * BITS Pilani, Pilani Campus, India(印度比斯汉尼学院帕利尼校区)
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 本文提出了一种多阶段管道,通过生成详细剧本并利用视觉锚点来提升AI生成视频故事中角色的一致性。
Comments Under Review
区域约束的上下文生成用于教学视频编辑
机构 * University of Science and Technology of China(中国科学技术大学) ; HiDream.ai Inc.(HiDream.ai公司)
专题命中 视频生成 :video diffusion(abstract);分类 cs.CV、cs.MM
AI总结 ReCo通过引入区域约束建模,提升基于指令的视频编辑中编辑区域的准确性和去噪效果,提出新的正则化方法和大规模数据集。
Comments Project page: https://zhw-zhang.github.io/ReCo-page/
PhysFire-WM: 一种融合物理信息的世界模型用于模拟火灾扩散动力学
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 PhysFire-WM通过融合物理信息和跨任务协作训练策略,提升火灾扩散预测的物理真实性和几何准确性。
Mitty:基于扩散的Human-to-Robot视频生成
机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)
专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV
AI总结 Mitty通过基于扩散的变换器实现端到端的人机视频生成,利用预训练模型和双向注意力机制,无需动作标签或中间抽象,生成高质量的机器人执行视频。
Vidarc:用于闭环控制的具身视频扩散模型
机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学)
专题命中 视频扩散模型 :video diffusion(title,abstract)
AI总结 Vidarc 提出了一种基于视频扩散的具身模型,通过掩码反向动力学模型实现快速准确的闭环控制,提升了现实部署中的成功率和效率。
灵巧世界模型
机构 * Seoul National University(首尔国立大学) ; RLWRLD
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 灵巧世界模型通过场景-动作-条件的视频扩散框架,实现静态3D场景与灵巧人类动作的动态交互模拟,推动交互式数字双胞胎的发展。
Comments Project Page: snuvclab.github.io/dwm