arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-22 至 2025-12-22 共收录 9 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2512.17108 2025-12-22 cs.LG cs.MM 79%

Atom: Efficient On-Device Video-Language Pipelines Through Modular Reuse

Atom:通过模块化重用实现高效的设备端视频-语言流水线

Kunjal Panchal, Saayan Mitra, Somdeb Sarkhel, Haoliang Wang, Ishita Dasgupta, Gang Wu, Hui Guan

专题命中 视频理解 :video-language(title,abstract);分类 cs.MM

AI总结 Atom通过模块化重用提升设备端视频-语言流水线效率,实现27-33%的执行速度提升,同时保持性能稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 5 篇

2512.17040 2025-12-22 cs.CV 83%

Infinite-Homography as Robust Conditioning for Camera-Controlled Video Generation

无限透视作为摄像机控制的鲁棒条件化方法用于摄像机控制的视频生成

Min-Jung Kim, Jeongho Kim, Hoiyeong Jin, Junha Hyung, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 InfCam通过无限透视变形和数据增强管道,实现高姿态保真度的摄像机控制视频生成,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17883 2025-12-22 cs.HC 78%

Map2Video: Street View Imagery Driven AI Video Generation

Map2Video: 基于街景图像的AI视频生成

Hye-Young Jo, Mose Sakashita, Aditi Mishra, Ryo Suzuki, Koichiro Niinuma, Aakar Gupta

专题命中 视频生成 :video generation(title,abstract)

AI总结 Map2Video通过整合现实地理数据和AI视频生成技术,帮助电影制作者更高效地创建空间一致的视频内容。

Comments 15 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16954 2025-12-22 cs.CV cs.AI 70%

Lights, Camera, Consistency: A Multistage Pipeline for Character-Stable AI Video Stories

灯光,摄像机,一致性:一种多阶段管道用于角色稳定的AI视频故事

Chayan Jain, Rishant Sharma, Archit Garg, Ishan Bhanuka, Pratik Narang, Dhruv Kumar

机构 * BITS Pilani, Pilani Campus, India(印度比斯汉尼学院帕利尼校区)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出了一种多阶段管道,通过生成详细剧本并利用视觉锚点来提升AI生成视频故事中角色的一致性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17650 2025-12-22 cs.CV cs.MM 62%

Region-Constraint In-Context Generation for Instructional Video Editing

区域约束的上下文生成用于教学视频编辑

Zhongwei Zhang, Fuchen Long, Wei Li, Zhaofan Qiu, Wu Liu, Ting Yao, Tao Mei

机构 * University of Science and Technology of China(中国科学技术大学) HiDream.ai Inc.(HiDream.ai公司)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV、cs.MM

AI总结 ReCo通过引入区域约束建模,提升基于指令的视频编辑中编辑区域的准确性和去噪效果,提出新的正则化方法和大规模数据集。

Comments Project page: https://zhw-zhang.github.io/ReCo-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17152 2025-12-22 cs.CV 57%

PhysFire-WM: A Physics-Informed World Model for Emulating Fire Spread Dynamics

PhysFire-WM: 一种融合物理信息的世界模型用于模拟火灾扩散动力学

Nan Zhou, Huandong Wang, Jiahao Li, Yang Li, Xiao-Ping Zhang, Yong Li, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 PhysFire-WM通过融合物理信息和跨任务协作训练策略,提升火灾扩散预测的物理真实性和几何准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 3 篇

2512.17253 2025-12-22 cs.CV 83%

Mitty: Diffusion-based Human-to-Robot Video Generation

Mitty:基于扩散的Human-to-Robot视频生成

Yiren Song, Cheng Liu, Weijia Mao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 Mitty通过基于扩散的变换器实现端到端的人机视频生成,利用预训练模型和双向注意力机制,无需动作标签或中间抽象,生成高质量的机器人执行视频。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17661 2025-12-22 cs.RO cs.LG 78%

Vidarc: Embodied Video Diffusion Model for Closed-loop Control

Vidarc:用于闭环控制的具身视频扩散模型

Yao Feng, Chendong Xiang, Xinyi Mao, Hengkai Tan, Zuyue Zhang, Shuhe Huang, Kaiwen Zheng, Haitian Liu, Hang Su, Jun Zhu

机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学)

专题命中 视频扩散模型 :video diffusion(title,abstract)

AI总结 Vidarc 提出了一种基于视频扩散的具身模型,通过掩码反向动力学模型实现快速准确的闭环控制,提升了现实部署中的成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17907 2025-12-22 cs.CV 70%

Dexterous World Models

灵巧世界模型

Byungjun Kim, Taeksoo Kim, Junyoung Lee, Hanbyul Joo

机构 * Seoul National University(首尔国立大学) RLWRLD

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 灵巧世界模型通过场景-动作-条件的视频扩散框架,实现静态3D场景与灵巧人类动作的动态交互模拟,推动交互式数字双胞胎的发展。

Comments Project Page: snuvclab.github.io/dwm

详情

展开后加载摘要…

URL PDF HTML 收藏