arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-22 至 2025-12-22 共收录 5 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 5 篇

2512.17040 2025-12-22 cs.CV 83%

Infinite-Homography as Robust Conditioning for Camera-Controlled Video Generation

无限透视作为摄像机控制的鲁棒条件化方法用于摄像机控制的视频生成

Min-Jung Kim, Jeongho Kim, Hoiyeong Jin, Junha Hyung, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 InfCam通过无限透视变形和数据增强管道,实现高姿态保真度的摄像机控制视频生成,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17883 2025-12-22 cs.HC 78%

Map2Video: Street View Imagery Driven AI Video Generation

Map2Video: 基于街景图像的AI视频生成

Hye-Young Jo, Mose Sakashita, Aditi Mishra, Ryo Suzuki, Koichiro Niinuma, Aakar Gupta

专题命中 视频生成 :video generation(title,abstract)

AI总结 Map2Video通过整合现实地理数据和AI视频生成技术,帮助电影制作者更高效地创建空间一致的视频内容。

Comments 15 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16954 2025-12-22 cs.CV cs.AI 70%

Lights, Camera, Consistency: A Multistage Pipeline for Character-Stable AI Video Stories

灯光,摄像机,一致性:一种多阶段管道用于角色稳定的AI视频故事

Chayan Jain, Rishant Sharma, Archit Garg, Ishan Bhanuka, Pratik Narang, Dhruv Kumar

机构 * BITS Pilani, Pilani Campus, India(印度比斯汉尼学院帕利尼校区)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出了一种多阶段管道,通过生成详细剧本并利用视觉锚点来提升AI生成视频故事中角色的一致性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17650 2025-12-22 cs.CV cs.MM 62%

Region-Constraint In-Context Generation for Instructional Video Editing

区域约束的上下文生成用于教学视频编辑

Zhongwei Zhang, Fuchen Long, Wei Li, Zhaofan Qiu, Wu Liu, Ting Yao, Tao Mei

机构 * University of Science and Technology of China(中国科学技术大学) HiDream.ai Inc.(HiDream.ai公司)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV、cs.MM

AI总结 ReCo通过引入区域约束建模,提升基于指令的视频编辑中编辑区域的准确性和去噪效果,提出新的正则化方法和大规模数据集。

Comments Project page: https://zhw-zhang.github.io/ReCo-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17152 2025-12-22 cs.CV 57%

PhysFire-WM: A Physics-Informed World Model for Emulating Fire Spread Dynamics

PhysFire-WM: 一种融合物理信息的世界模型用于模拟火灾扩散动力学

Nan Zhou, Huandong Wang, Jiahao Li, Yang Li, Xiao-Ping Zhang, Yong Li, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 PhysFire-WM通过融合物理信息和跨任务协作训练策略,提升火灾扩散预测的物理真实性和几何准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏