arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-07-31 至 2025-07-31 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 1 篇

2503.12024 2025-07-31 cs.CV 57%

SteerX: Creating Any Camera-Free 3D and 4D Scenes with Geometric Steering

Byeongjun Park, Hyojun Go, Hyelin Nam, Byung-Hoon Kim, Hyungjin Chung, Changick Kim

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project page: https://byeongjun-park.github.io/SteerX/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频扩散模型 1 篇

2507.22360 2025-07-31 cs.CV cs.AI 83%

GVD: Guiding Video Diffusion Model for Scalable Video Distillation

Kunyang Li, Jeffrey A Chan Santiago, Sarinda Dhanesh Samarasinghe, Gaowen Liu, Mubarak Shah

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学) Cisco Research(思科研究)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长视频与时序推理 1 篇

2411.07076 2025-07-31 cs.CV cs.AI 79%

StoryTeller: Improving Long Video Description through Global Audio-Visual Character Identification

Yichen He, Yuan Lin, Jianchao Wu, Hanchong Zhang, Yuchen Zhang, Ruicheng Le

专题命中 长视频与时序推理 :long video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏