arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-08-20 至 2025-08-20 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 3 篇

2508.13584 2025-08-20 cs.CV 88%

Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model

Ruixin Zhang, Jiaqing Fan, Yifan Liao, Qian Qiao, Fanzhang Li

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07961 2025-08-20 cs.CV 70%

Geo4D: Leveraging Video Generators for Geometric 4D Scene Reconstruction

Zeren Jiang, Chuanxia Zheng, Iro Laina, Diane Larlus, Andrea Vedaldi

机构 * Visual Geometry Group, University of Oxford(视觉几何组,牛津大学) Naver Labs Europe(Naver欧洲实验室)

专题命中 视频扩散模型 :video diffusion(abstract);long video(abstract);分类 cs.CV

Comments 17 pages, 6 figures, ICCV 2025 Highlight, Project page: https://geo4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13300 2025-08-20 cs.CV cs.AI 57%

GaitCrafter: Diffusion Model for Biometric Preserving Gait Synthesis

Sirshapan Mitra, Yogesh S. Rawat

机构 * CRCV, University of Central Florida(CRCV,中央佛罗里达大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏