arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-09-19 至 2025-09-19 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2509.14199 2025-09-19 cs.CV cs.AI cs.CL cs.LG 79%

Dense Video Understanding with Gated Residual Tokenization

Haichao Zhang, Wenhao Chai, Shwai He, Ang Li, Yun Fu

机构 * Northeastern University(东北大学) Princeton University(普林斯顿大学) University of Maryland(马里兰大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频扩散模型 1 篇

2508.01442 2025-09-19 cs.RO 50%

Physically-based Lighting Generation for Robotic Manipulation

Shutong Jin, Lezhong Wang, Ben Temming, Florian T. Pokorny

机构 * KTH Royal Institute of Technology(皇家理工学院) Technical University of Denmark(丹麦技术大学)

专题命中 视频扩散模型 :video diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频问答 1 篇

2508.19026 2025-09-19 cs.CL cs.AI cs.CV 57%

MovieCORE: COgnitive REasoning in Movies

Gueter Josmy Faure, Min-Hung Chen, Jia-Fong Yeh, Ying Cheng, Hung-Ting Su, Yung-Hao Tang, Shang-Hong Lai, Winston H. Hsu

机构 * National Taiwan University(国立台湾大学) NVIDIA National Tsing Hua University(国立清华大学)

专题命中 视频问答 :video-language(abstract);分类 cs.CV

Comments Accepted for EMNLP'2025 Main Conference (Oral Presentation). Project Page: https://joslefaure.github.io/assets/html/moviecore.html

详情

展开后加载摘要…

URL PDF HTML 收藏