arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-09-16 至 2025-09-16 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 4 篇

2509.12145 2025-09-16 cs.CV 79%

Open-ended Hierarchical Streaming Video Understanding with Vision Language Models

Hyolim Kang, Yunsu Park, Youngbeom Yoo, Yeeun Choi, Seon Joo Kim

机构 * Yonsei University(延世大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11360 2025-09-16 cs.CV 57%

GLaVE-Cap: Global-Local Aligned Video Captioning with Vision Expert Integration

Wan Xu, Feng Zhu, Yihan Zeng, Yuanfan Guo, Ming Liu, Hang Xu, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨理工大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03235 2025-09-16 cs.CV cs.AI 57%

Enhancing Traffic Incident Response through Sub-Second Temporal Localization with HybridMamba

Ibne Farabi Shihab, Sanjeda Akter, Anuj Sharma

机构 * Department of Computer Science, Iowa State University, Ames, IA, USA(计算机科学系,爱荷华州立大学) Department of Civil, Construction and Environmental Engineering, Iowa State University, Ames, IA, USA(土木、建设与环境工程系,爱荷华州立大学)

专题命中 视频理解 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01020 2025-09-16 cs.CV 57%

Shot-by-Shot: Film-Grammar-Aware Training-Free Audio Description Generation

Junyu Xie, Tengda Han, Max Bain, Arsha Nagrani, Eshika Khandelwal, Gül Varol, Weidi Xie, Andrew Zisserman

机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组) CVIT, IIIT Hyderabad(海得拉巴印度理工学院计算机视觉研究所) LIGM, École des Ponts ParisTech(巴黎理工学院路易-狄塞尔数学与计算机科学实验室) SAI, Shanghai Jiao Tong University(上海交通大学人工智能研究所)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments ICCV 2025. Project Page: https://www.robots.ox.ac.uk/vgg/research/shot-by-shot/

详情

展开后加载摘要…

URL PDF HTML 收藏