arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-17 至 2025-12-17 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2512.14273 2025-12-17 cs.CV 83%

Zoom-Zero: Reinforced Coarse-to-Fine Video Understanding via Temporal Zoom-in

Zoom-Zero: 通过时间放大实现强化的粗到细视频理解

Xiaoqian Shen, Min-Hung Chen, Yu-Chiang Frank Wang, Mohamed Elhoseiny, Ryo Hachiuma

机构 * NVIDIA(英伟达) KAUST(卡塔尔人工智能研究所在线大学)

专题命中 视频理解 :video understanding(title,abstract);video-language(abstract);分类 cs.CV

AI总结 Zoom-Zero通过时间放大和令牌选择性信用分配提升视频问题回答的时空定位精度和答案准确性。

Comments Project page: https://xiaoqian-shen.github.io/Zoom-Zero/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09143 2025-12-17 cs.CV 79%

Exo2Ego: Exocentric Knowledge Guided MLLM for Egocentric Video Understanding

Exo2Ego:基于外部知识引导的多模态大语言模型用于第一人称视频理解

Haoyu Zhang, Qiaohui Chu, Meng Liu, Haoxiang Shi, Yaowei Wang, Liqiang Nie

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 Exo2Ego通过迁移学习提升内向视频理解能力,利用外向知识增强模型性能。

Comments This paper is accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏