arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-07-24 至 2025-07-24 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2507.09068 2025-07-24 cs.CV cs.AI cs.IR cs.LG cs.MM 84%

Infinite Video Understanding

Dell Zhang, Xiangyu Chen, Jixiang Luo, Mengxi Jia, Changzhi Sun, Ruilong Ren, Jingren Liu, Hao Sun, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) Peking University(北京大学) Tianjin University(天津大学)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02591 2025-07-24 cs.CV 83%

AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding

Weili Xu, Enxin Song, Wenhao Chai, Xuexiang Wen, Tian Ye, Gaoang Wang

机构 * Zhejiang University(浙江大学) University of Washington(华盛顿大学) HKUST (GZ)(香港科技大学(广州)) Zhejiang University / Shanghai AI Lab(浙江大学/上海人工智能实验室)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

Comments ICCV 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17050 2025-07-24 cs.CV 57%

Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models

Tz-Ying Wu, Tahani Trigui, Sharath Nittur Sridhar, Anand Bodas, Subarna Tripathi

机构 * Intel(英特尔)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to CVAM Workshop at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏