arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-18 至 2026-02-18 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2602.15329 2026-02-18 cs.CV 79%

EventMemAgent: Hierarchical Event-Centric Memory for Online Video Understanding with Adaptive Tool Use

EventMemAgent: 基于分层事件中心记忆的在线视频理解与自适应工具使用

Siwei Wen, Zhangcheng Wang, Xingjian Zhang, Lei Huang, Wenjun Wu

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进创新中心,人工智能学院,北京航空航天大学) Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北京航空航天大学) Paradigm Inc.(4Paradigm公司)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 EventMemAgent通过分层事件中心记忆和自适应工具使用,解决在线视频理解中长程推理与细粒度细节的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10807 2026-02-18 cs.CV 57%

Prompts to Summaries: Zero-Shot Language-Guided Video Summarization with Large Language and Video Models

提示到摘要:基于大语言和视频模型的零样本语言引导视频摘要

Mario Barbara, Alaa Maalouf

机构 * Department of Computer Science, the University of Haifa(哈ifa大学计算机科学系)

专题命中 视频理解 :video-language(abstract);分类 cs.CV

AI总结 提出一种基于大语言和视频模型的零样本视频摘要方法,通过提示生成用户引导的摘要,无需训练数据,优于现有无监督和监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏