arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-18 至 2026-02-18 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2602.15329 2026-02-18 cs.CV 79%

EventMemAgent: Hierarchical Event-Centric Memory for Online Video Understanding with Adaptive Tool Use

EventMemAgent: 基于分层事件中心记忆的在线视频理解与自适应工具使用

Siwei Wen, Zhangcheng Wang, Xingjian Zhang, Lei Huang, Wenjun Wu

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进创新中心,人工智能学院,北京航空航天大学) Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北京航空航天大学) Paradigm Inc.(4Paradigm公司)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 EventMemAgent通过分层事件中心记忆和自适应工具使用,解决在线视频理解中长程推理与细粒度细节的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10807 2026-02-18 cs.CV 57%

Prompts to Summaries: Zero-Shot Language-Guided Video Summarization with Large Language and Video Models

提示到摘要:基于大语言和视频模型的零样本语言引导视频摘要

Mario Barbara, Alaa Maalouf

机构 * Department of Computer Science, the University of Haifa(哈ifa大学计算机科学系)

专题命中 视频理解 :video-language(abstract);分类 cs.CV

AI总结 提出一种基于大语言和视频模型的零样本视频摘要方法,通过提示生成用户引导的摘要,无需训练数据,优于现有无监督和监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长视频与时序推理 1 篇

2602.15318 2026-02-18 cs.CV cs.AI 57%

Sparrow: Text-Anchored Window Attention with Visual-Semantic Glimpsing for Speculative Decoding in Video LLMs

Sparrow: 一种基于文本锚定窗口注意力与视觉语义窥视的推测解码方法用于视频大语言模型

Libo Zhang, Zhaoning Zhang, Wangyang Hong, Peng Qiao, Dongsheng Li

机构 * National Key Laboratory of Parallel and Distributed Computing(平行与分布式计算国家重点实验室) College of Computer Science and Technology(计算机科学与技术学院) National University of Defense Technology(国防科技大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 Sparrow通过文本锚定窗口注意力与视觉语义窥视方法,解决视频大语言模型中推测解码的性能下降问题,实现2.82倍加速。

Comments 15 pages , 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏