arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-23 至 2026-02-23 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 2 篇

2602.18434 2026-02-23 cs.CV 57%

Going Down Memory Lane: Scaling Tokens for Video Stream Understanding with Dynamic KV-Cache Memory

回溯记忆:通过动态KV缓存内存扩展令牌实现视频流理解

Vatsal Agarwal, Saksham Suri, Matthew Gwilliam, Pulkit Kumar, Abhinav Shrivastava

机构 * University of Maryland, College Park(马里兰大学 College Park 分校)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 MemStream通过扩展令牌预算和自适应选择策略,提升视频流理解的准确性和细粒度信息保留能力。

Comments Project page: see https://vatsalag99.github.io/memstream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16160 2026-02-23 cs.CV 57%

Uncertainty-Guided Inference-Time Depth Adaptation for Transformer-Based Visual Tracking

不确定性引导的推理时间深度适应用于基于变换器的视觉跟踪

Patrick Poggi, Divake Kumar, Theja Tulabandhula, Amit Ranjan Trivedi

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出UncL-STARK,通过动态不确定性引导的深度适应,在不修改网络的情况下,提升基于变换器的视觉跟踪效率,实现计算开销降低和能耗节省。

Comments Submitted to IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏