arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-06 至 2026-01-06 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 3 篇

2512.17229 2026-01-06 cs.CV 83%

Video Detective: Seek Critical Clues Recurrently to Answer Question from Long Videos

视频侦探:通过反复寻找关键线索来回答长视频中的问题

Henghui Du, Chunjie Zhang, Xi Chen, Chang Zhou, Di Hu

机构 * Gaoling School of Artificial Intelligence(北京中国人民大学人工智能学院) Renmin University of China(中国人民大学) AI Technology Center Online Video Business Unit(人工智能技术中心在线视频业务部) Tencent PCG(腾讯PCG)

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 VideoDetective通过问题感知的记忆机制,使大语言模型能高效处理长视频问答任务,减少计算资源消耗并提升关键信息提取能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01322 2026-01-06 cs.CV cs.AI cs.LG cs.MM eess.IV 67%

LinMU: Multimodal Understanding Made Linear

LinMU: 使多模态理解线性化

Hongjie Wang, Niraj K. Jha

机构 * Princeton University(普林斯顿大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV、cs.MM

AI总结 LinMU通过线性复杂度设计实现多模态理解,无需二次注意力模块,提升视频处理效率。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01192 2026-01-06 cs.CV 57%

Crowded Video Individual Counting Informed by Social Grouping and Spatial-Temporal Displacement Priors

受社交分组和时空位移先验信息启发的拥挤视频个体计数

Hao Lu, Xuhui Zhu, Wenjing Zhang, Yanan Li, Xiang Bai

机构 * State Key Laboratory of Multispectral Information Intelligent Processing Technology(多谱信息智能处理技术国家重点实验室;人工智能与自动化学院,华中科技大学) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(湖北省智能机器人重点实验室;计算机科学与工程人工智能学院,武汉理工大学) Hubei Key Laboratory of Intelligent Robot(软件工程学院,华中科技大学) School of Computer Science & Engineering Artificial Intelligence, Wuhan Institute of Technology School of Software Engineering, Huazhong University of Science and Technology

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出OMAN++方法,通过引入社交分组和时空位移先验信息,提升拥挤场景下视频个体计数的准确性。

Comments Journal Extension of arXiv:2506.13067

详情

展开后加载摘要…

URL PDF HTML 收藏