arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-13 至 2026-01-13 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 2 篇

2601.06573 2026-01-13 cs.AI cs.MM 83%

QMAVIS: Long Video-Audio Understanding using Fusion of Large Multimodal Models

QMAVIS:利用大多模态模型融合实现长视频音频理解

Zixing Lin, Jiale Wang, Gee Wah Ng, Lee Onn Mak, Chan Zhi Yang Jeriel, Jun Yang Lee, Yaohao Li

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.MM

AI总结 QMAVIS通过融合大型多模态模型、大型语言模型和语音识别模型,实现了长视频音频理解,展示了在VideoMME数据集上38.75%的性能提升,并在其他数据集上表现出竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06176 2026-01-13 cs.CV 70%

TIR-Flow: Active Video Search and Reasoning with Frozen VLMs

TIR-Flow:基于冻结视频语言模型的主动视频搜索与推理

Hongbo Jin, Siyi Xie, Jiayu Ding, Kuanwei Lin, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 长视频与时序推理 :video reasoning(abstract);video-language(abstract);分类 cs.CV

AI总结 TIR-Flow通过三个协同模块实现冻结视频语言模型的主动视频搜索与推理,显著提升性能并拓展长视界视频推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏