arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-13 至 2026-01-13 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 3 篇

2502.12558 2026-01-13 cs.CV cs.AI 70%

MomentSeeker: A Task-Oriented Benchmark For Long-Video Moment Retrieval

MomentSeeker: 一个面向任务的长视频时刻检索基准

Huaying Yuan, Jian Ni, Zheng Liu, Yueze Wang, Junjie Zhou, Zhengyang Liang, Bo Zhao, Zhao Cao, Zhicheng Dou, Ji-Rong Wen

专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 MomentSeeker提出一个面向任务的长视频时刻检索基准,通过多样化的视频和查询形式,评估长视频中关键时刻检索的准确性和效率挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07290 2026-01-13 cs.CV 57%

VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding

VideoLoom:一种用于联合空间-时间理解的视频大语言模型

Jiapeng Shi, Junke Wang, Zuyao You, Bo He, Zuxuan Wu

机构 * Fudan University(复旦大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 VideoLoom是一种用于联合空间-时间理解的视频大语言模型,通过LoomData-8.7k数据集和LoomBench基准测试,在多个视频理解任务中取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06198 2026-01-13 cs.CV 57%

How Does India Cook Biryani?

印度是如何烹饪饭团的?

Shubham Goel, Farzana S, C V Rishi, Aditya Arun, C V Jawahar

机构 * IIIT Hyderabad

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 本文提出首个大规模饭团制作视频数据集及多阶段框架,用于研究烹饪视频中细粒度步骤差异及文化关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏