MomentSeeker: A Task-Oriented Benchmark For Long-Video Moment Retrieval
MomentSeeker: 一个面向任务的长视频时刻检索基准
专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV
AI总结 MomentSeeker提出一个面向任务的长视频时刻检索基准,通过多样化的视频和查询形式,评估长视频中关键时刻检索的准确性和效率挑战。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
MomentSeeker: 一个面向任务的长视频时刻检索基准
专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV
AI总结 MomentSeeker提出一个面向任务的长视频时刻检索基准,通过多样化的视频和查询形式,评估长视频中关键时刻检索的准确性和效率挑战。
VideoLoom:一种用于联合空间-时间理解的视频大语言模型
机构 * Fudan University(复旦大学) ; University of Maryland, College Park(马里兰大学学院公园分校)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 VideoLoom是一种用于联合空间-时间理解的视频大语言模型,通过LoomData-8.7k数据集和LoomBench基准测试,在多个视频理解任务中取得优异性能。
印度是如何烹饪饭团的?
机构 * IIIT Hyderabad
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 本文提出首个大规模饭团制作视频数据集及多阶段框架,用于研究烹饪视频中细粒度步骤差异及文化关联性。