arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-09-01 至 2025-09-01 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2508.19650 2025-09-01 cs.CV 83%

Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models

Hou Xia, Zheren Fu, Fangcan Ling, Jiajun Li, Yi Tu, Zhendong Mao, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) HUAWEI(华为)

专题命中 视频理解 :video language model(title,abstract);video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21809 2025-09-01 cs.CV 57%

VoCap: Video Object Captioning and Segmentation from Any Prompt

Jasper Uijlings, Xingyi Zhou, Xiuye Gu, Arsha Nagrani, Anurag Arnab, Alireza Fathi, David Ross, Cordelia Schmid

机构 * Google DeepMind(谷歌DeepMind)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频数据与评测 1 篇

2504.15376 2025-09-01 cs.CV cs.AI cs.CL cs.LG cs.MM 62%

Towards Understanding Camera Motions in Any Video

Zhiqiu Lin, Siyuan Cen, Daniel Jiang, Jay Karhade, Hewei Wang, Chancharik Mitra, Tiffany Ling, Yuhan Huang, Sifan Liu, Mingyu Chen, Rushikesh Zawar, Xue Bai, Yilun Du, Chuang Gan, Deva Ramanan

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV、cs.MM

Comments Project site: https://linzhiqiu.github.io/papers/camerabench/

详情

展开后加载摘要…

URL PDF HTML 收藏