arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6790 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 578 篇

2406.10079 2024-11-22 cs.CV cs.AI 57%

Localizing Events in Videos with Multimodal Queries

Gengyuan Zhang, Mang Ling Ada Fok, Jialu Ma, Yan Xia, Daniel Cremers, Philip Torr, Volker Tresp, Jindong Gu

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments 20 pages (including references and appendix); for the project homepage, see https://icq-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03166 2024-10-28 cs.CV 57%

VideoGLUE: Video General Understanding Evaluation of Foundation Models

Liangzhe Yuan, Nitesh Bharadwaj Gundavarapu, Long Zhao, Hao Zhou, Yin Cui, Lu Jiang, Xuan Yang, Menglin Jia, Tobias Weyand, Luke Friedman, Mikhail Sirotenko, Huisheng Wang, Florian Schroff, Hartwig Adam, Ming-Hsuan Yang, Ting Liu, Boqing Gong

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18976 2024-10-25 cs.CV cs.AI cs.CL cs.CY cs.LG 57%

CAMEL-Bench: A Comprehensive Arabic LMM Benchmark

Sara Ghaboura, Ahmed Heakl, Omkar Thawakar, Ali Alharthi, Ines Riahi, Abduljalil Saif, Jorma Laaksonen, Fahad S. Khan, Salman Khan, Rao M. Anwer

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments 10 pages, 5 figures, NAACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02492 2024-10-10 cs.CV cs.CL 57%

DTVLT: A Multi-modal Diverse Text Benchmark for Visual Language Tracking Based on LLM

Xuchen Li, Shiyu Hu, Xiaokun Feng, Dailing Zhang, Meiqi Wu, Jing Zhang, Kaiqi Huang

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments Preprint, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02921 2024-10-07 cs.CV 57%

AirLetters: An Open Video Dataset of Characters Drawn in the Air

Rishit Dagli, Guillaume Berger, Joanna Materzynska, Ingo Bax, Roland Memisevic

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments ECCV'24, HANDS workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10484 2024-09-30 cs.CV 57%

Beyond Raw Videos: Understanding Edited Videos with Large Multimodal Model

Lu Xu, Sijie Zhu, Chunyuan Li, Chia-Wen Kuo, Fan Chen, Xinyao Wang, Guang Chen, Dawei Du, Ye Yuan, Longyin Wen

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14109 2024-09-27 cs.CV 57%

Vision-Language Models Assisted Unsupervised Video Anomaly Detection

Yalong Jiang, Liquan Mao

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08887 2024-09-16 cs.CV cs.CL 57%

Visual Language Tracking with Multi-modal Interaction: A Robust Benchmark

Xuchen Li, Shiyu Hu, Xiaokun Feng, Dailing Zhang, Meiqi Wu, Jing Zhang, Kaiqi Huang

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00510 2024-09-04 cs.CV cs.AI 57%

Streamlining Forest Wildfire Surveillance: AI-Enhanced UAVs Utilizing the FLAME Aerial Video Dataset for Lightweight and Efficient Monitoring

Lemeng Zhao, Junjie Hu, Jianchao Bi, Yanbing Bai, Erick Mas, Shunichi Koshimura

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments accpeted by Proceedings of the International Conference on Intelligent Robots and Systems (2024 IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19707 2024-08-23 cs.CV 57%

DeMamba: AI-Generated Video Detection on Million-Scale GenVideo Benchmark

Haoxing Chen, Yan Hong, Zizheng Huang, Zhuoer Xu, Zhangxuan Gu, Yaohui Li, Jun Lan, Huijia Zhu, Jianfu Zhang, Weiqiang Wang, Huaxiong Li

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08407 2024-07-31 cs.CV cs.AI cs.CL 57%

MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos

Xuehai He, Weixi Feng, Kaizhi Zheng, Yujie Lu, Wanrong Zhu, Jiachen Li, Yue Fan, Jianfeng Wang, Linjie Li, Zhengyuan Yang, Kevin Lin, William Yang Wang, Lijuan Wang, Xin Eric Wang

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16658 2024-07-24 cs.CV 57%

EgoCVR: An Egocentric Benchmark for Fine-Grained Composed Video Retrieval

Thomas Hummel, Shyamgopal Karthik, Mariana-Iuliana Georgescu, Zeynep Akata

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16124 2024-07-24 cs.CV 57%

Fréchet Video Motion Distance: A Metric for Evaluating Motion Consistency in Videos

Jiahe Liu, Youran Qu, Qi Yan, Xiaohui Zeng, Lele Wang, Renjie Liao

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13094 2024-07-19 cs.CV 57%

Rethinking Video-Text Understanding: Retrieval from Counterfactually Augmented Data

Wufei Ma, Kai Li, Zhongshi Jiang, Moustafa Meshry, Qihao Liu, Huiyu Wang, Christian Häne, Alan Yuille

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments ECCV 2024. Project page: https://feint6k.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06491 2024-07-10 cs.CV 57%

VideoEval: Comprehensive Benchmark Suite for Low-Cost Evaluation of Video Foundation Model

Xinhao Li, Zhenpeng Huang, Jing Wang, Kunchang Li, Limin Wang

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06358 2024-07-10 cs.CV 57%

MiraData: A Large-Scale Video Dataset with Long Durations and Structured Captions

Xuan Ju, Yiming Gao, Zhaoyang Zhang, Ziyang Yuan, Xintao Wang, Ailing Zeng, Yu Xiong, Qiang Xu, Ying Shan

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02150 2024-07-03 cs.CV 57%

VRBiom: A New Periocular Dataset for Biometric Applications of HMD

Ketan Kotwal, Ibrahim Ulucan, Gokhan Ozbulak, Janani Selliah, Sebastien Marcel

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15704 2024-06-25 cs.CV 57%

video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models

Guangzhi Sun, Wenyi Yu, Changli Tang, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun Ma, Yuxuan Wang, Chao Zhang

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments Accepted at ICML 2024. arXiv admin note: substantial text overlap with arXiv:2310.05863

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09601 2024-06-17 cs.CV 57%

Turns Out I'm Not Real: Towards Robust Detection of AI-Generated Videos

Qingyuan Liu, Pengyuan Shi, Yun-Yun Tsai, Chengzhi Mao, Junfeng Yang

专题命中 视频数据与评测 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04979 2024-06-10 cs.CV 57%

Semantic Segmentation on VSPW Dataset through Masked Video Consistency

Chen Liang, Qiang Guo, Chongkai Yu, Chengjing Wu, Ting Liu, Luoqi Liu

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.09711 2024-05-17 cs.AI cs.CL cs.CV 57%

STAR: A Benchmark for Situated Reasoning in Real-World Videos

Bo Wu, Shoubin Yu, Zhenfang Chen, Joshua B Tenenbaum, Chuang Gan

专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV

Comments NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04133 2024-05-08 cs.CV 57%

Exposing AI-generated Videos: A Benchmark Dataset and a Local-and-Global Temporal Defect Based Detection Method

Peisong He, Leyao Zhu, Jiaxing Li, Shiqi Wang, Haoliang Li

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15033 2024-04-24 cs.CV 57%

IPAD: Industrial Process Anomaly Detection Dataset

Jinfan Liu, Yichao Yan, Junjie Li, Weiming Zhao, Pengzhi Chu, Xingdong Sheng, Yunhui Liu, Xiaokang Yang

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12391 2024-04-19 cs.CV cs.GR cs.LG 57%

On the Content Bias in Fréchet Video Distance

Songwei Ge, Aniruddha Mahapatra, Gaurav Parmar, Jun-Yan Zhu, Jia-Bin Huang

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments CVPR 2024. Project webpage: https://content-debiased-fvd.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04565 2024-04-09 cs.CV 57%

SportsHHI: A Dataset for Human-Human Interaction Detection in Sports Videos

Tao Wu, Runyu He, Gangshan Wu, Limin Wang

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11782 2024-04-04 cs.CV 57%

Learning Object State Changes in Videos: An Open-World Perspective

Zihui Xue, Kumar Ashutosh, Kristen Grauman

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments Accepted by CVPR 2024, Project website: https://vision.cs.utexas.edu/projects/VidOSC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06505 2024-04-02 cs.CV 57%

Grounded Question-Answering in Long Egocentric Videos

Shangzhe Di, Weidi Xie

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments Accepted to CVPR 2024. Project website at https://dszdsz.cn/GroundVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20225 2024-04-01 cs.CV 57%

MTMMC: A Large-Scale Real-World Multi-Modal Camera Tracking Benchmark

Sanghyun Woo, Kwanyong Park, Inkyu Shin, Myungchul Kim, In So Kweon

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV

Comments Accepted on CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06560 2024-02-12 cs.CV cs.LG 57%

Video Annotator: A framework for efficiently building video classifiers using vision-language models and active learning

Amir Ziai, Aneesh Vartakavi

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments Submitted for review to KDD '24 (ADS Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01651 2024-01-24 cs.CV cs.AI 57%

AIGCBench: Comprehensive Evaluation of Image-to-Video Content Generated by AI

Fanda Fan, Chunjie Luo, Wanling Gao, Jianfeng Zhan

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments Accepted to BenchCouncil Transactions on Benchmarks, Standards and Evaluations (TBench)

详情

展开后加载摘要…

URL PDF HTML 收藏