VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models
专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM
Comments EMNLP 2024 Main conference
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM
Comments EMNLP 2024 Main conference
专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM
Comments Accepted to ACM MM 2024. Project page: https://synopground.github.io/
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM
Comments ECCV2024 accepted
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM
专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV、eess.IV
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV、cs.MM
Comments We open-source our data, model, and code at: https://github.com/linzhiqiu/t2v_metrics ; Project page: https://linzhiqiu.github.io/papers/vqascore
专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV、cs.MM
Comments Project Page: https://funqa-benchmark.github.io/ Codebase: https://github.com/Jingkang50/FunQA
专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM
专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM
专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV、eess.IV
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、eess.IV
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV、eess.IV
Comments ICASSP 2022
专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM
Comments Dataset is available from: https://github.com/ParitoshParmar/Piano-Skills-Assessment
专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV、cs.MM
Comments Accepted by Findings of ACL 2021
专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV、cs.MM
专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM
Comments 19 pages, 6 tables, 4 figures. arXiv admin note: substantial text overlap with arXiv:2007.14560
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、eess.IV
Comments ICPR 2020 (HCAU)
专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM
Comments 19 pages, 1 figure, 14 tables
专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM
Comments Published in IEEE Transactions on Multimedia
Journal ref J. Li, Y. Wong, Q. Zhao and M. S. Kankanhalli, "Video Storytelling: Textual Summaries for Events," in IEEE Transactions on Multimedia, 2019
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM
Comments Accepted to AAAI 2019 Spring Symposium Series : Story-Enabled Intelligence
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM
Comments ACPR 2015
VISTA:视频交互时空分析基准
机构 * University of Central Florida(中央佛罗里达大学) ; BITS Pilani(比特斯理工学院) ; Ho Chi Minh City University of Science(胡志明市科学大学) ; Amazon GenAI Project(亚马逊生成人工智能项目)
专题命中 视频数据与评测 :video understanding(abstract,comments);分类 cs.CV
AI总结 提出VISTA基准,通过分解视频为实体、动作和关系,实现开放集多实体多动作的时空理解评估,揭示传统指标掩盖的偏差。
Comments Accepted to CVPR 2026 Workshop on Pixel-level Video Understanding in the Wild (PVUW)
OmniAssistBench:面向全模态大语言模型(Omni-LLMs)的助手式交互基准
机构 * Nankai University(南开大学) ; University of Waterloo(滑铁卢大学) ; Nanjing University(南京大学)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 针对全模态大语言模型助手式交互的评估瓶颈,构建OmniAssistBench数据集,实验显示Gemini-3-Pro、Qwen3-Omni-Instruct表现存在差距,当前模型在多轮交互等方面仍有不足。
Comments Project page: this https URL (https://xianyunsun.github.io/OmniAssistBench/)
VA-Judger:用于联合视频-音频生成的人类偏好反馈奖励建模
机构 * Shanghai Innovation Institution(上海创新研究院) ; Fudan University(复旦大学) ; Yinwang Intelligent Technology Co., Ltd(音网智能科技有限公司)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 本研究针对联合视频-音频生成的奖励信号问题,构建了VAPref-10K数据集与VA-Judger-Bench基准,提出思维链全奖励模型VA-Judger,其在预测人类偏好及提升生成质量上均优于基线方法。
Comments 19 pages, 7 figures, 8 tables. Code: https://github.com/ShareLab-SII/VA-Judger
WorldBench: 为世界模型诊断评估进行物理辨析
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Sony AI(索尼人工智能) ; Yale University(耶鲁大学) ; DEVCOM Army Research Laboratory(陆军研究实验室)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 WorldBench通过概念特定的解耦评估,提升世界模型的物理推理能力评估的准确性和可扩展性。
Comments Webpage: https://world-bench.github.io/
NBA_Streaming:用于连续流中细粒度篮球评论生成的大规模基准测试
机构 * School of Information Science and Technology, Beijing University of Technology(北京工业大学信息科学与技术学院) ; Fudan University(复旦大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 针对现有篮球评论生成方法与数据集不适用于连续流的局限,推出大规模基准NBA_Streaming,提出因果两阶段框架,可有效提升在线细粒度篮球评论生成性能。
从检测到理解:用于多任务交通异常推理的TAR与TAR-Bench
机构 * NVIDIA(英伟达) ; Santa Clara University(圣克拉拉大学)
专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV
AI总结 该研究提出TAR与TAR-Bench数据集,用于训练评估超越异常检测的视频-语言模型,经实验验证其多任务微调可提升模型推理能力,且为2026年AI城市挑战赛第3赛道提供官方数据。
幻觉还是完整性?用于AIGC视频质量评估的几何一致性指标
机构 * Hunan University(湖南大学)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 针对现有AIGC视频质量评估缺乏物理定律保真度量化指标的问题,提出GeoCon-Bench基准,通过帧间几何一致性评估AIGC视频质量,经实验验证其可靠性。
CodecArena:基于视觉强化学习的编解码器质量评估
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 研究针对视频编码主流指标无法准确评估内容保真度的问题,提出首个视频编码质量评估视觉-语言框架CodecArena,采用视觉强化学习方案优化,构建相关数据集与基准,在源不相交内容上实现优于现有方法的人类判断一致性。
Comments The project page is: https://jyfu-vcl.github.io/codecarena
GST-Bench:视觉语言模型能否从视频中发展出全局空间感知能力?
机构 * ByteDance Seed(字节跳动 Seed) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 该研究提出GST-Bench基准评估VLMs的视频全局空间感知,发现其与人类存在显著差距,构建GST-Bench-Local探究原因,还提供GST-Train数据集助力相关研究。