WorldMark: A Unified Benchmark Suite for Interactive Video World Models
WorldMark:交互式视频世界模型的统一基准套件
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 WorldMark 是交互式视频世界模型的统一基准套件,通过适配器解决动作格式不兼容问题,从多维度评估模型,揭示现有协议未察觉的差异,将发布相关数据与代码。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
WorldMark:交互式视频世界模型的统一基准套件
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 WorldMark 是交互式视频世界模型的统一基准套件,通过适配器解决动作格式不兼容问题,从多维度评估模型,揭示现有协议未察觉的差异,将发布相关数据与代码。
FakeI2V-Bench:评估图像级深度伪造检测器在深度伪造视频检测中的适用性
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 本研究构建FakeI2V-Bench基准,评估图像级深度伪造检测器在视频检测中的性能,提出IV-Bridge框架聚合帧级预测,使多数图像级检测器性能超越现有视频级方法,为相关研究提供基准与新方向。
Comments To Appear in KDD 2026, Jeju, Korea, August 9-13, 2026
AcoustiTrace:看似合理的声音为何违背物理规律
专题命中 视频数据与评测 :video generation(abstract);分类 cs.MM
AI总结 该研究提出AcoustiTrace诊断基准,从八个声学维度评估T2AV和I2AV生成,构建相关数据集与评估器,发现领先模型仍难符合基础声学规律,其诊断可指导模型优化与新方向探索。
EgoIntent: 一种用于理解‘是什么、为什么和下一步’的以自我为中心的步级基准
专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV
AI总结 EgoIntent基准旨在通过步级意图理解解决以自我为中心视频中对‘是什么、为什么和下一步’的细粒度理解难题,包含15种日常生活场景,评估模型在三个维度上的表现。
EgoSafe:用于视觉安全理解的第一人称移动采集基准
机构 * South China University of Technology(华南理工大学) ; Beihang University(北京航空航天大学)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 该研究推出第一人称移动采集的视觉安全理解基准 EgoSafe-Bench,含12000个样本,用分层推理评估(HRE)协议测试,发现现有大视觉语言模型存在感知-推理解耦问题,为逻辑鲁棒视频理解系统提供评估框架
CG-World:面向世界模型的大规模世界状态数据集与协议
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 CG-World是源自工业计算机图形流水线的大规模世界状态数据集,含约85万时间对齐片段,支持干预学习与反事实推理,经评估可为世界模型相关任务提供结构化监督,拟打造共享数据基础设施。
VendorBench-100:用于深度伪造图像检测的统一跨范式基准测试
机构 * Universidade da Beira Interior(贝拉内斯大学) ; Shri Guru Buddhi Swami College(什里·古鲁·布迪·斯瓦米学院) ; Swami Ramanand Tirtha Marathwada University(斯瓦米拉曼南德·蒂尔塔马哈拉施特拉大学)
专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV
AI总结 研究针对深度伪造图像检测的三种范式缺乏通用评估的问题,提出VendorBench-100基准测试,用统一框架评估36个模型,强调现实场景,通过MCC排名,发现ROC-AUC与MCC有差异,还发布评估框架和结果助力后续研究。
Comments Fixed scoring-normalization error in Neural Defend/TruthScan results, revising the central finding: MCC and ROC-AUC are strongly correlated (r ~ 0.86) overall, with only a specific subset showing one-directional threshold miscalibration. Abstract, tables, Discussion, Conclusion updated
RDVSv2:用于RGB-D视频显著目标检测的大规模基准测试
机构 * National Key Laboratory of Fundamental Science on Synthetic Vision, Sichuan University(四川大学合成视觉基础科学国家重点实验室) ; College of Computer Science, Sichuan University(四川大学计算机学院)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 介绍用于RGB-D视频显著目标检测的大规模基准测试RDVSv2,其规模大、场景多样。基于SAM2建立强大基线,采用参数高效微调策略联合编码多模态线索,该基线在RDVSv2及现有基准测试中达最优,为相关研究提供资源。
Comments Accepted to ACMMM 2026
fMRI2Face:用于动态人脸重建的全高清功能磁共振成像视频数据集和几何引导神经解码框架
机构 * Fudan University(复旦大学) ; Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学) ; Xmov(未提及通用中文名,可音译为艾莫夫)
专题命中 视频数据与评测 :video diffusion(abstract);分类 cs.CV
AI总结 该研究提出fMRI-Face数据集及fMRI2Face框架,用于从大脑活动重建动态人脸。框架从大脑活动中获取两种互补神经控制,经整合实现高保真面部视频重建,实验显示其性能优于基线,为动态面部感知研究提供了新平台和基准。
T-STAR:卫星视频中时空全景场景图生成的大规模基准测试
机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感信息工程学院) ; School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 本文针对卫星视频结构化理解难题,提出时空全景场景图生成任务,构建T-STAR大规模基准数据集,含超百万实例掩码和时空三元组,还提出统一框架,经实验验证其对卫星视频理解研究的重要性和框架有效性。
Comments 17 pages, 8 figures
生成式语义多目标跟踪:大规模基准和基于大型语言模型的推理框架
机构 * Northwestern Polytechnical University(西北工业大学)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 研究将语义多目标跟踪从刚性分类提升为开放式生成推理任务,引入Grand-SMOT基准,提出LLMTrack框架,通过时空融合模块压缩轨迹为语义令牌,提升了生成语义推理能力。
人工智能生成的以人为中心的视频的多维质量评估:数据集与模型
机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) ; USC-SJTU Institute of Cultural and Creative Industry, Shanghai Jiao Tong University(上海交通大学南加州大学文化创意产业学院) ; Polytech Nantes, Université de Nantes(法国南特大学高等理工学院)
专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV
AI总结 研究针对AI生成的以人为中心的视频质量评估问题,提出扩展数据集HVEval+并构建MoE-Rater模型,该模型采用专家混合及三阶段训练策略,能统一多种任务,在相关数据集上性能优越,推动了视频质量评估及T2V模型优化。
Comments Accepted for publication in IEEE TCSVT, 2026
Apple-$π$:基于视频对基于法律的物理智能进行思维基准测试
机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 研究针对视频模型评估仅看输出层面的不足,提出Apple-PI基准,含数据集、协议和评估套件三部分,通过对11个模型测试发现其距可靠世界模拟器差距大,并揭示了一些瓶颈与差距,为指导视频模型发展提供诊断基础。
用于悬吊负载下工人检测的隐私感知合成视频基准测试与关系评估
机构 * Government Technology Agency of Singapore(新加坡政府科技局)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 研究悬吊负载下工人检测的隐私问题,引入SynthSite合成视频基准测试及隐私感知混合生成工作流程,在五种隐私条件下评估相关指标,发现保留结构的模糊处理效用更好,强调建筑安全分析隐私评估需兼顾外观抑制和几何线索保留。
Comments Accepted at the 3rd Workshop on Synthetic Data for Computer Vision (SynData4CV), CVPR 2026. OpenReview: https://openreview.net/forum?id=dMfhFmDWsg . Dataset and code: https://huggingface.co/datasets/govtech/SynthSite
视频场景解析的全面综述:进展、挑战与展望
机构 * College of Software, Nankai University Tianjin China ; School of Electrical ; Electronic Engineering, NTU \& Institute for Infocomm Research, A STAR Singapore ; School of Information ; College of Computer Science, Nankai University Tianjin China ; VCIP, College of Computer Science, Nankai University Tianjin China ; Academy for Advanced Interdisciplinary Studies, Nankai University Tianjin China ; Nankai International Advanced Research Institute Shenzhen Futian China ; College of Software, Nankai University ; Electronic Engineering, NTU \& Institute for Infocomm Research, A STAR ; College of Computer Science, Nankai University ; VCIP, College of Computer Science, Nankai University ; Academy for Advanced Interdisciplinary Studies, Nankai University ; Nankai International Advanced Research Institute
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 该综述对视频场景解析在五项任务上的进展进行梳理,涵盖从手工线索到基础模型方法的文献架构,分析各方法特点,比较相关数据集等,指出设计权衡和失败模式,并给出未来发展方向。
从内容到受众:一种多模态注释框架用于广播电视分析
机构 * Dipartimento di Elettronica, Informazione e Bioingegneria, Politecnico di Milano, Italy(意大利米兰理工大学电子、信息与生物工程系)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 本文提出了一种多模态注释框架,用于广播电视内容分析,通过构建特定领域的基准测试,评估不同管道架构在广播新闻中的表现,展示了框架在受众分析中的应用价值。
SafeGuard:用于社会风险AI生成视频检测的多智能体感知-推理框架
机构 * University of Science and Technology of China(中国科学技术大学) ; King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) ; Vast Intelligence Lab(旷视智能实验室)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 针对AI生成视频检测挑战,提出SafeGuard多智能体框架,通过感知求解器与验证器协作,引入SafeVid基准,实验证明其泛化性佳,提升检测准确率。
Comments Accepted to ECCV 2026, The code and dataset are publicly available at https://github.com/williamw99/SafeGuard
LongEgoRefer: 长形式自我中心视频指代表达理解基准
机构 * Woven by Toyota, Japan(丰田公司,日本) ; The University of Tokyo, Japan(东京大学,日本) ; National Institute of Informatics, Japan(日本信息机构国家研究所) ; Institute of Science Tokyo, Japan(东京科学研究所,日本) ; NII LLMC, Japan(日本信息机构LLMC) ; Kyoto University, Japan(京都大学,日本)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 提出LongEgoRefer基准,基于Ego4D长视频构建,解决现有基准仅关注短视频导致目标稀疏和活动复杂的问题,评估现有方法发现性能显著下降,凸显长形式自我中心时空定位的挑战。
Comments ECCV 2026. Dataset and code: https://github.com/shunya-kato/LongEgoRefer
TCMA:面向无人机跨模态文本-视频检索的文本条件多粒度对齐
机构 * Carnegie Mellon University(卡内基梅隆大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Wuhan University(武汉大学)
专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV
AI总结 针对无人机视频检索中数据集粗粒度、冗余标注问题,构建细粒度多样化标注数据集DVTMD,并提出文本条件多粒度对齐框架TCMA,实现全局-局部多层级对齐,在无人机文本-视频检索任务上达到最优性能。
PhyEditBench: 一个用于物理感知图像编辑的真实世界多阶段基准
机构 * Nanjing University(南京大学) ; SDU(山东大学) ; HRBEU(哈尔滨工程大学) ; SDUTCM(山东中医药大学) ; USTC(中国科学技术大学)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 提出PhyEditBench基准,通过分层分类和真实/反物理实例评估编辑模型的物理理解能力,并引入训练无关基线PhyWorld利用视频生成推理。
Comments 19 pages, 6 figures, 2 tables. Accepted to ECCV 2026
EgoSAT: 一个全面的自我中心流式交互理解基准
机构 * College of AI, Tsinghua University(清华大学人工智能学院) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV
AI总结 提出EgoSAT基准,统一自我中心视频的回顾、在线和前瞻推理任务,评估视觉语言模型在流式设置中的表现,发现现有模型存在前瞻/回顾困难及置信度校准问题。
Comments Accepted to ECCV 2026. Project page: https://leiyj23.github.io/EgoSAT/
修剪视觉世界建模评估的长尾
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Stanford University(斯坦福大学) ; Columbia University(哥伦比亚大学)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 针对视觉世界模型在罕见物理交互上泛化不足的问题,提出Tailor-Bench基准,通过常规、非常规和不可能三种场景模式系统评估模型推理能力,揭示长尾性能差距。
MMOU:面向长且复杂真实世界视频的大规模多任务全模态理解与推理基准
机构 * NVIDIA, USA(NVIDIA美国分公司) ; University of Maryland, College Park, USA(马里兰大学帕克分校)
专题命中 视频数据与评测 :long video(abstract);分类 cs.CV
AI总结 提出MMOU基准,包含2万个人工标注问题与11877个长视频,覆盖13项技能,评估多模态大模型在长视频中的全模态理解与推理能力,最佳闭源模型仅64.2%准确率,开源模型46.8%。
Comments Project Page: https://huggingface.co/datasets/nvidia/MMOU
EgoCS-400K:面向世界模型的自我中心游戏数据集
机构 * City University of Hong Kong(香港城市大学)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 为支持世界模型研究,构建大规模自我中心游戏数据集EgoCS-400K,包含40万第一人称视频和1万小时游戏轨迹,支持动作条件未来预测、状态事件场景展开等交互式视觉建模任务。
OmniTraffic:面向时空交通推理的可控生成流水线与基准
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shanghai AI Lab(上海人工智能实验室) ; Beihang University(北京航空航天大学) ; Nanyang Technological University(南洋理工大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 提出OmniTraffic,一个基于12个真实路口3D重建的可控生成流水线与基准,通过8M VQA样本和3K人工验证测试集评估11个前沿MLLM,揭示拓扑与时空推理中的显著人机差距,并证明仿真数据微调可提升真实场景性能。
Comments 34 pages, 28 figures
Proact-VL:用于实时AI伴侣的主动式视频大语言模型
机构 * Tsinghua University(清华大学)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 本文提出Proact-VL框架,通过游戏场景中的评论和引导任务,解决实时AI伴侣在低延迟推理、自主响应决策和内容质量控制方面的挑战,实现了主动式实时交互。
Comments ICML 2026
M$^3$Eval: 通过认知基础视频任务的多模态记忆评估
机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) ; State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) ; Yuanpei College, Peking University(北京大学元培学院) ; Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; School of Psychological and Cognitive Sciences, Peking University(北京大学心理学与认知科学学院) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 提出首个多模态模型记忆评估框架M$^3$Eval,通过认知心理学设计的视频任务系统评估模型在记忆保持、忠实性和鲁棒性上的表现,发现模型在并行视频流处理、干扰模式、时空记忆和符号记忆方面的显著缺陷。
Comments We present an evaluation designed for multi-modal memory in multi-modal models
SagaQA:面向电视剧长篇叙事理解的多跳推理基准
机构 * IRIT, University of Toulouse, France(法国图卢兹大学IRIT中心) ; Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局) ; CNRS, IRIT, France(法国CNRS与IRIT)
专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV
AI总结 提出SagaQA基准,通过跨剧集的多跳推理任务评估模型对完整电视剧多模态叙事的高层次理解,并比较并行、顺序和混合三种规划策略的性能。
CoCoVideo: 基于商业模型的高质量对比基准用于AI生成视频检测
机构 * School of Informatics, Xiamen University(厦门大学信息学院) ; China Academy of Information and Communications Technology(中国信息通信技术研究院) ; AI Transcend Pte. Ltd.(AI Transcend有限公司)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 针对现有数据集依赖低质量开源模型且商业样本带水印的问题,提出包含13个商业生成器的CoCoVideo-26K对比数据集,并设计结合对比学习与置信门控多模态大语言模型的CoCoDetect检测框架,实现高保真AI生成视频的鲁棒检测。
Comments Accepected by CVPR 2026
v-HUB: 从视觉和声音理解视频幽默的基准
机构 * Shanghai Jiao Tong University(上海交通大学) ; Wuhan University(武汉大学) ; Beijing Institute for General Artificial Intelligence(北京一般人工智能研究院) ; Independent Researcher(独立研究者)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 提出v-HUB基准,通过非语言短视频评估多模态大语言模型在仅凭视觉线索理解幽默的能力,并发现音频信息有助于提升幽默理解。
Comments 24 pages, 9 figures