Towards Multimodal Lifelong Understanding: A Dataset and Agentic Baseline
迈向多模态终身理解:一个数据集和代理基准
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 本文提出MM-Lifelong数据集和ReMA代理,解决多模态终身理解中的工作记忆瓶颈和全局定位崩溃问题,通过动态内存管理提升模型性能。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
迈向多模态终身理解:一个数据集和代理基准
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 本文提出MM-Lifelong数据集和ReMA代理,解决多模态终身理解中的工作记忆瓶颈和全局定位崩溃问题,通过动态内存管理提升模型性能。
MicroVerse: 微观世界模拟的初步探索
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Peking Union Medical College Hospital(北京协和医学院附属医院) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 MicroVerse通过构建MicroWorldBench和MicroSim-10K数据集,首次提出微观世界模拟概念,展示其在生物机制教育中的潜力。
WorldSense: 评估多模态大语言模型的现实世界多模态理解
机构 * Xiaohongshu Inc.(小红书公司) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 WorldSense是首个评估多模态大语言模型现实世界多模态理解能力的基准,通过多模态协作、多样化视频任务和高质量标注,全面评估模型在复杂场景中的表现。
Comments Accepted by ICLR2026
GenVidBench:一个600万的AI生成视频检测基准数据集
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 GenVidBench是一个包含600万视频的AI生成视频检测基准数据集,通过大规模、跨源和跨生成器的视频收集,提升AI生成视频检测模型的泛化能力。
Comments AAAI 2026
多模态理解和生成的统一奖励模型
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 本文提出统一奖励模型,通过联合学习多种视觉任务提升多模态理解和生成的性能。
Comments project page: https://codegoat24.github.io/UnifiedReward/
UDVideoQA: 一个用于城市动态多对象时空推理的交通视频问答数据集
机构 * Arizona State University(亚利桑那州立大学)
专题命中 视频数据与评测 :video language model(abstract);分类 cs.CV
AI总结 UDVideoQA是一个用于城市动态多对象时空推理的交通视频问答数据集,通过统一标注流程生成28K问题-答案对,评估视觉定位和因果推理能力。
3DSPA:一种用于评估视频真实性的3D语义点自编码器
机构 * University of California, San Diego, CA, USA(加州大学圣迭戈分校) ; University of British Columbia, Vancouver, BC, Canada(不列颠哥伦比亚大学) ; Vector Institute, Toronto, ON, Canada(向量研究所)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 3DSPA通过整合3D语义与时空点轨迹,实现无需参考视频的视频真实性自动评估。
VQPP:视频查询性能预测基准
机构 * University of Bucharest / Bitdefender(布加勒斯大学/Bitdefender) ; University of Bucharest(布加勒斯大学)
专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV
AI总结 本文提出VQPP基准,用于视频查询性能预测,包含两个数据集和两个系统,探索预检索和后检索预测器,并展示其在训练大型语言模型上的应用。
一种可泛化的术中理解基础模型用于不同手术程序
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 ZEN是一种基于自监督多教师蒸馏框架训练的术中手术视频理解基础模型,通过大规模数据集训练实现了跨手术程序的泛化能力,优于现有手术基础模型。
世界模拟器能推理吗?Gen-ViRe:一个生成性视觉推理基准
机构 * University of Central Florida(中央佛罗里达大学) ; National University of Singapore(新加坡国立大学) ; UW-Madison(威斯康星大学麦迪逊分校)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 Gen-ViRe提出一个生成性视觉推理基准,通过分解CoF推理为六个认知维度和24个子任务,评估视频模型的推理能力,揭示视觉质量与推理深度的差异。
Comments 10 pages
TwiFF (Think With Future Frames): 一个大规模动态视觉推理数据集
机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院) ; School of Computer and Computing Science, Hangzhou City University, Hangzhou, China(杭州市城市大学计算机与计算科学学院) ; Henan Academy of Innovations in Medical Science (AIMS), Zhengzhou, China(河南省医学创新研究院) ; School of Software, Beihang University, Beijing, China(北京航空航天大学软件学院)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 TwiFF提出一个大规模动态视觉推理数据集及模型,通过整合视频生成与图像理解能力,提升动态场景下的视觉问答性能。
Comments preprint
WorldArena: 一个用于评估具身世界模型感知与功能效用的统一基准
机构 * Tsinghua University, Beijing, China(清华大学) ; Shanghai Jiao Tong University, Shanghai, China(上海交通大学) ; The University of Hong Kong, Hong Kong SAR, China(香港大学) ; Princeton University, Princeton, NJ, USA(普林斯顿大学) ; Chinese Academy of Sciences, Beijing, China(中国科学院) ; University of Science(科学技术大学) ; Peking University, Beijing, China(北京大学) ; National University of Singapore, Singapore(新加坡国立大学)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 WorldArena是一个统一的基准,用于评估具身世界模型的感知和功能效用,揭示高视觉质量与强具身任务能力之间的差距。
VideoVeritas:通过感知预设强化学习实现AI生成视频检测
机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究所)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 VideoVeritas通过感知预设强化学习提升AI生成视频检测性能,整合细粒度感知与事实推理,采用时空定位和自监督计数提升检测效果。
Comments Project: https://github.com/EricTan7/VideoVeritas
基于显著性的DETR用于时刻检索和突出检测
机构 * SALUTEDEV LLC
专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV
AI总结 本文提出基于显著性的DETR架构,通过引入显著性引导交叉注意力机制和混合DETR结构,提升视频时刻检索和突出检测性能,并在多个基准上取得最佳结果。
Comments 8 pages, 2 figure, 6 tables
STEC:一种无参考的时空熵覆盖度量,用于评估采样视频帧
机构 * Independent Researcher(独立研究者)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 STEC是一种无参考的时空熵覆盖度量,用于评估视频帧采样的有效性,通过联合建模空间信息强度、时间分散性和非冗余性,提供一种轻量且原则性的采样质量度量。
Comments This paper corresponds to the camera-ready version of a WACV 2026 Workshop paper
高效处理倾斜无人机视频以快速绘制洪水范围
机构 * IDLab, Department of Information Technology, Ghent University - imec(IDLab,信息科技系,根特大学 - imec) ; Environmental Intelligence Unit, VITO (Flemish Institute for Technological Research)(环境智能单元,VITO(佛兰德斯技术研究院))
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 本文提出TTR框架,通过利用倾斜视频的时空冗余性,实现嵌入式设备上的高效视频分割,减少推理延迟并保持分割精度,适用于时间敏感的遥感任务。
推动自适应多阶段视频异常推理:一个基准数据集和方法
机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学计算机科学与技术学院(深圳校区)) ; Shenzhen Key Laboratory of Visual Object Detection and Recognition, Harbin Institute of Technology(哈尔滨工业大学深圳视觉目标检测与识别重点实验室)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 本文提出视频异常推理任务及相应数据集,通过结构化思维链和自适应策略优化,提升多阶段视频异常推理能力。
VideoLoom:一种用于联合空间-时间理解的视频大语言模型
机构 * Fudan University(复旦大学) ; University of Maryland, College Park(马里兰大学学院公园分校)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 VideoLoom是一种用于联合空间-时间理解的视频大语言模型,通过LoomData-8.7k数据集和LoomBench基准测试,在多个视频理解任务中取得优异性能。
印度是如何烹饪饭团的?
机构 * IIIT Hyderabad
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 本文提出首个大规模饭团制作视频数据集及多阶段框架,用于研究烹饪视频中细粒度步骤差异及文化关联性。
从理解到参与:通过视觉语言模型(VLMs)生成个性化药学视频片段
机构 * Roche(罗氏) ; Accenture(埃森哲) ; Involead
专题命中 视频数据与评测 :long video(abstract);分类 cs.CV
AI总结 本文提出基于视觉语言模型和音频语言模型的个性化药学视频片段生成方法,通过剪切合并算法和个性化机制提升生成效率与质量,实现制药行业内容处理的高效自动化。
Comments Contributed original research to top tier conference in VLM; currently undergoing peer review
理解病毒性:一种基于Rubric的视觉-语言模型框架用于短形式教育娱乐内容评估
机构 * Birla Institute of Technology and Science, Pilani(比拉理工学院和科学学院,比里尼)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 本文提出基于Rubric的视觉-语言模型框架,用于评估短形式教育娱乐视频的病毒性,通过提取音频视觉特征并训练回归评估器,实现可解释且可扩展的参与度预测。
Comments Under Review
在4D中学习推理:面向视觉语言模型的动态空间理解
机构 * The University of Hong Kong(香港大学) ; ARC Lab, Tencent PCG(腾讯PCG实验室)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 本研究提出DSR套件,通过生成多选题-答案对和轻量级几何选择模块提升视觉语言模型的动态空间推理能力。
用于机器人应用的测压识别合成数据集
机构 * University of São Paulo(圣保罗大学)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 本文提出了一种混合数据合成方法,通过结合过程渲染和AI驱动视频生成,提升机器人应用中测压识别的训练效果和可靠性。
Journal ref 2025 Latin American Robotics Symposium (LARS)
Omni-Effects: 统一且空间可控的视觉效果生成
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 Omni-Effects通过统一框架实现空间可控的多效果生成,结合LoRA-MoE和SAP技术,提升视觉效果生成的精度和多样性。
Comments Accepted to AAAI2026
MeViS:一种多模态数据集,用于指称运动表达视频分割
机构 * Fudan University(复旦大学) ; Shanghai University of Finance and Economics(上海财经大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 MeViS数据集通过多模态数据提升视频分割中运动表达的理解能力,提出LMPM++方法实现新突破。
Comments IEEE TPAMI, Project Page: https://henghuiding.com/MeViS/
Journal ref in IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 47, no. 12, pp. 11400-11416, 2025
MMSI-Video-Bench: 一个面向视频基于空间智能的综合基准
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiaotong University(上海交通大学) ; The Chinese University of Hong Kong(香港中文大学) ; Zhejiang University(浙江大学) ; Beihang University(北京航空航天大学) ; Xi’an Jiaotong University(西安交通大学) ; University of Hong Kong(香港大学) ; Fudan University(复旦大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV
AI总结 MMSI-Video-Bench是一个综合评估视频基于空间智能的基准,通过多任务和多数据集评估25个MLLMs,揭示了人机推理差距和模型泛化不足的问题。
从生成的人类视频到物理上合理的机器人轨迹
机构 * University of California, Berkeley(加州大学伯克利分校) ; New York University(纽约大学) ; Johannes Kepler University(约翰·凯撒大学)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 本文提出GenMimic方法,通过物理感知强化学习策略,从生成的视频中实现零样本的人形机器人动作模仿,并建立了评估零样本泛化能力的基准。
Comments For project website, see https://genmimic.github.io
重新思考视频中的链式推理
机构 * The Chinese University of Hong Kong(香港中文大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV
AI总结 本研究提出了一种高效的视频推理框架,通过简洁推理和减少的视觉标记提升推理效率和性能,无需依赖传统CoT注释或监督微调。
Comments Technical report
细粒度眼动视频时空定位
机构 * The Chinese University of Hong Kong(香港中文大学)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 本文提出EgoMask基准和EgoMask-Train数据集,针对眼动视频细粒度时空定位的挑战,通过微调提升模型性能。
Comments Accepted by ICCV 2025
NeuroABench: 一种多模态评估基准,用于神经外科解剖识别
机构 * Hong Kong Institute of Science and Innovation(香港科学与创新研究院) ; The University of Hong Kong-Shenzhen Hospital(香港大学深圳医院) ; Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 NeuroABench是首个用于评估神经外科领域解剖理解的多模态基准,通过实验揭示了MLLMs在解剖识别任务中的局限性,并展示了人类表现与模型之间的差距。
Comments Accepted by IEEE ICIA 2025