Random Temporal Skipping for Multirate Video Analysis
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM
Comments Accepted at ACCV 2018. Camera ready
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM
Comments Accepted at ACCV 2018. Camera ready
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM
Comments ACM Multimedia 2017 preprint
超越器械运动:面向手术技能评估的组织张力识别
机构 * University of Zagreb(萨格勒布大学) ; University of Twente(特文特大学) ; University of Groningen(格罗宁根大学) ; Radboud University Medical Center(拉德堡德大学医学中心) ; Canisius-Wilhelmina Hospital(卡尼修斯-威廉明娜医院)
专题命中 视频理解 :video understanding(abstract,comments);分类 cs.CV
AI总结 针对现有手术视频理解方法未捕捉组织张力的问题,本文构建SurgTension数据集,提出TensionTRAC框架,实现了腹腔镜及机器人辅助直肠癌手术的组织张力识别,为手术技能评估提供客观基准。
Comments The paper is accepted by ECCV 2026 Workshop On Medical Video Understanding
专题命中 视频理解 :video understanding(abstract);分类 cs.CV;long video(comments)
Comments Accepted to CVPR 2023. Project Page: https://jingkang50.github.io/PVSG/. Codebase: https://github.com/LilyDaytoy/OpenPVSG. We provide 400 long videos with frame-level panoptic segmentation, scene graph, dense captions, and QA annotations
专题命中 视频理解 :video-language(abstract);分类 cs.CV;video understanding(comments)
Comments Winner of CVPR2023 Long-form Video Understanding and Generation Challenge (Track 3)
专题命中 视频理解 :video understanding(abstract,comments);分类 cs.CV
Comments 7 pages, 3 figures; This work was presented at the 3rd Workshop on YouTube-8M Large-Scale Video Understanding, at the International Conference on Computer Vision (ICCV 2019) in Seoul, Korea
专题命中 视频理解 :video understanding(abstract,comments);分类 cs.CV
Comments ECCV2018 workshop on YouTube-8M Large-Scale Video Understanding
专题命中 视频理解 :video understanding(abstract,comments);分类 cs.CV
Comments accepted to CVPR'17 Workshop on YouTube-8M Large-Scale Video Understanding (oral presentation); code is at https://github.com/taufikxu/youtube on branches kunxu and zhs
粗粒度索引,细粒度证据:解耦长视频检索增强生成中的时间粒度
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Soochow University(苏州大学)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 该研究针对长视频RAG中索引与证据粒度耦合的问题,提出无训练的DAGC方法,实现40%-50%节点保留、1.3-1.7倍加速且维持99%问答性能,增益可跨模型迁移。
基于多模态自我/外部中心数据采集与结构化任务知识的装配与拆卸作业中基于人工智能的工人指导
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 该研究提出一种从专家演示中提取结构化任务知识的以数据为中心的方法,结合多模态数据推导任务表示,实现装配拆卸作业的工人指导,经案例验证其优于静态图像方法,可用于维修、培训等场景。
Comments 5 pages. Published in CIRP Annals - Manufacturing Technology
Journal ref CIRP Annals - Manufacturing Technology 75 (2026) 19-23
基于最优传输的视觉信息聚合用于视频语言模型的令牌压缩
专题命中 视频理解 :video language model(abstract);分类 cs.CV
AI总结 该研究针对视频语言模型的视觉令牌冗余问题,提出AVIOT方法,将视频令牌压缩转化为最优传输问题,沿任务和空间轴调整表示构造,在多基准上实现了与未压缩基线相当或更优的性能,且高压缩率下表现稳定。
Comments Code: https://github.com/ernie-research/AVIOT
TempJail:基于字幕时序调度的针对大型视觉语言模型的时序越狱攻击
机构 * University of Electronic Science and Technology of China(电子科技大学) ; East China Normal University(华东师范大学)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 TempJail是一种黑盒视频越狱框架,通过优化字幕时序调度攻击LVLMs,在四个模型和两个数据集上的攻击成功率优于基线。
Comments 8 pages,4 figures
PL-NBA:支持多种视觉理解任务的控球级通用篮球视频数据集
机构 * Beijing University of Technology(北京工业大学) ; Nanjing University of Science and Technology(南京理工大学) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 本文构建首个控球级篮球视频数据集PL-NBA,包含11000个进攻控球片段及31567个注释事件,在四项视觉理解任务上验证其挑战性,为体育视频理解提供基准。
TTSD-FAR:用于大视频语言模型中缺失模态情感识别的带Fisher锚定恢复的测试时自蒸馏
专题命中 视频理解 :video-language(abstract);分类 cs.CV
AI总结 针对大视频语言模型测试时的模态缺失问题,提出带Fisher锚定恢复的测试时自蒸馏框架,在多数据集模态缺失场景下性能优于基线方法且保持稳定。
PEEK: 通过高效知识蒸馏提取关键帧
机构 * Télécom SudParis — SAMOVAR(Telecom SudParis — SAMOVAR) ; Institut Polytechnique de Paris(巴黎政治学院) ; Moments Lab
专题命中 视频理解 :video-language(abstract);分类 cs.CV
AI总结 提出PEEK方法,通过知识蒸馏将教师模型的帧相关性排名迁移至轻量级时序模型,实现高效动态帧采样,在低帧预算下显著提升视频字幕生成性能。
Comments Accepted at BMVC 2026. Supplementary material at https://www.killian-steunou.com/peek/static/pdfs/peek_supplementary.pdf
通过结构化奖励强化视频MLLMs的一致性
机构 * Rutgers University(罗格斯大学) ; University of Toronto(多伦多大学)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 研究通过结构化奖励提升视频MLLMs的一致性,发现传统监督不足,提出结合事实和时间单元的奖励机制,提升视频理解准确性。
Comments Accepted by COLM 2026
基于深度引导协同建模的视听分割
机构 * School of Intelligent Science and Technology, University of Science and Technology Beijing(北京科技大学智能科学与技术学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 该研究针对现有视听分割方法未建模几何线索的问题,提出三模态框架DGCM-AVS,通过深度感知动态调制器与深度引导渐进融合模块优化,在AVSS数据集上实现M_J、M_F指标的显著提升。
Journal ref IEEE Transactions on Multimedia, 2026
EgoGazeLite:面向 token 高效多模态大语言模型视频输入的设备内自我中心注视预测
机构 * Copenhagen Business School(哥本哈根商学院)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 EgoGazeLite 是轻量双进程注视预测器,可在消费级硬件上实时运行,无需眼动追踪硬件即可实现 token 高效的自我中心视频理解,性能与真实注视裁剪无显著差异。
Comments 16 pages. Accepted at the WearableAI Workshop, ECCV 2026 (Archival Track)
Zero-MELO:基于多模态大语言模型的测试时证据校准用于零样本微手势识别
机构 * University of Oulu(奥卢大学) ; Peking University(北京大学)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 该研究针对多模态大语言模型在微手势识别中局部证据不足、分数偏差的瓶颈,提出Zero-MELO框架,结合树搜索、测试时校准与多线索融合,在iMiGUE和MA-52数据集上显著优于Qwen2.5-VL基线。
Comments Accepted by ACM MM 2026
追踪真相:面向视频大语言模型的物体感知时空监控
机构 * National University of Singapore(新加坡国立大学) ; VinUniversity(文大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 本文提出STEMO-Bench基准测试,通过分解查询验证时空监控能力,改进视频大语言模型的时空推理一致性。
Comments The authors are withdrawing this manuscript due to errors identified in the experimental evaluation and result aggregation, which affect several reported quantitative results and some conclusions. These issues require substantial re-evaluation of the experiments and analysis
数据更少,收敛更快:面向多模态指令微调的目标驱动数据优化
机构 * Peking University(北京大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; National University of Singapore(新加坡国立大学)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 本文提出目标驱动数据优化框架GDO,通过优化训练样本实现更快收敛和更高精度,适用于多模态指令微调任务。
Comments Accepted to ECCV 2026
RoboMirror: 在模仿之前理解以实现视频到仿人运动
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 RoboMirror通过视觉语言模型将视频提炼为视觉运动意图,直接生成物理合理的仿人运动,无需姿态重建,实现远程存在并提升任务成功率。
手术内窥镜视频的时间视觉语言模型的鲁棒性研究
机构 * Indian Institute of Technology Delhi(印度理工学院德里分校) ; Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) ; Birmingham City University(伯明翰城市大学) ; University Hospitals Birmingham(伯明翰大学医院) ; Khalifa University(哈利法大学) ; German Cancer Research Center (DKFZ)(德国癌症研究中心)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 该研究针对手术内窥镜视频的时间视觉语言模型,构建Endo-C6基准测试其鲁棒性,提出RobustEndoCLIP,可提升模型在内窥镜损坏下的性能与鲁棒性。
Comments Accepted to MICCAI 2026
有限资源下自监督图像与视频预训练的对照研究
机构 * Eindhoven University of Technology(埃因霍温理工大学)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 该研究对照研究有限资源下的图像与视频自监督预训练,发现DINOv2式预训练性能最优,结合其与VideoMAE可提升图像任务性能但降低部分视频任务性能,为资源有限场景的视觉模型训练提供参考。
TennisVAR:一种基于击球证据的多模态大语言模型,用于网球视频中的战术推理
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 该研究针对网球视频理解的感知与理解差距,提出回合级战术推理任务,构建专家标注基准TRACE,开发基于证据的多模态大语言模型TennisVAR,实现网球视频的战术推理。
Comments Project Page: https://whynotgit2025.github.io/TennisVAR/
面向视觉语言模型空间推理的多视图关系蒸馏
机构 * KAIST(韩国科学技术院)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 针对视觉语言模型空间推理的几何脆弱性问题,提出多视图关系蒸馏方法,在保留语言对齐的同时提升视觉空间推理性能,可泛化至3D场景理解任务。
REFRAMED:面向电影的真实音频描述生成
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 本文提出新的音频描述生成范式,构建含206部电影的REFRAMED数据集及评估协议,实验显示现有AD系统和多模态LLMs表现优于简单基线但不及专业人类,为视频理解研究提供新基础。
Comments COLM 2026
VADER:用于视频大语言模型幻觉缓解的自适应去偏方法
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 本研究针对视频大语言模型的幻觉问题,提出无训练自适应去偏框架VADER,通过视觉焦点重分配与选择性证据擦除模块结合对比解码,在LLaVA-Video-7B等模型的EventHallusion任务上取得显著性能提升。
LAVE:面向视频工具使用智能体的隐式视觉证据增强规划
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 针对视频工具使用智能体的工具观测瓶颈,提出无训练框架LAVE,通过双通道观测接口复用隐式视觉证据,在三个基准数据集上提升了智能体性能,Video-MME得分较最强基线提高3.76分。
Comments 16 pages, 6 figures, 9 tables. Includes appendix
SmartMage:面向3D场景理解的动态模态编排
机构 * Zhejiang University(浙江大学) ; Stanford University(斯坦福大学)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 本文针对现有MLLMs采用固定模态组合的缺陷,提出SmartMage模型,通过SMART和MAGE模块动态编排模态,在5个3D场景理解基准上取得最优性能,在RGB视频理解基准上表现具竞争力。
Comments Accepted to ACM MM 2026