Let's Split Up: Zero-Shot Classifier Edits for Fine-Grained Video Understanding
让我们拆分:用于细粒度视频理解的零样本分类器编辑
机构 * Leiden University(莱顿大学)
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 本文提出零样本分类器编辑方法,通过细粒度视频理解提升分类精度,优于视觉-语言基线。
Comments ICLR 2026
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
让我们拆分:用于细粒度视频理解的零样本分类器编辑
机构 * Leiden University(莱顿大学)
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 本文提出零样本分类器编辑方法,通过细粒度视频理解提升分类精度,优于视觉-语言基线。
Comments ICLR 2026
DataCube: 通过自然语言语义分析实现的视频检索平台
机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 DataCube通过自然语言语义分析实现视频检索,提供高效的视频处理和多维检索功能。
Comments This paper is under review for the IJCAI-ECAI 2026 Demonstrations Track
综述:视频生成中的时空一致性
机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) ; School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) ; Peng Cheng Laboratory(鹏城实验室) ; School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 本文综述了视频生成中时空一致性的最新进展,涵盖生成模型、特征表示、训练策略等,探讨了未来研究方向和挑战。
CHAI: 文本到视频的缓存注意力推理
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 CHAI通过引入缓存注意力机制,以减少延迟并保持视频质量,实现比OpenSora 1.2快1.65至3.35倍的推理速度。
世界动作模型是零样本策略
机构 * NVIDIA
专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV
AI总结 DreamZero通过世界动作模型实现零样本策略,有效提升机器人在新任务和环境中的泛化能力,同时支持跨身体转移和少样本适应。
Comments Project page: https://dreamzero0.github.io/
FUTURE-VLA:在实时执行下统一轨迹预测
机构 * Department of Automation, Tsinghua University(自动化系,清华大学) ; Shenzhen International Graduation School, Tsinghua University(深圳国际研究生院,清华大学) ; Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) ; School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院,南洋理工大学)
专题命中 长视频与时序推理 :long video(abstract)
AI总结 FUTURE-VLA通过实时执行实现统一轨迹预测,采用双效效率范式提升时空信息密度,实现实时预测与人机交互机制,取得多项任务的高成功率。