arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1388 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1388 篇

2511.14143 2026-06-09 cs.CV cs.AI 版本更新 57%

SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM

SMART: 基于音频增强多模态大模型的镜头感知视频时刻检索

An Yu, Weiheng Lu, Jian Li, Zhenfei Zhang, Yunhang Shen, Felix X. -F. Ye, Ming-Ching Chang

机构 * Department of Computer Science, University at Albany - SUNY(University at Albany - SUNY 计算机科学系) School of Software & Microelectronics, Peking University(北京大学软件与微电子学院) Nanjing University(南京大学) Xiamen University(厦门大学) Department of Mathematics and Statistics, University at Albany - SUNY(University at Albany - SUNY 数学与统计学系)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出SMART框架,融合音频与视觉特征,利用镜头感知令牌压缩技术,在多模态大模型基础上实现视频时刻检索,在Charades-STA和QVHighlights上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22574 2026-06-08 cs.CV cs.AI 版本更新 57%

Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models

增强视频表示中的时空语义残差以缓解视频大型多模态模型中的幻觉

Yuansheng Gao, Jinman Zhao, Tong Zhang, Xingguo Xu, Wenbin Xing, Han Bao, Zonghui Wang, Wenzhi Chen

机构 * Zhejiang University(浙江大学) University of Toronto(多伦多大学) Dalian University of Technology(大连理工大学) Sun Yat-sen University(中山大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出ViSSRes方法,通过轻量级MLP网络学习视频表示的残差,从时空和语义一致性优化,在推理时仅需单次前向传播,有效降低幻觉率并提升视频理解性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03837 2026-06-03 cs.CV 57%

Where Do We (Not) Need Temporal Context in Low-Resource Video Task Adaptation?

在低资源视频任务适应中,我们(不)需要时间上下文的哪些部分?

Luc P. J. Sträter, Hazel Doughty

机构 * Leiden University(莱顿大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文系统研究了视频理解中模型适应策略的时间上下文分配问题,通过评估不同设置下的参数高效微调和探测方法,揭示了时间上下文在骨干网络、PEFT和探测之间的最优分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02522 2026-06-02 cs.CV cs.AI 57%

Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events

Moment-Video: 诊断视频多模态大语言模型在瞬时视觉事件上的时间保真度

Xiaolin Liu, Yilun Zhu, Xiangyu Zhao, Xuehui Wang, Yan Li, Xin Li, Haoyu Cao, Xing Sun, Shaofeng Zhang, Xu Yang, Zhihang Zhong, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Southeast University(东南大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出 Moment-Video 基准,通过瞬时视觉事件理解任务诊断视频 MLLMs 的时间保真度,发现最佳模型准确率仅 39.6%,多数开源模型低于 25%。

Comments 28 pages, 10 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02352 2026-06-02 cs.CV 57%

Multi-modal Video Representation Alignment for Robust Self-supervised Driver Distraction Detection

多模态视频表示对齐用于鲁棒的自监督驾驶员分心检测

David J. Lerch, Livien Majer, Zeyun Zhong, Manuel Martin, Frederik Diederichs, Rainer Stiefelhagen

机构 * Fraunhofer IOSB(弗劳恩霍夫智能系统研究所) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出一种多模态全局对齐框架,通过软目标和加权机制处理错误负样本和不可靠正样本,在Drive&Act数据集上优于现有方法,实现鲁棒的驾驶员分心检测。

Comments Accepted at the IEEE ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02161 2026-06-02 cs.CV cs.CL 57%

InfoMerge: Information-aware Token Compression for Efficient Video Large Language Models

InfoMerge: 信息感知的令牌压缩用于高效视频大语言模型

Xinxin Liu, Shiwei Gan, Xiao Liu, Yafeng Yin, Lei Xie, Sanglu Lu

机构 * State Key Laboratory of Novel Software Technology(新型软件技术国家重点实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出InfoMerge,一种无需训练的视觉令牌压缩方法,通过鲁棒冗余估计和内容感知预算分配,在减少85%视觉令牌的同时保持98.8%性能,实现4.24倍预填充加速。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02120 2026-06-02 cs.CV cs.AI cs.LG 57%

Understanding-Enhanced Model Collaboration for Long-Tailed Egocentric Mistake Detection

理解增强的模型协作用于长尾自我中心错误检测

Boyu Han, Qianqian Xu, Shilong Bao, Zhiyong Yang, Ruochen Cui, Qingming Huang

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) School of Computer Science and Tech., University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Information Engineering, CAS(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出理解增强的模型协作方法(UE-MCM),结合粗粒度视频理解与细粒度动作推理,通过双分支模型和自适应融合门检测自我中心视频中的错误,并优化长尾分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01756 2026-06-02 cs.CV 57%

EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models

EvoCut:面向高效大型视觉语言模型的多层演化感知视觉标记压缩

Hongyu Lu, Feng Zhang, Wenwei Jin, Huanling Hu, Pengfei Zhang, Yao Hu, Jiawei Li, Shikai Jiang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Xiaohongshu(小红书) Fudan University(复旦大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出一种无需训练和注意力的视觉标记压缩方法EvoCut,通过分析多层演化偏差估计标记重要性,在LLaVA-1.5-7B上仅保留11.1%的视觉标记即可保持94.4%的平均性能。

Comments Preprint. 12 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11283 2026-06-02 cs.CV 57%

Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey

多模态大语言模型驱动的视频翻译:面向角色的综述

Bingzheng Qu, Kehai Chen, Xuefeng Bai, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文通过面向角色的分类法,系统综述了多模态大语言模型在视频翻译中的应用,将其分为语义推理器、表达执行器和视觉合成器三个功能角色,并总结了数据集、基准和评估指标,指出了端到端视频翻译的挑战与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28820 2026-05-28 cs.CV 57%

From Pixels to Words -- Towards Native One-Vision Models at Scale

从像素到文字——迈向原生单视觉大规模模型

Haiwen Diao, Jiahao Wang, Penghao Wu, Yuhao Dong, Yuwei Niu, Yue Zhu, Zhongang Cai, Weichen Fan, Linjun Dai, Silei Wu, Xuanyu Zheng, Mingxuan Li, Yuanhan Zhang, Bo Li, Hanming Deng, Huchuan Lu, Quan Wang, Lei Yang, Lewei Lu, Dahua Lin, Ziwei Liu

机构 * S-Lab, NTU(S实验室,国立科技大学) SenseTime Research(商汤科技研究院) DLUT(大连理工大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出NEO-ov原生基础模型,通过端到端学习跨帧和像素-文字对应,无需外部编码器或适配器,在细粒度视觉感知上缩小了与模块化模型的差距,验证了原生单视觉架构的可行性和竞争力。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28229 2026-05-28 cs.CV cs.AI 57%

VidPrism: Heterogeneous Mixture of Experts for Image-to-Video Transfer

VidPrism: 用于图像到视频迁移的异构混合专家模型

Rui Lin, Chuanming Wang, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出VidPrism,一种异构时间混合专家框架,通过功能专业化专家、内容感知多速率采样和动态双向融合机制,解决传统MoE中专家同质化问题,在视频识别基准上达到最先进性能。

Comments CVPR2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00913 2026-05-28 cs.CV cs.CL 57%

Benchmarking and Mechanistic Analysis of Vision-Language Models for Cross-Depiction Assembly Instruction Alignment

跨描绘装配指令对齐的视觉-语言模型基准测试与机制分析

Zhuchenyang Liu, Yao Zhang, Yu Xiao

机构 * Aalto University(阿alto大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 构建IKEA-Bench基准,评估19个视觉-语言模型在装配图与视频帧对齐任务上的表现,发现视觉编码是提升跨描绘鲁棒性的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26967 2026-05-27 cs.CV 57%

CodecCap: High-Fidelity Codec-Inspired Residual Modeling for Dense Video Captioning

CodecCap: 高保真度编解码器启发的残差建模用于密集视频字幕生成

Zihan Lin, Songhe Deng, Shuwei He, Danxiang Zhu, Dan Zhang, Yishu Lei, Xianlong Luo, Shikun Feng, Rui Liu

机构 * ERNIE Team, Baidu(百度ERNIE团队) College of Artificial Intelligence, Inner Mongolia University(内蒙古大学人工智能学院)

专题命中 视频理解 :video-language(abstract);分类 cs.CV

AI总结 提出CodecCap框架,通过关键帧和残差字幕模拟视频编解码器,在保持细粒度视觉证据的同时减少冗余,并引入VidCapQA基准验证其高保真度。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26232 2026-05-27 cs.CV 57%

Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos

并非所有模态都平等:面向多模态视频的指令感知门控

Bonan Ding, Umair Nawaz, Ufaq Khan, Abdelrahman M. Shaker, Muhammad Haris Khan, Jiale Cao, Jin Xie, Fahad Shahbaz Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能学院) Tianjin University(天津大学) Chongqing University(重庆大学) Linköping University(林奈大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出UniMVU框架,通过内模态和模态级指令感知动态门控实现多模态视频理解,在六个基准上优于静态融合方法。

Comments 19 pages, 8 figures, 7 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25979 2026-05-26 cs.CV 57%

LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

LLaVA-OneVision-2:迈向下一代感知智能

Xiang An, Yin Xie, Feilong Tang, Yunyao Yan, Huajie Tan, Didi Zhu, Changrui Chen, Xiuwei Zhao, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Kaichen Zhang, Wenkang Zhang, Zheng Cheng, Nansen Zhang, Chunsheng Wu, Chunjiang Ge, Zimin Ran, Dehua Song, Chunyuan Li, Shikun Feng, Ming Hu, Zhangquan Chen, Junbo Niu, Bo Li, Ziyong Feng, Ziwei Liu, Zongyuan Ge, Jiankang Deng

机构 * Glint Lab(Glint实验室) AIM for Health Lab(健康AI实验室) MVP Lab(MVP实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出LLaVA-OV-2模型,通过编解码流令牌化、窗口注意力和3D RoPE实现统一视频理解与时空定位,在多项基准上超越Qwen3-VL-8B。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25615 2026-05-26 cs.CV 57%

UAV-OVO: Out-of-Viewpoint Generalization in UAV Action Recognition

UAV-OVO:无人机动作识别中的视点外泛化

Yu Xia, Zhengbo Zhang, Shuaihu Zhang, Zhigang Tu

机构 * Wuhan University(武汉大学) Singapore University of Technology and Design(新加坡科技与设计大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 针对无人机动作识别中训练与测试视点不一致导致的性能下降问题,提出UAV-OVO基准和LATER方法,通过视点隔离和LoRA锚定特征重中心化实现视点鲁棒泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17260 2026-05-26 cs.CV 57%

LiteFrame: Efficient Vision Encoders Unlock Frame Scaling in Video LLMs

LiteFrame: 高效视觉编码器解锁视频大语言模型中的帧缩放

Jihwan Kim, Nikhil Parthasarathy, Danfeng Qin, Junhwa Hur, Deqing Sun, Bohyung Han, Ming-Hsuan Yang, Boqing Gong

机构 * Seoul National University(首尔国立大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 针对视频大语言模型处理长视频时视觉令牌上下文长度爆炸的问题,提出LiteFrame高效视频编码器,通过压缩令牌蒸馏(CTD)训练框架,使紧凑的学生模型直接预测教师模型的信息密集时空压缩表示,从而在降低35%端到端延迟的同时处理8倍帧数并提升视频理解精度。

Comments Project Page: https://jjihwan.github.io/projects/LiteFrame

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20342 2026-05-22 cs.CV 57%

ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning

ParaVT: 平衡工具先验悖论以实现代理视频强化学习中的并行工具使用

Zuhao Yang, Kaichen Zhang, Sudong Wang, Keming Wu, Zhongyu Yang, Bo Li, Xiaojuan Qi, Shijian Lu, Xingxuan Li, Lidong Bing

机构 * MiroMind NTU(国立台湾大学) HKU(香港大学) HKUST(GZ)(香港科技大学(广州)) THU(清华大学) LMMs-Lab(LMMs实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出ParaVT,一种用于并行视频工具调用的端到端强化学习框架,通过引入PARA-GRPO机制解决工具先验悖论,提升了长视频理解的性能。

Comments Project Page: https://evolvinglmms-lab.github.io/ParaVT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22078 2026-05-22 cs.AI cs.CV 57%

Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding

通过无训练空间-时间池化和栅格化增强视频大语言模型的视觉令牌表示

Bingjun Luo, Tony Wang, Hanqi Chen, Xinpeng Ding

机构 * Tsinghua University(清华大学) Shenzhen University(深圳大学) Xidian University(西安电子科技大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出了一种无需训练的空间-时间池化和栅格化方法ST-GridPool,用于提升视频大语言模型的视觉令牌表示,通过多级时空交互和基于规范的空间池化技术,在不需重新训练的情况下提高性能。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21973 2026-05-22 cs.CV 57%

Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding

Foresee-to-Ground: 从预测性时间感知到证据驱动推理的视频时间接地

Zelin Zheng, Xinyan Liu, Ruixin Li, Antoni B. Chan, Guorong Li, Qingming Huang, Laiyun Qing

机构 * Qwen3-VL-8B-Instruct

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出了一种新的视频时间接地框架F2G,通过将时间接地问题重新表述为可验证的识别-测量问题,结合预测性时间感知和证据驱动推理,以提高时间接地的准确性和鲁棒性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21625 2026-05-22 cs.CV cs.AI cs.CL 57%

Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly

Flat-Pack Bench: 通过家具组装评估大视觉-语言模型的时空理解

Aditya Chetan, Eric Cai, Peeyush Kushwaha, Bharath Raj Nagoor Kani, Utkarsh Mall, Qianqian Wang, Noah Snavely, Bharath Hariharan

机构 * Cornell University(康奈尔大学) Cornell Tech(康奈尔科技) MBZUAI(麦吉尔-伯克利-浙江大学人工智能研究院) UC Berkeley(伯克利大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出Flat-Pack Bench基准,用于评估大视觉-语言模型在复杂视频场景中的时空理解能力,发现当前模型在细粒度时空推理上存在显著不足。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20838 2026-05-21 cs.CV cs.AI 57%

USV: Towards Understanding the User-generated Short-form Videos

USV: 向理解用户生成的短视频迈进

Haoyue Cheng, Su Xu, Liwei Jin, Wayne Wu, Chen Qian, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出了USV数据集,用于高层面的视频语义理解,通过用户生成的短视频进行主题识别和视频-文本检索任务,提出了MMF-Net和VTCL两种有效基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19559 2026-05-20 cs.CV cs.AI 57%

EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs

EgoCoT-Bench: 用于MLLMs的 grounded 和可验证的 operation-centric 思维链推理基准测试

Yang Dai, Dian Jiao, Tianwei Lin, Wenqiao Zhang

机构 * Zhejiang University(浙江大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出EgoCoT-Bench,一个用于评估MLLMs在第一人称视角下细粒度操作中心推理能力的基准测试,包含3172个可验证的问答对,涵盖感知、预见和高层次推理等任务,旨在解决现有基准测试在细粒度推理和证据验证方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19137 2026-05-20 cs.CV 57%

Towards Data-Efficient Video Pre-training with Frozen Image Foundation Models

迈向数据高效的视频预训练:使用冻结的图像基础模型

Svetlana Orlova, Niccolò Cavagnero, Gijs Dubbelman

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文探讨了如何通过冻结预训练的图像基础模型并仅训练时间模块来实现数据高效的视频预训练,从而减少对大规模视频数据和计算资源的需求。

Comments Accepted to CVPR 2026 Workshops CV4Smalls

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18431 2026-05-20 cs.CV 57%

Seeing Together: Multi-Robot Cooperative Egocentric Spatial Reasoning with Multimodal Large Language Models

协同视见:基于多模态大语言模型的多机器人协作自体空间推理

Kunyu Peng, Zhikun Zhou, Kailun Yang, Di Wen, Ruiping Liu, Yufan Chen, Junwei Zheng, Hao Shi, Yi Zhou, M. Saquib Sarfraz, Danda Pani Paudel, Luc Van Gool

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) University of Oxford(牛津大学) Zhejiang University(浙江大学) ETH Zurich(苏黎世联邦理工学院) Ant Group(蚂蚁集团)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文研究了多机器人协作动态空间推理问题,提出了首个针对该任务的基准CoopSR以及多机器人自体问答数据集EgoTeam,通过引入SP-CoR框架实现了细粒度的协作空间推理,显著提升了多机器人协作推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18209 2026-05-19 cs.CV cs.AI 57%

SPATIOROUTE: Dynamic Prompt Routing for Zero-Shot Spatial Reasoning

SPATIOROUTE: 动态提示路由用于零样本空间推理

Pawat Chunhachatrachai, Gueter Josmy Faure, Hung-Ting Su, Winston H. Hsu

机构 * National Taiwan University(台湾国立大学) Delta Robotics Innovation Center(Delta机器人创新中心)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出SpatioRoute,一种动态提示生成方法,通过语义定制的提示模板路由问题,无需额外训练或3D传感器输入,在零样本设置下提升空间推理性能,同时发现Chain-of-Thought提示在空间视频理解中效果不佳。

Comments 10 pages, 2 figures, 2nd Workshop on 3D-LLM/VLA, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04727 2026-05-19 cs.CV cs.AI 57%

Are Multimodal LLMs Ready for Surveillance? A Reality Check on Zero-Shot Anomaly Detection in the Wild

多模态大语言模型是否准备好用于监控?对零样本异常检测在现实中的检验

Shanle Yao, Armin Danesh Pazho, Narges Rashvand, Hamed Tabkhi

机构 * Electrical and Computer Engineering Department(电气与计算机工程系)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文研究了多模态大语言模型在现实中的零样本异常检测性能,发现其存在保守偏差,通过特定指令可以提升F1分数,但召回率仍是关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06038 2026-05-19 cs.CV cs.AI 57%

Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models

Fourier Compressor: 频域视觉令牌压缩用于视觉-语言模型

Huanyu Wang, Jushi Kai, Haoli Bai, Lu Hou, Bo Jiang, Ziwei He, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Noah’s Ark Lab(诺亚实验室) Huawei Technologies Ltd.(华为技术有限公司) School of Computer Science(计算机科学学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出了一种基于频域的视觉令牌压缩策略,通过傅里叶变换减少计算开销并提升效率,同时保持语义准确性,实验表明其在图像和视频任务中均表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17584 2026-05-19 cs.CV 57%

VVitCutLER: Towards Unsupervised Object Detection and Segmentation in Videos

VVitCutLER: 向视频中无监督的目标检测和分割迈进

Zhijing Lu, Khurram Azeem Hashmi, Didier Stricker, Muhammad Zeshan Afzal

机构 * RPTU University of Kaiserslautern-Landau(莱茵-瓦尔德大学凯撒斯劳滕-兰道分校) German Research Center for Artificial Intelligence(德国人工智能研究中心)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 该研究提出VVitCutLER框架,通过引入时间一致性提升视频中伪标签的质量,从而改进目标检测和实例分割的性能,减少时间不稳定性。

Comments 11 figures, cvpr workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16381 2026-05-19 cs.CV cs.AI 57%

StreamPro: From Reactive Perception to Proactive Decision-Making in Streaming Video

StreamPro: 从反应式感知到主动决策的流视频处理

Ao Li, Zihan Xiao, Zihao Yue, Boshen Xu, Linli Yao, Jiaze Li, Pei Fu, Jianzhong Ju, Jian Luan, Qin Jin

机构 * AIM3 Lab, Renmin University of China(中国人民大学AIM3实验室) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 StreamPro通过引入CB-Stream损失和GRPO算法,提升流视频处理的主动决策能力,在StreamPro-Bench上取得显著成效,性能优于先前最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏