2608.20814 2026-08-24 cs.CV 新提交 88% Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision 通过高效的段级到视频级监督增强长视频理解的局部推理能力 Beibei Zhang, Chao Xu, Jun Lan, Zongyi Li, Lai Wei, Huijia Zhu, Tongwei Ren 机构 * Ant Group(蚂蚁集团) 纠错 专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV AI总结 针对长视频理解中MLLMs易受干扰噪声影响的问题,提出S2V方法,通过段级VQA训练模型,提升了LVU性能与训练推理效率。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.20805 2026-08-24 cs.CV 新提交 79% Routing Before Looking: Query-Adaptive Evidence Acquisition for Long-form Video Understanding 先路由后查看:面向长视频理解的查询自适应证据获取 Tianyue Wang, Xuying Wu, Yuxiang Ma, Ruiming Liang, Jiaxuan Kang, Yanchao Hao, Zheng Wei, Leigang Qu, Haiyun Guo, Jinqiao Wang 机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Tencent(腾讯) ; Wuhan University(武汉大学) ; Southeast University(东南大学) ; National University of Singapore(新加坡国立大学) 纠错 专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV AI总结 针对长视频理解中查询需求与证据获取策略不匹配的问题,提出Route2Look框架,通过查询自适应路由策略选择证据获取工具,实现最优性能与帧效率。 Comments Accept to EMNLP 2026 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.20473 2026-08-24 cs.CV 新提交 57% Aggregating Visual Information with Optimal Transport for VideoLM Token Compression 基于最优传输的视觉信息聚合用于视频语言模型的令牌压缩 Wenti Yin, Xiaotian Han, Junyuan Shang, Yuchen Ding, Shuohuan Wang, Dianhai Yu, Changxin Gao, Nong Sang 专题命中 视频理解 :video language model(abstract);分类 cs.CV AI总结 该研究针对视频语言模型的视觉令牌冗余问题,提出AVIOT方法,将视频令牌压缩转化为最优传输问题,沿任务和空间轴调整表示构造,在多基准上实现了与未压缩基线相当或更优的性能,且高压缩率下表现稳定。 Comments Code: this https URL (https://github.com/ernie-research/AVIOT) 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图