arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-24 至 2026-08-24 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2608.20814 2026-08-24 cs.CV 新提交 88%

Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision

通过高效的段级到视频级监督增强长视频理解的局部推理能力

Beibei Zhang, Chao Xu, Jun Lan, Zongyi Li, Lai Wei, Huijia Zhu, Tongwei Ren

机构 * Ant Group(蚂蚁集团)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 针对长视频理解中MLLMs易受干扰噪声影响的问题,提出S2V方法,通过段级VQA训练模型,提升了LVU性能与训练推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20805 2026-08-24 cs.CV 新提交 79%

Routing Before Looking: Query-Adaptive Evidence Acquisition for Long-form Video Understanding

先路由后查看:面向长视频理解的查询自适应证据获取

Tianyue Wang, Xuying Wu, Yuxiang Ma, Ruiming Liang, Jiaxuan Kang, Yanchao Hao, Zheng Wei, Leigang Qu, Haiyun Guo, Jinqiao Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tencent(腾讯) Wuhan University(武汉大学) Southeast University(东南大学) National University of Singapore(新加坡国立大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 针对长视频理解中查询需求与证据获取策略不匹配的问题,提出Route2Look框架,通过查询自适应路由策略选择证据获取工具,实现最优性能与帧效率。

Comments Accept to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20473 2026-08-24 cs.CV 新提交 57%

Aggregating Visual Information with Optimal Transport for VideoLM Token Compression

基于最优传输的视觉信息聚合用于视频语言模型的令牌压缩

Wenti Yin, Xiaotian Han, Junyuan Shang, Yuchen Ding, Shuohuan Wang, Dianhai Yu, Changxin Gao, Nong Sang

专题命中 视频理解 :video language model(abstract);分类 cs.CV

AI总结 该研究针对视频语言模型的视觉令牌冗余问题,提出AVIOT方法,将视频令牌压缩转化为最优传输问题,沿任务和空间轴调整表示构造,在多基准上实现了与未压缩基线相当或更优的性能,且高压缩率下表现稳定。

Comments Code: this https URL (https://github.com/ernie-research/AVIOT)

详情

展开后加载摘要…

URL PDF HTML 收藏