arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-26 至 2026-08-26 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 6 篇

2608.24763 2026-08-26 cs.CV cs.LG 新提交 79%

MoTE: Mixture of Task Experts for Multi-Task Video Understanding

MoTE:面向多任务视频理解的任务专家混合模型

Muhammad Asad Ali, Umar Khan, Nadia Robertini, Didier Stricker

机构 * University of Kaiserslautern-Landau (RPTU)(凯泽斯劳滕-兰道大学(RPTU)) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 视频理解 :video understanding(title);video-language(abstract);分类 cs.CV

AI总结 针对多任务视频理解中现有解码器的任务行为纠缠、能力扩展难等问题,提出MoTE架构,实例化为VideoLLM-MoTE,在COIN基准上表现优于基线,实现了可解释且计算高效的多任务视频-语言学习。

Comments Accepted at BMVC 2026. 32 pages, 4 figures, 15 tables, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23329 2026-08-26 cs.CV cs.AI 版本更新 79%

Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents

超越视频:统一视频推理与深度研究的开放世界视频智能体

Wenqi Liu, Shijie Ma, Yunxiao Wang, Meng Liu, Qile Su, Han Liu, Bohan Hou, Zeyu Wang, Xuanyu Zheng, Changyi Liu, Tianke Zhang, Haonan Fan, Kaiyu Jiang, Yingxin Li, Jiankang Chen, Xu Wang, Hongyi Fu, Jianxiong Wang, Bin Wen, Tingting Gao, Han Li, Jianhua Yin, Yinwei Wei, Xuemeng Song

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北京航空航天大学) City University of Hong Kong(香港城市大学) Nanyang Technological University(南洋理工大学) Kuaishou Technology(快手科技) Southern University of Science and Technology(南方科技大学)

专题命中 视频理解 :video reasoning(title);video understanding(abstract);分类 cs.CV

AI总结 本研究提出统一视频推理与深度研究的VideoRover框架,构建相关数据集与基准,其8B-RL模型在无工具直接回答场景性能接近专有模型,优于同工具套件的更大开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24302 2026-08-26 cs.AI 新提交 78%

VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models

VideoHarness-RSI:基于冻结视觉语言模型的长视频理解的递归 harness 自改进方法

Guoyang Xu, Hao Chen

机构 * Tencent(腾讯)

专题命中 视频理解 :video understanding(title,abstract)

AI总结 该研究提出 VIDEOHARNESS-RSI,通过递归搜索可执行上下文构建程序,在冻结 VLM 上实现长视频理解的改进,且所选 harness 可迁移至其他长视频基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23553 2026-08-26 cs.CV 版本更新 74%

RT-NeuS: Towards Real-Time Neuro-Symbolic Video Understanding via Adaptive Temporal Verification

LE-NeuS: 通过自适应时间验证实现低延迟的神经符号视频理解

Shawn Liang, Sahil Shah, Chengwei Zhou, S P Sharan, Harsh Goel, Arnab Sanyal, Sandeep Chinchali, Gourav Datta

机构 * Case Western Reserve University(凯斯西储大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 LE-NeuS通过自适应时间验证优化,实现低延迟的神经符号视频理解,在保持高准确率的同时大幅减少推理延迟。

Comments Camera-ready version, accepted at NeuS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20473 2026-08-26 cs.CV 版本更新 57%

Aggregating Visual Information with Optimal Transport for VideoLM Token Compression

基于最优传输的视觉信息聚合用于视频语言模型的令牌压缩

Wenti Yin, Xiaotian Han, Junyuan Shang, Yuchen Ding, Shuohuan Wang, Dianhai Yu, Changxin Gao, Nong Sang

专题命中 视频理解 :video language model(abstract);分类 cs.CV

AI总结 该研究针对视频语言模型的视觉令牌冗余问题,提出AVIOT方法,将视频令牌压缩转化为最优传输问题,沿任务和空间轴调整表示构造,在多基准上实现了与未压缩基线相当或更优的性能,且高压缩率下表现稳定。

Comments Homepage: this https URL (https://ernie-research.github.io/AVIOT;) Code: this https URL (https://github.com/ernie-research/AVIOT;) Model: this https URL (https://huggingface.co/ernie-research/AVIOT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18405 2026-08-26 cs.CV cs.LG 版本更新 57%

Iwin Transformer: Hierarchical Vision Transformer using Interleaved Windows

Iwin Transformer:基于交错窗口的分层视觉Transformer

Simin Huo, Ning Li

专题命中 视频理解 :video generation(abstract);分类 cs.CV

AI总结 Iwin Transformer通过交错窗口注意力和深度可分离卷积实现无位置嵌入的分层视觉Transformer,提升图像分类、语义分割和视频动作识别等任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏