arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-26 至 2026-08-26 共收录 16 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 6 篇

2608.24763 2026-08-26 cs.CV cs.LG 新提交 79%

MoTE: Mixture of Task Experts for Multi-Task Video Understanding

MoTE:面向多任务视频理解的任务专家混合模型

Muhammad Asad Ali, Umar Khan, Nadia Robertini, Didier Stricker

机构 * University of Kaiserslautern-Landau (RPTU)(凯泽斯劳滕-兰道大学(RPTU)) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 视频理解 :video understanding(title);video-language(abstract);分类 cs.CV

AI总结 针对多任务视频理解中现有解码器的任务行为纠缠、能力扩展难等问题,提出MoTE架构,实例化为VideoLLM-MoTE,在COIN基准上表现优于基线,实现了可解释且计算高效的多任务视频-语言学习。

Comments Accepted at BMVC 2026. 32 pages, 4 figures, 15 tables, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23329 2026-08-26 cs.CV cs.AI 版本更新 79%

Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents

超越视频:统一视频推理与深度研究的开放世界视频智能体

Wenqi Liu, Shijie Ma, Yunxiao Wang, Meng Liu, Qile Su, Han Liu, Bohan Hou, Zeyu Wang, Xuanyu Zheng, Changyi Liu, Tianke Zhang, Haonan Fan, Kaiyu Jiang, Yingxin Li, Jiankang Chen, Xu Wang, Hongyi Fu, Jianxiong Wang, Bin Wen, Tingting Gao, Han Li, Jianhua Yin, Yinwei Wei, Xuemeng Song

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北京航空航天大学) City University of Hong Kong(香港城市大学) Nanyang Technological University(南洋理工大学) Kuaishou Technology(快手科技) Southern University of Science and Technology(南方科技大学)

专题命中 视频理解 :video reasoning(title);video understanding(abstract);分类 cs.CV

AI总结 本研究提出统一视频推理与深度研究的VideoRover框架,构建相关数据集与基准,其8B-RL模型在无工具直接回答场景性能接近专有模型,优于同工具套件的更大开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24302 2026-08-26 cs.AI 新提交 78%

VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models

VideoHarness-RSI:基于冻结视觉语言模型的长视频理解的递归 harness 自改进方法

Guoyang Xu, Hao Chen

机构 * Tencent(腾讯)

专题命中 视频理解 :video understanding(title,abstract)

AI总结 该研究提出 VIDEOHARNESS-RSI,通过递归搜索可执行上下文构建程序,在冻结 VLM 上实现长视频理解的改进,且所选 harness 可迁移至其他长视频基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23553 2026-08-26 cs.CV 版本更新 74%

RT-NeuS: Towards Real-Time Neuro-Symbolic Video Understanding via Adaptive Temporal Verification

LE-NeuS: 通过自适应时间验证实现低延迟的神经符号视频理解

Shawn Liang, Sahil Shah, Chengwei Zhou, S P Sharan, Harsh Goel, Arnab Sanyal, Sandeep Chinchali, Gourav Datta

机构 * Case Western Reserve University(凯斯西储大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 LE-NeuS通过自适应时间验证优化,实现低延迟的神经符号视频理解,在保持高准确率的同时大幅减少推理延迟。

Comments Camera-ready version, accepted at NeuS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20473 2026-08-26 cs.CV 版本更新 57%

Aggregating Visual Information with Optimal Transport for VideoLM Token Compression

基于最优传输的视觉信息聚合用于视频语言模型的令牌压缩

Wenti Yin, Xiaotian Han, Junyuan Shang, Yuchen Ding, Shuohuan Wang, Dianhai Yu, Changxin Gao, Nong Sang

专题命中 视频理解 :video language model(abstract);分类 cs.CV

AI总结 该研究针对视频语言模型的视觉令牌冗余问题,提出AVIOT方法,将视频令牌压缩转化为最优传输问题,沿任务和空间轴调整表示构造,在多基准上实现了与未压缩基线相当或更优的性能,且高压缩率下表现稳定。

Comments Homepage: this https URL (https://ernie-research.github.io/AVIOT;) Code: this https URL (https://github.com/ernie-research/AVIOT;) Model: this https URL (https://huggingface.co/ernie-research/AVIOT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18405 2026-08-26 cs.CV cs.LG 版本更新 57%

Iwin Transformer: Hierarchical Vision Transformer using Interleaved Windows

Iwin Transformer:基于交错窗口的分层视觉Transformer

Simin Huo, Ning Li

专题命中 视频理解 :video generation(abstract);分类 cs.CV

AI总结 Iwin Transformer通过交错窗口注意力和深度可分离卷积实现无位置嵌入的分层视觉Transformer,提升图像分类、语义分割和视频动作识别等任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 5 篇

2608.24674 2026-08-26 cs.CV 新提交 79%

TurboT2VA: Fast Large-Scale Text-to-Video-Audio Generation via Score-Regularized Consistency Distillation

TurboT2VA:基于分数正则化一致性蒸馏的快速大规模文本-视频-音频生成

Xiaoda Yang, Yuxiang Liu, Kaiwen Zheng, Yuan Liu, Yibo Lai, Shengpeng Ji, Kai Jiang, Jianfei Chen, Xiaobin Hu, Shuicheng Yan, Jintao Zhang, Jun Zhu, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tianjin University(天津大学) Tsinghua University(清华大学) Qingdao University(青岛大学) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出TurboT2VA框架,通过多模态归一化与渐进式课程方案,在保持音视频生成质量的同时,大幅加速190亿参数联合T2VA模型的推理,在不同分辨率下实现最高54.67倍的生成器加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21580 2026-08-26 cs.CV cs.AI 版本更新 79%

GraphVid: Interactive Graph-Controllable Video Generation

GraphVid:交互式图可控视频生成

Vedant Shah, Onkar Susladkar, Tushar Prakash, Kiet Nguyen, Tianjiao Yu, Adheesh Juvekar, Muntasir Wahed, Ismini Lourentzou

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 研究如何实现可控视频生成,提出基于图条件的GraphVid模型及相关数据集,通过结构化交互图实现灵活精确控制,相比其他方法在减少训练数据和参数的情况下,提升了视频生成的可控性与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09057 2026-08-26 cs.CV cs.MM cs.SD 版本更新 76%

Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence

Tora3:基于轨迹的音频视频生成与物理一致性

Junchao Liao, Zhenghao Zhang, Xiangyu Meng, Litao Li, Ziying Zhang, Siyu Zhu, Long Qin, Weizhi Wang

机构 * Alibaba Cloud Computing(阿里巴巴云 computing) Fudan University(复旦大学)

专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM

AI总结 Tora3通过引入轨迹作为共享的运动先验,提升音频视频生成的物理一致性,采用轨迹对齐的运动表示和混合流匹配方案,改进运动真实性和运动-声音同步性。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20809 2026-08-26 cs.CV 版本更新 57%

Layer-Aware Video Composition via Split-then-Merge

通过分割后再融合的分层视频合成

Ozgur Kara, Yujia Chen, Ming-Hsuan Yang, James M. Rehg, Wen-Sheng Chu, Du Tran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google(谷歌)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 StM通过分割未标注视频并融合动态前景与背景层,提升生成视频合成的控制能力和数据效率。

Comments Project Webpage: this https URL (https://split-then-merge.github.io)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24329 2026-08-26 cs.HC 新提交 50%

How Do Professional Editors Evaluate the Editing Quality of AI-Generated Cinematic Video Ads?

专业编辑如何评估AI生成的影视视频广告的剪辑质量?

Po-Ming Law, Weizhi Li, Arpit Narechania

专题命中 视频生成 :video generation(abstract)

AI总结 该研究针对AI生成影视广告缺乏细粒度评估框架的问题,构建两阶段生成流程,通过专业编辑评价得出六个剪辑质量维度,为相关评估与生成提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2608.23927 2026-08-26 cs.CV 新提交 57%

GlanceWAM: Sparse Test-Time Imagination for World-Action Models

GlanceWAM:面向世界-动作模型的稀疏测试时想象方法

Linhan Wang, Zijian An, Mingyuan Zhang, Chen Dai, Yi Xu, Can Cui, Zichong Yang, Yinlin Chen, Lifeng Zhou, Chang-Tien Lu

机构 * Virginia Tech(弗吉尼亚理工大学) Drexel University(卓克索大学) Northeastern University(东北大学) Purdue University(普渡大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 该研究提出GlanceWAM,通过异步解耦视频DiT的想象与控制,打破世界-动作模型的速度-成功率困境,在RoboCasa、LIBERO基准测试中表现优异,推理速度达48ms/块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23664 2026-08-26 cs.CV cs.LG 新提交 57%

Scaling Reinforcement Learning for Diffusion Models via Velocity Matching

通过速度匹配扩展扩散模型的强化学习

Jaemoo Choi, Wei Guo, Yuchen Zhu, Arash Vahdat, Molei Tao, Julius Berner, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) NVIDIA(英伟达公司)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 该研究提出基于奖励的速度匹配(RVM)方法,用于扩散模型的奖励微调,其训练成本显著降低,性能优于或相当基于轨迹的策略梯度方法,还通过动态跟踪奖励改善了视频生成的运动效果。

Comments 30 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2608.22067 2026-08-26 cs.RO cs.AI cs.CV cs.LG 版本更新 57%

Inferring Action from Future Latent State for Robotic Manipulation

从未来隐状态推断机器人操纵动作

Fenghao Lei, Zhixiong Huang, Long Yang, Jiabao Chen, Peilin Huang, Han Fu, Zhuo Li, Xiaoxue Ren

机构 * DeepLeap Research(DeepLeap研究院)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出无需视频生成的机器人操纵模型DELE-w0.5,通过从捕获动作相关物理结果的未来隐状态推断动作,在4项长程操纵任务的480次试验中,其性能优于最强基线47.5和30.7个百分点,实现最优表现。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 1 篇

2608.23383 2026-08-26 cs.CV 版本更新 57%

Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

面向持续故事与交互世界的长时序视听生成

Nan Duan, Haoyang Huang, Weiyang Jin, Haoran Li, Yaowei Li, Yuming Li, Yijun Liu, Xin Lu, Xiaoxiao Ma, Yanwen Ma, Yaofeng Su, Yilang Sun, Haoyu Wang, Zeyue Xue, Songchun Zhang, Junhao Zhuang

机构 * Joy Future Academy, JD(京东探索研究院)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 研究针对长时序视听生成的需求,提出JoyAI-Echo-1.5系统,含长视频与世界模型变体,通过专用技术实现跨镜头一致性等性能,在相关基准上取得领先结果,为生成连贯内容提供基础。

Comments Project page: this https URL (https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 1 篇

2608.24160 2026-08-26 cs.AI 新提交 50%

OmniJudge or OmniBias? Diagnosing Multimodal Judges through Balanced, Decoupled Lenses

全能评判者还是全能偏差?通过平衡、解耦的视角诊断多模态评判者

Guangzheng Hu, Ziyue Jiang, Weixu Qiao, Lixin Zhang, Jianye Kang, Yuru Wu, Rong Bao, Niantong Li, Wei Wang, Ziyi Cheng, Xinfa Zhu, HangRui Hu, Ting He, Bing Zhao, Lin Qu, Hu Wei, Jin Xu

专题命中 视频数据与评测 :text-to-video(abstract)

AI总结 本研究推出平衡解耦的多模态评判者诊断基准D3-Omni,发现全能评判者存在模态相关维度表现差、漏检失败等系统性盲点,为评估多模态模型提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏