arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-26 至 2026-08-26 共收录 7 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2608.24763 2026-08-26 cs.CV cs.LG 新提交 79%

MoTE: Mixture of Task Experts for Multi-Task Video Understanding

MoTE:面向多任务视频理解的任务专家混合模型

Muhammad Asad Ali, Umar Khan, Nadia Robertini, Didier Stricker

机构 * University of Kaiserslautern-Landau (RPTU)(凯泽斯劳滕-兰道大学(RPTU)) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 视频理解 :video understanding(title);video-language(abstract);分类 cs.CV

AI总结 针对多任务视频理解中现有解码器的任务行为纠缠、能力扩展难等问题,提出MoTE架构,实例化为VideoLLM-MoTE,在COIN基准上表现优于基线,实现了可解释且计算高效的多任务视频-语言学习。

Comments Accepted at BMVC 2026. 32 pages, 4 figures, 15 tables, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24302 2026-08-26 cs.AI 新提交 78%

VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models

VideoHarness-RSI:基于冻结视觉语言模型的长视频理解的递归 harness 自改进方法

Guoyang Xu, Hao Chen

机构 * Tencent(腾讯)

专题命中 视频理解 :video understanding(title,abstract)

AI总结 该研究提出 VIDEOHARNESS-RSI,通过递归搜索可执行上下文构建程序,在冻结 VLM 上实现长视频理解的改进,且所选 harness 可迁移至其他长视频基准。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 2 篇

2608.24674 2026-08-26 cs.CV 新提交 79%

TurboT2VA: Fast Large-Scale Text-to-Video-Audio Generation via Score-Regularized Consistency Distillation

TurboT2VA:基于分数正则化一致性蒸馏的快速大规模文本-视频-音频生成

Xiaoda Yang, Yuxiang Liu, Kaiwen Zheng, Yuan Liu, Yibo Lai, Shengpeng Ji, Kai Jiang, Jianfei Chen, Xiaobin Hu, Shuicheng Yan, Jintao Zhang, Jun Zhu, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tianjin University(天津大学) Tsinghua University(清华大学) Qingdao University(青岛大学) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出TurboT2VA框架,通过多模态归一化与渐进式课程方案,在保持音视频生成质量的同时,大幅加速190亿参数联合T2VA模型的推理,在不同分辨率下实现最高54.67倍的生成器加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24329 2026-08-26 cs.HC 新提交 50%

How Do Professional Editors Evaluate the Editing Quality of AI-Generated Cinematic Video Ads?

专业编辑如何评估AI生成的影视视频广告的剪辑质量?

Po-Ming Law, Weizhi Li, Arpit Narechania

专题命中 视频生成 :video generation(abstract)

AI总结 该研究针对AI生成影视广告缺乏细粒度评估框架的问题,构建两阶段生成流程,通过专业编辑评价得出六个剪辑质量维度,为相关评估与生成提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2608.23927 2026-08-26 cs.CV 新提交 57%

GlanceWAM: Sparse Test-Time Imagination for World-Action Models

GlanceWAM:面向世界-动作模型的稀疏测试时想象方法

Linhan Wang, Zijian An, Mingyuan Zhang, Chen Dai, Yi Xu, Can Cui, Zichong Yang, Yinlin Chen, Lifeng Zhou, Chang-Tien Lu

机构 * Virginia Tech(弗吉尼亚理工大学) Drexel University(卓克索大学) Northeastern University(东北大学) Purdue University(普渡大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 该研究提出GlanceWAM,通过异步解耦视频DiT的想象与控制,打破世界-动作模型的速度-成功率困境,在RoboCasa、LIBERO基准测试中表现优异,推理速度达48ms/块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23664 2026-08-26 cs.CV cs.LG 新提交 57%

Scaling Reinforcement Learning for Diffusion Models via Velocity Matching

通过速度匹配扩展扩散模型的强化学习

Jaemoo Choi, Wei Guo, Yuchen Zhu, Arash Vahdat, Molei Tao, Julius Berner, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) NVIDIA(英伟达公司)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 该研究提出基于奖励的速度匹配(RVM)方法,用于扩散模型的奖励微调,其训练成本显著降低,性能优于或相当基于轨迹的策略梯度方法,还通过动态跟踪奖励改善了视频生成的运动效果。

Comments 30 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频数据与评测 1 篇

2608.24160 2026-08-26 cs.AI 新提交 50%

OmniJudge or OmniBias? Diagnosing Multimodal Judges through Balanced, Decoupled Lenses

全能评判者还是全能偏差?通过平衡、解耦的视角诊断多模态评判者

Guangzheng Hu, Ziyue Jiang, Weixu Qiao, Lixin Zhang, Jianye Kang, Yuru Wu, Rong Bao, Niantong Li, Wei Wang, Ziyi Cheng, Xinfa Zhu, HangRui Hu, Ting He, Bing Zhao, Lin Qu, Hu Wei, Jin Xu

专题命中 视频数据与评测 :text-to-video(abstract)

AI总结 本研究推出平衡解耦的多模态评判者诊断基准D3-Omni,发现全能评判者存在模态相关维度表现差、漏检失败等系统性盲点,为评估多模态模型提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏