arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-06 至 2026-02-06 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2512.23646 2026-02-06 cs.CV 79%

Active Perception Agent for Omnimodal Audio-Video Understanding

多模态音频视频理解的主动感知代理

Keda Tao, Wenjie Du, Bohan Yu, Weiqiang Wang, Jian Liu, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 OmniAgent通过动态规划和音频引导感知范式,实现多模态细粒度推理,无需训练即超越现有模型性能。

Comments Website:https://kd-tao.github.io/OmniAgent/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 4 篇

2602.06028 2026-02-06 cs.CV 83%

Context Forcing: Consistent Autoregressive Video Generation with Long Context

上下文强制:通过长上下文实现一致的自回归视频生成

Shuo Chen, Cong Wei, Sun Sun, Ping Nie, Kai Zhou, Ge Zhang, Ming-Hsuan Yang, Wenhu Chen

机构 * Department of EECS, University of California, Merced, USA(加州大学梅尔塞德斯分校电子工程与计算机科学系) University of Waterloo, Canada(滑铁卢大学)

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV

AI总结 Context Forcing通过长上下文教师训练学生,解决长视频生成中的学生-教师不匹配问题,实现更长的上下文长度和更一致的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05966 2026-02-06 cs.CV cs.AI 79%

LSA: Localized Semantic Alignment for Enhancing Temporal Consistency in Traffic Video Generation

LSA:局部语义对齐用于增强交通视频生成中的时间一致性

Mirlan Karimov, Teodora Spasojevic, Markus Braun, Julian Wiederer, Vasileios Belagiannis, Marc Pollefeys

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) ETH Zurich(苏黎世联邦理工学院) Friedrich-Alexander University Erlangen-Nuremberg(埃朗根-纽伦堡弗里德里希-亚历山大大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 LSA通过局部语义对齐提升交通视频生成的时间一致性,无需外部控制信号。

Comments Accepted to IEEE IV 2026. 8 pages, 3 figures. Code available at https://github.com/mirlanium/LSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05827 2026-02-06 cs.CV cs.RO 79%

Sparse Video Generation Propels Real-World Beyond-the-View Vision-Language Navigation

稀疏视频生成推动现实世界超越视界视觉语言导航

Hai Zhang, Siqi Liang, Li Chen, Yuxian Li, Yukuan Xu, Yichao Zhong, Fu Zhang, Hongyang Li

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出SparseVideoNav,通过稀疏视频生成实现现实世界超越视界导航,显著提升导航效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01758 2026-02-06 cs.CV 70%

Many-for-Many: Unify the Training of Multiple Video and Image Generation and Manipulation Tasks

许多对许多:统一多个视频和图像生成与操控任务的训练

Ruibin Li, Tao Yang, Yangming Shi, Weiguo Feng, Shilei Wen, Bingyue Peng, Lei Zhang

机构 * ByteDance(字节跳动) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出many-for-many框架,通过统一训练多个视频和图像生成与操控任务,提升视频生成性能并引入深度图条件。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长视频与时序推理 1 篇

2602.05829 2026-02-06 cs.CV 70%

Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning

Weaver:用于视频交织推理的端到端代理系统训练

Yudi Shi, Shangzhe Di, Qirui Chen, Qinian Wang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Weidi Xie

专题命中 长视频与时序推理 :video reasoning(abstract);long video(abstract);分类 cs.CV

AI总结 Weaver通过端到端训练多模态推理代理系统,提升视频推理任务在长视频处理上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏