arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-23 至 2026-02-23 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2602.18019 2026-02-23 cs.CV cs.AI 79%

DeepSVU: Towards In-depth Security-oriented Video Understanding via Unified Physical-world Regularized MoE

DeepSVU: 向深入的安全导向视频理解迈进:通过统一的物理世界正则化MoE

Yujie Jin, Wenxin Zhang, Jingjing Wang, Guodong Zhou

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出DeepSVU任务,通过统一物理世界正则化MoE方法,提升视频中威胁的识别、归因和评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17869 2026-02-23 cs.CV 79%

Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models

学习紧凑的视频表示以在大规模多模态模型中实现高效的长视频理解

Yuxiao Chen, Jue Wang, Zhikang Zhang, Jingru Yi, Xu Zhang, Yang Zou, Zhaowei Cai, Jianbo Yuan, Xinyu Li, Hao Yang, Davide Modolo

机构 * Amazon AGI(亚马逊人工智能研究院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出了一种端到端的长视频理解框架,结合自适应视频采样器和空间时间视频压缩器,以高效处理长视频的冗余问题。

详情

展开后加载摘要…

URL PDF HTML 收藏