arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-02 至 2026-02-02 共收录 11 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2510.02295 2026-02-02 cs.CV cs.AI cs.LG 83%

VideoNSA: Native Sparse Attention Scales Video Understanding

VideoNSA:原生稀疏注意力扩展视频理解

Enxin Song, Wenhao Chai, Shusheng Yang, Ethan Armand, Xiaojun Shan, Haiyang Xu, Jianwen Xie, Zhuowen Tu

专题命中 视频理解 :video understanding(title,abstract);video-language(abstract);分类 cs.CV

AI总结 VideoNSA通过端到端训练提升视频理解,结合原生稀疏注意力实现长视频和时间推理的性能优化

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12243 2026-02-02 cs.CV cs.AI 57%

Less is More: Label-Guided Summarization of Procedural and Instructional Videos

少即是多:基于标签的程序性和教学视频摘要

Shreya Rajpal, Michal Golovanevsky, Carsten Eickhoff

机构 * University of Tübingen(图宾根大学) Vellore Institute of Technology(维洛雷理工学院) Brown University(布朗大学)

专题命中 视频理解 :long video(abstract);分类 cs.CV

AI总结 PRISM提出了一种基于标签的视频摘要方法,通过集成语义和多模态分析,生成语义准确且上下文连贯的摘要,有效提升摘要质量。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 5 篇

2601.10214 2026-02-02 cs.CV cs.GR 83%

Beyond Inpainting: Unleash 3D Understanding for Precise Camera-Controlled Video Generation

超越修复:释放3D理解以实现精确的相机控制视频生成

Dong-Yu Chen, Yixin Guo, Shuojin Yang, Tai-Jiang Mu, Shi-Min Hu

机构 * BNRist, Department of Computer Science and Technology, Tsinghua University(BNRist,计算机科学与技术系,清华大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 DepthDirector通过双流条件机制和LoRA适配器实现精确摄像机控制,提升视频生成的3D理解和视觉质量。

Comments Project page: https://eleanor6725.github.io/DepthDirector/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05179 2026-02-02 cs.CV 83%

FlashVideo: Flowing Fidelity to Detail for Efficient High-Resolution Video Generation

FlashVideo: 为高效高分辨率视频生成实现流畅的细节保真度

Shilong Zhang, Wenbo Li, Shoufa Chen, Chongjian GE, Peize Sun, Yifu Zhang, Yi Jiang, Zehuan Yuan, Bingyue Peng, Ping Luo

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 FlashVideo通过两阶段框架在高效高分辨率视频生成中实现流畅细节保真度,优化计算效率并提升商业应用潜力。

Comments Model and Weight: https://github.com/FoundationVision/FlashVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19488 2026-02-02 cs.CV 79%

Entropy-Guided k-Guard Sampling for Long-Horizon Autoregressive Video Generation

熵引导的k-guard采样用于长 Horizon 自回归视频生成

Yizhao Han, Tianxing Shi, Zhao Wang, Zifan Xu, Zhiyuan Pu, Mingxiao Li, Qian Zhang, Wei Yin, Xiao-Xiao Long

机构 * Nanjing University(南京大学) Horizon Robotics China Mobile(中国移动)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 熵引导的k-guard采样用于长Horizon自回归视频生成,通过自适应调整令牌候选集大小以提升视频生成的质量和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14256 2026-02-02 cs.CV 79%

Identity-GRPO: Optimizing Multi-Human Identity-preserving Video Generation via Reinforcement Learning

身份保持的多人类视频生成优化:通过强化学习进行优化

Xiangyu Meng, Zixian Zhang, Zhenghao Zhang, Junchao Liao, Long Qin, Weizhi Wang

机构 * Alibaba Group(阿里巴巴集团) Fudan University(复旦大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Identity-GRPO通过强化学习优化多人类身份保持的视频生成,显著提升一致性指标。

Comments Our project and code are available at https://ali-videoai.github.io/identity_page, https://github.com/alibaba/identity-grpo

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02725 2026-02-02 cs.AI 50%

Advances in Artificial Intelligence: A Review for the Creative Industries

人工智能进展:面向创意产业的综述

Nantheera Anantrasirichai, Fan Zhang, David Bull

机构 * Visual Information Laboratory, University of Bristol, Bristol, UK(布里斯托大学视觉信息实验室)

专题命中 视频生成 :video generation(abstract)

AI总结 本文综述了自2022年以来人工智能在创意产业中的进展,探讨了生成式AI、大语言模型和扩散模型等技术对创意生产流程的影响,并分析了人类与AI协作的新趋势及面临的挑战。

Comments This is an updated review of our previous paper (see https://doi.org/10.1007/s10462-021-10039-7), and has been accepted by Artificial Intelligence Review journal

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2601.22275 2026-02-02 cs.CV cs.AI 83%

VMonarch: Efficient Video Diffusion Transformers with Structured Attention

VMonarch:具有结构注意力的高效视频扩散变换器

Cheng Liang, Haoxian Chen, Liang Hou, Qi Fan, Gangshan Wu, Xin Tao, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 视频扩散模型 :video diffusion(title,abstract);long video(abstract);分类 cs.CV

AI总结 VMonarch通过结构化注意力机制提升视频扩散变换器的效率,减少计算量并提高处理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07891 2026-02-02 cs.CV 70%

Video Unlearning via Low-Rank Refusal Vector

通过低秩拒绝向量实现视频去学习

Simone Facchiano, Stefano Saravalle, Matteo Migliarini, Edoardo De Matteis, Alessio Sampieri, Andrea Pilzer, Emanuele Rodolà, Indro Spinelli, Luca Franco, Fabio Galasso

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) ItalAI Paradigma NVIDIA

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出一种无需训练的视频扩散模型概念去除方法,通过低秩拒绝向量实现安全生成,有效减少不安全内容生成。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 2 篇

2601.22959 2026-02-02 cs.CV 79%

Triage: Hierarchical Visual Budgeting for Efficient Video Reasoning in Vision-Language Models

Triage: 分层视觉预算机制用于视觉语言模型中的高效视频推理

Anmin Wang, Nan Zhang, Wei Tao, Xiaoyang Qu, Guokuan Li, Jiguang Wan, Jianzong Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司)

专题命中 长视频与时序推理 :video reasoning(title,abstract);分类 cs.CV

AI总结 Triage通过分层视觉预算机制优化视频推理,提升效率并保持性能。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22076 2026-02-02 cs.LG cs.DC 50%

Where Do the Joules Go? Diagnosing Inference Energy Consumption

焦耳去哪儿了?诊断推理能耗

Jae-Won Chung, Ruofan Wu, Jeff J. Ma, Mosharaf Chowdhury

机构 * University of Michigan \& The ML.ENERGY Initiative

专题命中 长视频与时序推理 :video generation(abstract)

AI总结 研究通过大规模测量发现生成式AI中不同任务和硬件配置对能耗的影响差异,并提出框架解释能耗与利用率等隐含指标的关系,为优化数据中心能耗提供依据。

Comments The ML ENERGY Leaderboard v3.0 is open at https://ml.energy/leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏