arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-05 至 2026-02-05 共收录 7 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2602.04202 2026-02-05 cs.CV 77%

VTok: A Unified Video Tokenizer with Decoupled Spatial-Temporal Latents

VTok: 一种具有解耦空间-时间潜在变量的统一视频分词器

Feng Wang, Yichun Shi, Ceyuan Yang, Qiushan Guo, Jingxiang Sun, Alan Yuille, Peng Wang

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 视频理解 :video generation(abstract);video understanding(abstract);text-to-video(abstract);分类 cs.CV

AI总结 VTok通过解耦空间和时间潜在变量,实现紧凑且高效的视频分词,提升视频理解和生成任务的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 2 篇

2412.13462 2026-02-05 cs.SD cs.MM eess.AS 79%

SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation

SAVGBench: 多模态空间对齐音频视频生成基准测试

Kazuki Shimada, Christian Simon, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji

机构 * Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.MM

AI总结 SAVGBench提出了一种新的基准测试方法,用于评估空间对齐音频视频生成任务的性能,通过引入专门的数据集和对齐度量标准,评估不同生成模型的对齐效果。

Comments 5 pages, 2 figures, accepted for publication in IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03915 2026-02-05 cs.CV cs.AI cs.CE cs.LG 57%

Phaedra: Learning High-Fidelity Discrete Tokenization for the Physical Science

Phaedra: 学习高保真离散标记化以用于物理科学

Levi Lingsch, Georgios Kissas, Johannes Jakubik, Siddhartha Mishra

机构 * ETH AI Center(苏黎世联邦理工学院人工智能中心) IBM Research Europe(IBM欧洲研究院) Seminar for Applied Mathematics, ETH Zurich(苏黎世联邦理工学院应用数学系) Swiss Data Science Center, ETH Zurich(瑞士数据科学中心,苏黎世联邦理工学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Phaedra通过结合经典形状增益量化和正交分解,改进了科学图像的高保真离散标记化,提升PDE数据的重建和泛化能力。

Comments 57 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2601.21896 2026-02-05 cs.CV 79%

Past- and Future-Informed KV Cache Policy with Salience Estimation in Autoregressive Video Diffusion

具有显著性估计的过去和未来信息KV缓存策略在自回归视频扩散中

Hanmo Chen, Chenghao Xu, Xu Yang, Xuan Chen, Cheng Deng

机构 * Hangzhou Institute of Technology, Xidian University, Hangzhou, China(杭州理工大学,西安电子科技大学,中国杭州) Xidian University, Xi'an, China(西安电子科技大学,中国西安) Hohai University, Nanjing, China(河海大学,中国南京)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 本文提出PaFu-KV策略,通过显著性估计优化KV缓存,提升视频生成的质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04220 2026-02-05 cs.CV 79%

Adaptive 1D Video Diffusion Autoencoder

自适应一维视频扩散自编码器

Yao Teng, Minxuan Lin, Xian Liu, Shuai Wang, Xiao Yang, Xihui Liu

机构 * The University of Hong Kong(香港大学) ByteDance Inc.(字节跳动公司) CUHK(香港中文大学) Nanjing University(南京大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 本文提出了一种自适应一维视频扩散自编码器,通过改进的编码和解码机制实现更高效的视频压缩与重建。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频数据与评测 1 篇

2505.13928 2026-02-05 cs.CV cs.IR 83%

LoVR: A Benchmark for Long Video Retrieval in Multimodal Contexts

LoVR:一种多模态背景下长视频检索的基准

Qifeng Cai, Hao Liang, Zhaoyang Han, Hejun Dong, Meiyi Qiang, Ruichuan An, Quanqing Xu, Bin Cui, Wentao Zhang

机构 * East China Normal University Shanghai China Peking University \& Zhongguancun Academy Beijing China Huazhong University of Science Beihang University Beijing China Peking University Beijing China East China Normal University Peking University \& Zhongguancun Academy Beihang University Peking University

专题命中 视频数据与评测 :long video(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 LoVR是一个针对长视频检索的多模态基准,通过高质量标注和细粒度数据提升视频理解挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他视频模型 1 篇

2506.07464 2026-02-05 cs.CV cs.AI 57%

DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO

DeepVideo-R1: 通过难度感知的回归GRPO实现视频强化微调

Jinyoung Park, Jeehye Na, Jinyoung Kim, Hyunwoo J. Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Korea University(韩国大学)

专题命中 其他视频模型 :video reasoning(abstract);分类 cs.CV

AI总结 DeepVideo-R1通过回归GRPO和难度感知数据增强,提升视频大语言模型的推理能力。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏