arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-19 至 2026-02-19 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2602.16545 2026-02-19 cs.CV cs.LG 74%

Let's Split Up: Zero-Shot Classifier Edits for Fine-Grained Video Understanding

让我们拆分:用于细粒度视频理解的零样本分类器编辑

Kaiting Liu, Hazel Doughty

机构 * Leiden University(莱顿大学)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 本文提出零样本分类器编辑方法,通过细粒度视频理解提升分类精度,优于视觉-语言基线。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16231 2026-02-19 cs.CV 57%

DataCube: A Video Retrieval Platform via Natural Language Semantic Profiling

DataCube: 通过自然语言语义分析实现的视频检索平台

Yiming Ju, Hanyu Zhao, Quanyue Ma, Donglin Hao, Chengwei Wu, Ming Li, Songjing Wang, Tengfei Pan

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 DataCube通过自然语言语义分析实现视频检索,提供高效的视频处理和多维检索功能。

Comments This paper is under review for the IJCAI-ECAI 2026 Demonstrations Track

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 1 篇

2502.17863 2026-02-19 cs.CV cs.AI 79%

A Survey: Spatiotemporal Consistency in Video Generation

综述:视频生成中的时空一致性

Zhiyu Yin, Kehai Chen, Xuefeng Bai, Ruili Jiang, Juntao Li, Hongdong Li, Jin Liu, Yang Xiang, Jun Yu, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Peng Cheng Laboratory(鹏城实验室) School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文综述了视频生成中时空一致性的最新进展,涵盖生成模型、特征表示、训练策略等,探讨了未来研究方向和挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2602.16132 2026-02-19 cs.CV cs.LG 70%

CHAI: CacHe Attention Inference for text2video

CHAI: 文本到视频的缓存注意力推理

Joel Mathew Cherian, Ashutosh Muralidhara Bharadwaj, Vima Gupta, Anand Padmanabha Iyer

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 CHAI通过引入缓存注意力机制,以减少延迟并保持视频质量,实现比OpenSora 1.2快1.65至3.35倍的推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2602.15922 2026-02-19 cs.RO cs.CV cs.LG 57%

World Action Models are Zero-shot Policies

世界动作模型是零样本策略

Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng, Shenyuan Gao, Sihyun Yu, George Kurian, Suneel Indupuru, You Liang Tan, Chuning Zhu, Jiannan Xiang, Ayaan Malik, Kyungmin Lee, William Liang, Nadun Ranawaka, Jiasheng Gu, Yinzhen Xu, Guanzhi Wang, Fengyuan Hu, Avnish Narayan, Johan Bjorck, Jing Wang, Gwanghyun Kim, Dantong Niu, Ruijie Zheng, Yuqi Xie, Jimmy Wu, Qi Wang, Ryan Julian, Danfei Xu, Yilun Du, Yevgen Chebotar, Scott Reed, Jan Kautz, Yuke Zhu, Linxi "Jim" Fan, Joel Jang

机构 * NVIDIA

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 DreamZero通过世界动作模型实现零样本策略,有效提升机器人在新任务和环境中的泛化能力,同时支持跨身体转移和少样本适应。

Comments Project page: https://dreamzero0.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 1 篇

2602.15882 2026-02-19 cs.RO cs.AI 50%

FUTURE-VLA: Forecasting Unified Trajectories Under Real-time Execution

FUTURE-VLA:在实时执行下统一轨迹预测

Jingjing Fan, Yushan Liu, Shoujie Li, Botao Ren, Siyuan Li, Xiao-Ping Zhang, Wenbo Ding, Zhidong Deng

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Shenzhen International Graduation School, Tsinghua University(深圳国际研究生院,清华大学) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院,南洋理工大学)

专题命中 长视频与时序推理 :long video(abstract)

AI总结 FUTURE-VLA通过实时执行实现统一轨迹预测,采用双效效率范式提升时空信息密度,实现实时预测与人机交互机制,取得多项任务的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏