arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-11-19 至 2025-11-19 共收录 8 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2511.14446 2025-11-19 cs.CV cs.AI 57%

Agentic Video Intelligence: A Flexible Framework for Advanced Video Exploration and Understanding

Hong Gao, Yiming Bao, Xuezhen Tu, Yutong Xu, Yue Jin, Yiyang Mu, Bin Zhong, Linan Yue, Min-Ling Zhang

机构 * SouthEast University(东南大学) ZTE Corporation(中兴通讯)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14120 2025-11-19 cs.CV cs.AI 57%

Multi-view Phase-aware Pedestrian-Vehicle Incident Reasoning Framework with Vision-Language Models

Hao Zhen, Yunxiang Yang, Jidong J. Yang

机构 * College of Engineering University of Georgia(工程学院 乔治亚大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 23 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14454 2025-11-19 cs.CV 57%

Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language Models

Xuyang Liu, Yiyu Wang, Junpeng Ma, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) Fudan University(复旦大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments EMNLP 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 2 篇

2508.15874 2025-11-19 cs.RO cs.AI cs.CV 57%

Spatial Policy: Guiding Visuomotor Robotic Manipulation with Spatial-Aware Modeling and Reasoning

Yijun Liu, Yuwei Liu, Yuan Meng, Jieheng Zhang, Yuwei Zhou, Ye Li, Jiacheng Jiang, Kangye Ji, Shijia Ge, Zhi Wang, Wenwu Zhu

机构 * Tsinghua University(清华大学) Beijing University of Technology(北京理工大学) Guangzhou University(广州大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01711 2025-11-19 cs.CV cs.AI 57%

GAIS: Frame-Level Gated Audio-Visual Integration with Semantic Variance-Scaled Perturbation for Text-Video Retrieval

Bowen Yang, Yun Cao, Chen He, Xiaosu Su

机构 * School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2510.12089 2025-11-19 cs.CV 70%

Playmate2: Training-Free Multi-Character Audio-Driven Animation via Diffusion Transformer with Reward Feedback

Xingpei Ma, Shenneng Huang, Jiaran Cai, Yuansheng Guan, Shen Zheng, Hanfeng Zhao, Qiang Zhang, Shunsi Zhang

机构 * Project lead & Corresponding Author(项目负责人及通讯作者)

专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 1 篇

2511.14349 2025-11-19 cs.CV 79%

ARC-Chapter: Structuring Hour-Long Videos into Navigable Chapters and Hierarchical Summaries

Junfu Pu, Teng Wang, Yixiao Ge, Yuying Ge, Chen Li, Ying Shan

机构 * ARC Lab, Tencent PCG(腾讯PCG广告实验室)

专题命中 长视频与时序推理 :long video(title,abstract);分类 cs.CV

Comments Project Page: https://arcchapter.github.io/index_en.html

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 1 篇

2507.02373 2025-11-19 cs.CV 79%

UVLM: Benchmarking Video Language Model for Underwater World Understanding

Xizhe Xue, Yang Zhou, Dawei Yan, Lijie Tao, Junjie Li, Ying Li, Haokui Zhang, Rong Xiao

专题命中 视频数据与评测 :video language model(title,abstract);分类 cs.CV

Comments 18 pages, 10 figures, 7 tables. Accepted to the Fortieth AAAI Conference on Artificial Intelligence (AAAI-26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏