arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-08-06 至 2025-08-06 共收录 16 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2508.03695 2025-08-06 cs.CV 57%

Trokens: Semantic-Aware Relational Trajectory Tokens for Few-Shot Action Recognition

Pulkit Kumar, Shuaiyi Huang, Matthew Walmer, Sai Saketh Rambhatla, Abhinav Shrivastava

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted at ICCV 2025; First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 3 篇

2412.18688 2025-08-06 cs.CV cs.AI 88%

Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation

Faraz Waseem, Muhammad Shahzad

机构 * University Of Reading(阅读大学)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

Comments 35 pages, 18 figures, Manuscript submitted to ACM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16119 2025-08-06 cs.CV cs.AI 83%

FastInit: Fast Noise Initialization for Temporally Consistent Video Generation

Chengyu Bai, Yuming Li, Zhongyu Zhao, Jintao Chen, Peidong Jia, Qi She, Ming Lu, Shanghang Zhang

机构 * Peking University(北京大学) ByteDance(字节跳动)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00701 2025-08-06 cs.CV cs.AI 57%

D3: Training-Free AI-Generated Video Detection Using Second-Order Features

Chende Zheng, Ruiqi suo, Chenhao Lin, Zhengyu Zhao, Le Yang, Shuai Liu, Minghui Yang, Cong Wang, Chao Shen

机构 * Xi’an Jiaotong University(西安交通大学) Guangdong OPPO Mobile Communications Co., Ltd.(广东OPPO移动通信有限公司) City University of Hong Kong(香港城市大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 6 篇

2411.18375 2025-08-06 cs.CV eess.IV 86%

Individual Content and Motion Dynamics Preserved Pruning for Video Diffusion Models

Yiming Wu, Zhenghao Chen, Huan Wang, Dong Xu

机构 * The University of Hong Kong(香港大学) University of Newcastle(新castle大学) Westlake University(西湖大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV、eess.IV

Comments ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03254 2025-08-06 cs.CV cs.AI 83%

V.I.P. : Iterative Online Preference Distillation for Efficient Video Diffusion Models

Jisoo Kim, Wooseok Seo, Junwan Kim, Seungho Park, Sooyeon Park, Youngjae Yu

机构 * Yonsei University(延世大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments ICCV2025 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17350 2025-08-06 cs.CV 79%

Decouple and Track: Benchmarking and Improving Video Diffusion Transformers for Motion Transfer

Qingyu Shi, Jianzong Wu, Jinbin Bai, Jiangning Zhang, Lu Qi, Yunhai Tong, Xiangtai Li

机构 * PKU(北京大学) NTU(国立新加坡大学) NUS(新加坡国立大学) ZJU(浙江大学) UC Merced(加州大学默塞德分校)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03480 2025-08-06 cs.CV cs.AI 57%

VideoGuard: Protecting Video Content from Unauthorized Editing

Junjie Cao, Kaizhou Li, Xinchun Yu, Hongxiang Li, Xiaoping Zhang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments ai security, 10pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02807 2025-08-06 cs.CV 57%

DreamVVT: Mastering Realistic Video Virtual Try-On in the Wild via a Stage-Wise Diffusion Transformer Framework

Tongchun Zuo, Zaiyu Huang, Shuliang Ning, Ente Lin, Chao Liang, Zerong Zheng, Jianwen Jiang, Yuan Zhang, Mingyuan Gao, Xin Dong

机构 * ByteDance Intelligent Creation(字节跳动智能创作)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14404 2025-08-06 cs.CV cs.AI 57%

Causally Steered Diffusion for Automated Video Counterfactual Generation

Nikos Spyrou, Athanasios Vlontzos, Paraskevas Pegios, Thomas Melistas, Nefeli Gkouti, Yannis Panagakis, Giorgos Papanastasiou, Sotirios A. Tsaftaris

机构 * Spotify, UK(英国Spotify)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 3 篇

2508.03009 2025-08-06 cs.CV cs.AI 83%

Enhancing Long Video Question Answering with Scene-Localized Frame Grouping

Xuyi Yang, Wenhao Zhang, Hongbo Jin, Lin Liu, Hongbo Xu, Yongwei Nie, Fei Yu, Fei Ma

专题命中 视频问答 :long video(title,abstract);video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07454 2025-08-06 cs.CV 74%

How Can Objects Help Video-Language Understanding?

Zitian Tang, Shijie Wang, Junho Cho, Jaewook Yoo, Chen Sun

机构 * Brown University(布朗大学) Samsung Electronics(三星电子)

专题命中 视频问答 :video-language(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03039 2025-08-06 cs.CV cs.MM 73%

VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering

Yiran Meng, Junhong Ye, Wei Zhou, Guanghui Yue, Xudong Mao, Ruomei Wang, Baoquan Zhao

机构 * Sun Yat-Sen University(中山大学) Cardiff University(卡地夫大学) Shenzhen University(深圳大学)

专题命中 视频问答 :video understanding(abstract);video reasoning(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 1 篇

2508.03694 2025-08-06 cs.CV 88%

LongVie: Multimodal-Guided Controllable Ultra-Long Video Generation

Jianxiong Gao, Zhaoxi Chen, Xian Liu, Jianfeng Feng, Chenyang Si, Yanwei Fu, Yu Qiao, Ziwei Liu

机构 * Nanjing University(南京大学) Fudan University(复旦大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) NVIDIA(NVIDIA公司) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

Comments Project page: https://vchitect.github.io/LongVie-project/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 2 篇

2508.03050 2025-08-06 cs.CV 57%

Multi-human Interactive Talking Dataset

Zeyu Zhu, Weijia Wu, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments 9 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05787 2025-08-06 cs.CV 57%

EASG-Bench: Video Q&A Benchmark with Egocentric Action Scene Graphs

Ivan Rodin, Tz-Ying Wu, Kyle Min, Sharath Nittur Sridhar, Antonino Furnari, Subarna Tripathi, Giovanni Maria Farinella

机构 * University of Catania(卡塔尼亚大学) Intel Labs(英特尔实验室)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments Accepted to SAUAFG Workshop at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏