arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-08-21 至 2025-08-21 共收录 8 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2508.14395 2025-08-21 cs.HC cs.AI 78%

NoteIt: A System Converting Instructional Videos to Interactable Notes Through Multimodal Video Understanding

Running Zhao, Zhihan Jiang, Xinchen Zhang, Chirui Chang, Handi Chen, Weipeng Deng, Luyao Jin, Xiaojuan Qi, Xun Qian, Edith C. H. Ngai

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Google(谷歌)

专题命中 视频理解 :video understanding(title);long video(abstract)

Comments Accepted to UIST 2025. Project website: https://zhaorunning.github.io/NoteIt/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 2 篇

2508.14609 2025-08-21 cs.CV 79%

AnchorSync: Global Consistency Optimization for Long Video Editing

Zichi Liu, Yinggui Wang, Tao Wei, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, AI Institute Shanghai Jiao Tong University Shanghai China(人工智能联合实验室,人工智能研究院,上海交通大学)

专题命中 视频生成 :long video(title,abstract);分类 cs.CV

Comments ACM MM 2025; Code is released at https://github.com/VISION-SJTU/AnchorSync

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14465 2025-08-21 cs.CV 57%

DreamSwapV: Mask-guided Subject Swapping for Any Customized Video Editing

Weitao Wang, Zichen Wang, Hongdeng Shen, Yulei Lu, Xirui Fan, Suhui Wu, Jun Zhang, Haoqian Wang, Hao Zhang

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2508.14811 2025-08-21 cs.CV 57%

Tinker: Diffusion's Gift to 3D--Multi-View Consistent Editing From Sparse Inputs without Per-Scene Optimization

Canyu Zhao, Xiaoman Li, Tianjian Feng, Zhiyue Zhao, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学) Zhejiang University of Technology(浙江工业大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project webpage: https://aim-uofa.github.io/Tinker

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2407.05311 2025-08-21 cs.CV 57%

MMAD: Multi-label Micro-Action Detection in Videos

Kun Li, Pengyu Liu, Dan Guo, Fei Wang, Zhiliang Wu, Hehe Fan, Meng Wang

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) ReLER, CCAI, Zhejiang University(浙江大学ReLER、CCAI)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 1 篇

2506.18897 2025-08-21 cs.RO cs.AI 67%

MinD: Learning A Dual-System World Model for Real-Time Planning and Implicit Risk Analysis

Xiaowei Chi, Kuangzhi Ge, Jiaming Liu, Siyuan Zhou, Peidong Jia, Zichen He, Yuzhen Liu, Tingguang Li, Lei Han, Sirui Han, Shanghang Zhang, Yike Guo

专题命中 长视频与时序推理 :video generation(abstract);video diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 2 篇

2508.14812 2025-08-21 cs.CV 79%

Repeating Words for Video-Language Retrieval with Coarse-to-Fine Objectives

Haoyu Zhao, Jiaxi Gu, Shicong Wang, Xing Zhang, Hang Xu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Tencent(腾讯) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21755 2025-08-21 cs.CV 79%

VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness

Dian Zheng, Ziqi Huang, Hongbo Liu, Kai Zou, Yinan He, Fan Zhang, Lulu Gu, Yuanhan Zhang, Jingwen He, Wei-Shi Zheng, Yu Qiao, Ziwei Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) S-Lab, Nanyang Technological University(南洋理工大学S实验室) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV

Comments Equal contributions from first two authors. Project page: https://vchitect.github.io/VBench-2.0-project/ Code: https://github.com/Vchitect/VBench

详情

展开后加载摘要…

URL PDF HTML 收藏