arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-02 至 2025-12-02 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 2 篇

2512.00694 2025-12-02 cs.CV 74%

Affordance-First Decomposition for Continual Learning in Video-Language Understanding

基于可及性的分解方法用于视频-语言理解中的持续学习

Mengzhu Xu, Hanzhi Liu, Ningkang Peng, Qianyu Chen, Canran Xiao

机构 * University of Sydney(悉尼大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Nanjing Normal University(南京师范大学) Nanyang Technological University(南洋理工大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

专题命中 长视频与时序推理 :video-language(title);分类 cs.CV

AI总结 AFD通过显式分解视频-语言理解中的稳定性与适应性,实现了在持续学习中的高性能表现。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08015 2025-12-02 cs.CV 57%

4DGT: Learning a 4D Gaussian Transformer Using Real-World Monocular Videos

4DGT: 基于4D高斯变换器的学习用于动态场景重建

Zhen Xu, Zhengqin Li, Zhao Dong, Xiaowei Zhou, Richard Newcombe, Zhaoyang Lv

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 4DGT通过基于4D高斯的变换器模型,在真实世界单目视频上实现高效动态场景重建,显著提升重建速度并优于现有方法。

Comments NeurIPS 2025 (Spotlight); Project Page: https://4dgt.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏