arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-11-03 至 2025-11-03 共收录 7 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2509.21657 2025-11-03 cs.CV 57%

FantasyWorld: Geometry-Consistent World Modeling via Unified Video and 3D Prediction

Yixiang Dai, Fan Jiang, Chiyu Wang, Mu Xu, Yonggang Qi

机构 * AMAP, Alibaba Group(阿里集团AMAP) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视频理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11664 2025-11-03 cs.AI 50%

VRoPE: Rotary Position Embedding for Video Large Language Models

Zikang Liu, Longteng Guo, Yepeng Tang, Tongtian Yue, Junxian Cai, Kai Ma, Qingbin Liu, Xi Chen, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) Basic Algorithm Center, Tencent(腾讯基础算法中心)

专题命中 视频理解 :video understanding(abstract)

Comments EMNLP 2025 Main Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 1 篇

2503.18559 2025-11-03 cs.CV 86%

AMD-Hummingbird: Towards an Efficient Text-to-Video Model

Takashi Isobe, He Cui, Dong Zhou, Mengmeng Ge, Dong Li, Emad Barsoum

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);long video(abstract);分类 cs.CV

Comments Homepage: https://www.amd.com/en/developer/resources/technical-articles/amd-hummingbird-0-9b-text-to-video-diffusion-model-with-4-step-inferencing.html| GitHub: https://github.com/AMD-AIG-AIMA/AMD-Hummingbird-T2V

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2510.27169 2025-11-03 cs.CV 70%

DANCER: Dance ANimation via Condition Enhancement and Rendering with diffusion model

Yucheng Xing, Jinxing Yin, Xiaodong Liu

机构 * Stony Brook University(石溪大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27364 2025-11-03 cs.CV cs.AI 61%

Fine-Tuning Open Video Generators for Cinematic Scene Synthesis: A Small-Data Pipeline with LoRA and Wan2.1 I2V

Meftun Akarsu, Kerem Catay, Sedat Bin Vedat, Enes Kutay Yarkan, Ilke Senturk, Arda Sar, Dafne Eksioglu

机构 * AI Yapım Hagia Labs Singapore(AI Yapım 赫亚实验室新加坡) AI Engineer Hagia Labs İstanbul(AI工程师 赫亚实验室伊斯坦布尔) Full Stack Engineer Hagia Labs İstanbul(全栈工程师 赫亚实验室伊斯坦布尔) Chief Creator Hagia Labs İstanbul(首席创作者 赫亚实验室伊斯坦布尔)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV;video generation(comments)

Comments video generation, image-to-video, dif- fusion transformer, LoRA, fine-tuning, cinematic scene synthesis, multi-GPU inference, fully sharded data parallelism, computational efficiency

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 1 篇

2505.00254 2025-11-03 cs.CV cs.AI 70%

AVA: Towards Agentic Video Analytics with Vision Language Models

Yuxuan Yan, Shiqi Jiang, Ting Cao, Yifan Yang, Qianqian Yang, Yuanchao Shu, Yuqing Yang, Lili Qiu

机构 * Zhejiang University(浙江大学) Microsoft Research(微软研究院) Tsinghua University(清华大学)

专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments Accepted to NDSI 2026, 19pages, 12 figures, complementary evaluations and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 1 篇

2509.16873 2025-11-03 cs.CV 57%

$\mathtt{M^3VIR}$: A Large-Scale Multi-Modality Multi-View Synthesized Benchmark Dataset for Image Restoration and Content Creation

Yuanzhi Li, Lebin Zhou, Nam Ling, Zhenghao Chen, Wei Wang, Wei Jiang

机构 * Santa Clara University(圣克拉拉大学) University of Newcastle(新castle大学) Futurewei Technologies, Inc.(未来科技公司)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏