arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-09-22 至 2025-09-22 共收录 9 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2508.10215 2025-09-22 eess.IV cs.CV 81%

Data-Efficient Learning for Generalizable Surgical Video Understanding

Sahar Nasirihaghighi

机构 * Department of Information Technology (ITEC), University of Klagenfurt(信息科技系,克雷根弗特大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15800 2025-09-22 cs.CV cs.AI 79%

ChronoForge-RL: Chronological Forging through Reinforcement Learning for Enhanced Video Understanding

Kehua Chen

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 3 篇

2509.15496 2025-09-22 cs.CV 79%

Lynx: Towards High-Fidelity Personalized Video Generation

Shen Sang, Tiancheng Zhi, Tianpei Gu, Jing Liu, Linjie Luo

机构 * ByteDance(字节跳动)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Lynx Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15479 2025-09-22 cs.CV 79%

OpenViGA: Video Generation for Automotive Driving Scenes by Streamlining and Fine-Tuning Open Source Models with Public Data

Björn Möller, Zhengyang Li, Malte Stelzer, Thomas Graave, Fabian Bettels, Muaaz Ataya, Tim Fingscheidt

机构 * Technische Universität Braunschweig(布拉unsch维格技术大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14476 2025-09-22 cs.CV cs.AI cs.MM 73%

AToken: A Unified Tokenizer for Vision

Jiasen Lu, Liangchen Song, Mingze Xu, Byeongjoo Ahn, Yanjun Wang, Chen Chen, Afshin Dehghan, Yinfei Yang

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

Comments 30 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2412.01064 2025-09-22 cs.CV cs.AI cs.LG cs.MM eess.IV 67%

FLOAT: Generative Motion Latent Flow Matching for Audio-driven Talking Portrait

Taekyung Ki, Dongchan Min, Gyeongsu Chae

机构 * KAIST(韩国科学技术院) DeepBrain AI Inc.(DeepBrain AI公司)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、eess.IV、cs.MM

Comments ICCV 2025. Project page: https://deepbrainai-research.github.io/float/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2509.15546 2025-09-22 cs.CV 70%

Enhancing Sa2VA for Referent Video Object Segmentation: 2nd Solution for 7th LSVOS RVOS Track

Ran Hong, Feng Lu, Leilei Cao, An Yan, Youhai Jiang, Fengjie Zhu

机构 * TEX AI, Transsion Holdings(TEX AI,Transsion Holdings) Nanchang University(南昌大学) ShanghaiTech University(上海科技大学)

专题命中 动作与事件理解 :video reasoning(abstract);video-language(abstract);分类 cs.CV

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 1 篇

2505.05467 2025-09-22 cs.CV cs.AI cs.CL 57%

StreamBridge: Turning Your Offline Video Large Language Model into a Proactive Streaming Assistant

Haibo Wang, Bo Feng, Zhengfeng Lai, Mingze Xu, Shiyu Li, Weifeng Ge, Afshin Dehghan, Meng Cao, Ping Huang

机构 * Apple(苹果公司) Fudan University(复旦大学)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 1 篇

2503.11103 2025-09-22 cs.CV cs.AI 57%

Pruning the Paradox: How CLIP's Most Informative Heads Enhance Performance While Amplifying Bias

Avinash Madasu, Vasudev Lal, Phillip Howard

机构 * Intel Labs(英特尔实验室) Oracle(Oracle公司) Thoughtworks(Thoughtworks公司)

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏