arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-17 至 2025-12-17 共收录 11 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2512.14273 2025-12-17 cs.CV 83%

Zoom-Zero: Reinforced Coarse-to-Fine Video Understanding via Temporal Zoom-in

Zoom-Zero: 通过时间放大实现强化的粗到细视频理解

Xiaoqian Shen, Min-Hung Chen, Yu-Chiang Frank Wang, Mohamed Elhoseiny, Ryo Hachiuma

机构 * NVIDIA(英伟达) KAUST(卡塔尔人工智能研究所在线大学)

专题命中 视频理解 :video understanding(title,abstract);video-language(abstract);分类 cs.CV

AI总结 Zoom-Zero通过时间放大和令牌选择性信用分配提升视频问题回答的时空定位精度和答案准确性。

Comments Project page: https://xiaoqian-shen.github.io/Zoom-Zero/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09143 2025-12-17 cs.CV 79%

Exo2Ego: Exocentric Knowledge Guided MLLM for Egocentric Video Understanding

Exo2Ego:基于外部知识引导的多模态大语言模型用于第一人称视频理解

Haoyu Zhang, Qiaohui Chu, Meng Liu, Haoxiang Shi, Yaowei Wang, Liqiang Nie

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 Exo2Ego通过迁移学习提升内向视频理解能力,利用外向知识增强模型性能。

Comments This paper is accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 2 篇

2509.24979 2025-12-17 cs.CV 74%

Video Generation with Stable Transparency via Shiftable RGB-A Distribution Learner

通过可移动的RGB-A分布学习实现稳定的透明度视频生成

Haotian Dong, Wenjing Wang, Chen Li, Jing Lyu, Di Lin

机构 * Tianjin University(天津大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出了一种通过可移动RGB-A分布学习实现稳定透明度视频生成的方法,提升了视频质量和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13392 2025-12-17 cs.CV 57%

Beyond the Visible: Disocclusion-Aware Editing via Proxy Dynamic Graphs

超越可见范围:通过代理动态图实现的遮挡感知编辑

Anran Qi, Changjian Li, Adrien Bousseau, Niloy J. Mitra

机构 * Inria - Université Côte d’Azur(法国国家信息与自动化技术研究院-埃克塞特大学) University of Edinburgh(爱丁堡大学) Adobe Research(Adobe研究部) UCL(伦敦大学学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 通过代理动态图实现遮挡感知编辑,结合运动规范与外观合成,实现可控的图像到视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 3 篇

2512.14217 2025-12-17 cs.CV cs.RO 70%

DRAW2ACT: Turning Depth-Encoded Trajectories into Robotic Demonstration Videos

DRAW2ACT:将深度编码轨迹转化为机器人演示视频

Yang Bai, Liudi Yang, George Eskandar, Fengyi Shen, Mohammad Altillawi, Ziyuan Liu, Gitta Kutyniok

机构 * Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) University of Freiburg(弗赖堡大学) Technical University of Munich(慕尼黑技术大学) Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心(慕尼黑))

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 DRAW2ACT通过深度感知的轨迹条件视频生成框架,生成可控且一致的机器人演示视频,提升机器人操作的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14095 2025-12-17 cs.CV 57%

AnchorHOI: Zero-shot Generation of 4D Human-Object Interaction via Anchor-based Prior Distillation

AnchorHOI: 通过基于锚点的先验蒸馏实现零样本4D人-物交互生成

Sisi Dai, Kai Xu

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 AnchorHOI通过基于锚点的先验蒸馏策略,结合视频扩散模型提升4D人-物交互生成的多样性和泛化能力。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14133 2025-12-17 cs.GR 50%

AnimaMimic: Imitating 3D Animation from Video Priors

AnimaMimic:从视频先验模仿3D动画

Tianyi Xie, Yunuo Chen, Yaowei Guo, Yin Yang, Bolei Zhou, Demetri Terzopoulos, Ying Jiang, Chenfanfu Jiang

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 AnimaMimic通过视频扩散模型学习的运动先验,实现静态3D网格的自动动画生成,结合物理模拟提升真实感,整合进标准动画流程。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 3 篇

2512.04540 2025-12-17 cs.CV 88%

VideoMem: Enhancing Ultra-Long Video Understanding via Adaptive Memory Management

VideoMem: 通过自适应内存管理增强超长视频理解

Hongbo Jin, Qingyuan Wang, Wenhao Zhang, Yang Liu, Sijie Cheng

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 VideoMem通过自适应内存管理框架,有效提升超长视频理解任务的性能,采用PRPO算法和两个核心模块实现高效训练和长期记忆保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14699 2025-12-17 cs.CV 79%

MemFlow: Flowing Adaptive Memory for Consistent and Efficient Long Video Narratives

MemFlow: 流动适应性记忆用于一致且高效的长视频叙述

Sihui Ji, Xi Chen, Shuai Yang, Xin Tao, Pengfei Wan, Hengshuang Zhao

机构 * HKU(香港大学) Kling Team, Kuaishou Technology(快手技术 Kling 团队) HKUST(GZ)(香港科技大学(广州))

专题命中 长视频与时序推理 :long video(title);video generation(abstract);分类 cs.CV

AI总结 MemFlow通过动态更新内存库和选择性激活令牌,实现长视频生成中的一致性和高效性。

Comments Project Page: https://sihuiji.github.io/MemFlow.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14284 2025-12-17 cs.CV 57%

SS4D: Native 4D Generative Model via Structured Spacetime Latents

SS4D:通过结构化时空潜在变量实现的原生4D生成模型

Zhibing Li, Mengchen Zhang, Tong Wu, Jing Tan, Jiaqi Wang, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Stanford University(斯坦福大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 SS4D通过结构化时空潜在变量实现原生4D生成模型,直接从单目视频合成动态3D物体,提升时间一致性和结构一致性。

Comments ToG(Siggraph Asia 2025)

Journal ref ACM Transactions on Graphics, 44(6): Article 244, 12 pages, December 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 1 篇

2512.14017 2025-12-17 cs.CV cs.AI 88%

KFS-Bench: Comprehensive Evaluation of Key Frame Sampling in Long Video Understanding

KFS-Bench: 长视频理解中关键帧采样的全面评估

Zongyao Li, Kengo Ishida, Satoshi Yamazaki, Xiaotong Ji, Jianquan Liu

机构 * Visual Intelligence Research Laboratories, NEC Corporation(NEC公司视觉智能研究实验室)

专题命中 视频数据与评测 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 KFS-Bench通过多场景标注评估关键帧采样策略,提出新度量标准和方法提升问答性能。

Comments WACV2026

详情

展开后加载摘要…

URL PDF HTML 收藏