arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-10 至 2025-12-10 共收录 10 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2509.06335 2025-12-10 cs.CV 79%

Harnessing Object Grounding for Time-Sensitive Video Understanding

利用物体接地提升时间敏感视频理解

Tz-Ying Wu, Sharath Nittur Sridhar, Subarna Tripathi

机构 * Intel(英特尔公司)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出 GO-Tokenizer 以提升视频大型语言模型的时间敏感视频理解能力,通过实时编码紧凑的物体信息,提高模型性能并减少噪声影响。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 5 篇

2512.08269 2025-12-10 cs.CV 83%

EgoX: Egocentric Video Generation from a Single Exocentric Video

EgoX:从单个外视视频生成自视视频

Taewoong Kang, Kinam Kim, Dohyeon Kim, Minho Park, Junha Hyung, Jaegul Choo

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 EgoX通过轻量级LoRA适应和统一条件策略,从单个外视视频生成自视视频,实现几何一致且逼真的视频生成,具有高可扩展性和鲁棒性。

Comments 21 pages, project page : https://keh0t0.github.io/EgoX

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08765 2025-12-10 cs.CV 74%

Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance

Wan-Move:通过潜在轨迹引导实现可动视频生成

Ruihang Chu, Yefei He, Zhekai Chen, Shiwei Zhang, Xiaogang Xu, Bin Xia, Dingdong Wang, Hongwei Yi, Xihui Liu, Hengshuang Zhao, Yu Liu, Yingya Zhang, Yujiu Yang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Tsinghua University(清华大学) HKU(香港大学) CUHK(香港中文大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 Wan-Move通过潜在轨迹引导实现视频生成的精确运动控制,无需修改架构即可提升运动可控性。

Comments NeurlPS 2025. Code and data available at https://github.com/ali-vilab/Wan-Move

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08577 2025-12-10 cs.CV cs.AI cs.LG cs.RO 74%

Disturbance-Free Surgical Video Generation from Multi-Camera Shadowless Lamps for Open Surgery

多摄像头无影灯下开放式手术的干扰自由视频生成

Yuna Kato, Shohei Mori, Hideo Saito, Yoshifumi Takatsume, Hiroki Kajita, Mariko Isogawa

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出了一种自动化方法,通过识别照明系统移动并重新对齐视频帧,生成无遮挡的开放式手术视频,提升手术区域的可视化效果和观看舒适度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06723 2025-12-10 cs.CV 74%

Zo3T: Zero-Shot 3D-Aware Trajectory-Guided Image-to-Video Generation via Test-Time Training

Zo3T: 无监督3D感知轨迹引导图像到视频生成 via 测试时间训练

Ruicheng Zhang, Jun Zhou, Zunnan Xu, Zihao Liu, Jiehui Huang, Mingyang Zhang, Yu Sun, Xiu Li

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 Zo3T通过引入3D感知运动投影、轨迹引导测试时间LoRA和指导场校正,提升了轨迹引导图像到视频生成的3D真实感和运动准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08905 2025-12-10 cs.CV 57%

Self-Evolving 3D Scene Generation from a Single Image

从单张图像自演化生成3D场景

Kaizhi Zheng, Yue Fan, Jing Gu, Zishuo Xu, Xuehai He, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 EvoScene通过自演化框架从单张图像生成高质量3D场景,结合几何推理和视觉知识,实现结构和外观的逐步优化。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2505.06670 2025-12-10 cs.CV 57%

Video Dataset Condensation with Diffusion Models

视频数据集压缩与扩散模型

Zhe Li, Hadrien Reynaud, Mischa Dombrowski, Sarah Cechnicka, Franciskus Xaverius Erick, Bernhard Kainz

机构 * Department AIBE FAU Erlangen-Nürnberg(FAU埃尔朗根-纽伦堡AIBE部门) Department of Computing Imperial College London(伦敦帝国理工学院计算系)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出基于扩散模型和VST-UNet的视频数据集压缩方法,结合训练免费聚类算法,有效提升视频数据集蒸馏性能,达到10.61%的性能提升。

Comments Accepted at BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 2 篇

2508.21058 2025-12-10 cs.GR cs.AI cs.CV 88%

Mixture of Contexts for Long Video Generation

上下文混合用于长视频生成

Shengqu Cai, Ceyuan Yang, Lvmin Zhang, Yuwei Guo, Junfei Xiao, Ziyan Yang, Yinghao Xu, Zhenheng Yang, Alan Yuille, Leonidas Guibas, Maneesh Agrawala, Lu Jiang, Gordon Wetzstein

机构 * Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出上下文混合(MoC)模块,通过稀疏注意力路由解决长视频生成中的长上下文记忆问题,提升模型在长序列中的效率与一致性。

Comments Project page: https://primecai.github.io/moc/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07720 2025-12-10 cs.CV 70%

ViSA: 3D-Aware Video Shading for Real-Time Upper-Body Avatar Creation

ViSA: 一种3D感知的视频着色方法用于实时上半身数字人生成

Fan Yang, Heyuan Li, Peihao Li, Weihao Yuan, Lingteng Qiu, Chaoyue Song, Cheng Chen, Yisheng He, Shifeng Zhang, Xiaoguang Han, Steven Hoi, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 长视频与时序推理 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 ViSA结合3D重建与视频生成技术,实时生成高质量上半身数字人,减少模糊和僵硬问题,提升视觉质量。

Comments Project page: \url{https://lhyfst.github.io/visa}

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 1 篇

2508.00518 2025-12-10 cs.CV cs.CL 57%

Fine-grained Spatiotemporal Grounding on Egocentric Videos

细粒度眼动视频时空定位

Shuo Liang, Yiwu Zhong, Zi-Yuan Hu, Yeyao Tao, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 本文提出EgoMask基准和EgoMask-Train数据集,针对眼动视频细粒度时空定位的挑战,通过微调提升模型性能。

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏