arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-19 至 2025-12-19 共收录 10 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2510.02262 2025-12-19 cs.CV 79%

From Frames to Clips: Training-free Adaptive Key Clip Selection for Long-Form Video Understanding

从帧到片段:训练免费的自适应关键片段选择用于长形式视频理解

Guangyu Sun, Archit Singhal, Burak Uzkent, Mubarak Shah, Chen Chen, Garin Kessler

机构 * Amazon(亚马逊公司) University of Central Florida(中央佛罗里达大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 F2C通过自适应关键片段选择提升长视频理解,比均匀采样在多个基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 2 篇

2512.16920 2025-12-19 cs.CV cs.AI 57%

EasyV2V: A High-quality Instruction-based Video Editing Framework

EasyV2V: 一种高质量的基于指令的视频编辑框架

Jinjie Mai, Chaoyang Wang, Guocheng Gordon Qian, Willi Menapace, Sergey Tulyakov, Bernard Ghanem, Peter Wonka, Ashkan Mirzaei

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 EasyV2V通过简化设计和灵活输入实现高质量视频编辑,超越现有系统。

Comments Project page: https://snap-research.github.io/easyv2v/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16776 2025-12-19 cs.CV 57%

Kling-Omni Technical Report

Kling-Omni 技术报告

Kling Team, Jialu Chen, Yuanzheng Ci, Xiangyu Du, Zipeng Feng, Kun Gai, Sainan Guo, Feng Han, Jingbin He, Kang He, Xiao Hu, Xiaohua Hu, Boyuan Jiang, Fangyuan Kong, Hang Li, Jie Li, Qingyu Li, Shen Li, Xiaohan Li, Yan Li, Jiajun Liang, Borui Liao, Yiqiao Liao, Weihong Lin, Quande Liu, Xiaokun Liu, Yilun Liu, Yuliang Liu, Shun Lu, Hangyu Mao, Yunyao Mao, Haodong Ouyang, Wenyu Qin, Wanqi Shi, Xiaoyu Shi, Lianghao Su, Haozhi Sun, Peiqin Sun, Pengfei Wan, Chao Wang, Chenyu Wang, Meng Wang, Qiulin Wang, Runqi Wang, Xintao Wang, Xuebo Wang, Zekun Wang, Min Wei, Tiancheng Wen, Guohao Wu, Xiaoshi Wu, Zhenhua Wu, Da Xie, Yingtong Xiong, Yulong Xu, Sile Yang, Zikang Yang, Weicai Ye, Ziyang Yuan, Shenglong Zhang, Shuaiyu Zhang, Yuanxing Zhang, Yufan Zhang, Wenzheng Zhao, Ruiliang Zhou, Yan Zhou, Guosheng Zhu, Yongjie Zhu

机构 * Kling Team(Kling团队)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Kling-Omni 是一种通用生成框架,通过多模态视觉语言输入直接合成高质量视频,整合视频生成、编辑和智能推理任务,实现电影级内容创作。

Comments Kling-Omni Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 4 篇

2512.16093 2025-12-19 cs.CV cs.AI cs.LG 79%

TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times

TurboDiffusion:通过100-200倍加速视频扩散模型

Jintao Zhang, Kaiwen Zheng, Kai Jiang, Haoxu Wang, Ion Stoica, Joseph E. Gonzalez, Jianfei Chen, Jun Zhu

机构 * Tsinghua University(清华大学) Shengshu Technology(盛舒科技) UC Berkeley(加州大学伯克利分校)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 TurboDiffusion通过低比特注意力、步骤蒸馏和W8A8量化等技术,实现视频扩散模型100-200倍加速并保持视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16900 2025-12-19 cs.CV 57%

FlashPortrait: 6x Faster Infinite Portrait Animation with Adaptive Latent Prediction

FlashPortrait: 6倍更快的无限人物动画生成

Shuyuan Tu, Yueming Pan, Yinming Huang, Xintong Han, Zhen Xing, Qi Dai, Kai Qiu, Chong Luo, Zuxuan Wu

机构 * Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Xi’an Jiaotong University(西安交通大学) Tencent Inc.(腾讯公司) Tongyi Lab, Alibaba Group(阿里云通义实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 FlashPortrait通过归一化面部表情块和动态滑动窗口方案,实现6倍加速的无限长人物动画生成,保持身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16023 2025-12-19 cs.CV 57%

CoVAR: Co-generation of Video and Action for Robotic Manipulation via Multi-Modal Diffusion

CoVAR: 通过多模态扩散生成视频与动作用于机器人操作

Liudi Yang, Yang Bai, George Eskandar, Fengyi Shen, Mohammad Altillawi, Dong Chen, Ziyuan Liu, Abhinav Valada

机构 * University of Freiburg(弗赖堡大学) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Technical University of Munich(慕尼黑技术大学) Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 CoVAR通过多模态扩散模型生成视频与动作,解决机器人操作中动作标注不足的问题,提升视频生成质量与动作精度。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06833 2025-12-19 cs.CV 57%

ConsistTalk: Intensity Controllable Temporally Consistent Talking Head Generation with Diffusion Noise Search

ConsistTalk: 可控强度的时序一致说话头生成与扩散噪声搜索

Zhenjie Liu, Jianzhang Lu, Renjie Lu, Cong Liang, Shangfei Wang

机构 * The corresponding author.(通讯作者)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 ConsistTalk通过引入光流引导时间模块、音频到强度模型和扩散噪声初始化策略,实现了可控强度和时序一致的说话头生成,有效减少闪烁并提升音频视频同步质量。

Comments AAAI26 poster

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 1 篇

2512.16891 2025-12-19 cs.CV cs.AI cs.IR cs.LG cs.MM 62%

LinkedOut: Linking World Knowledge Representation Out of Video LLM for Next-Generation Video Recommendation

LinkedOut: 从视频大语言模型中提取世界知识表示以实现下一代视频推荐

Haichao Zhang, Yao Lu, Lichen Wang, Yunzhe Li, Daiwei Chen, Yunpeng Xu, Yun Fu

机构 * Northeastern University(东北大学) LinkedIn(领英) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 LinkedOut通过从视频中提取世界知识表示,实现低延迟、多视频输入的视频推荐,无需人工标注,取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 1 篇

2512.16397 2025-12-19 cs.CV cs.AI cs.GR 57%

Using Gaussian Splats to Create High-Fidelity Facial Geometry and Texture

利用高斯散点创建高质量的面部几何和纹理

Haodi He, Jihun Yu, Ronald Fedkiw

机构 * Epic Games, Stanford University(Epic Games、斯坦福大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出利用高斯散点重建高质量面部几何与纹理,通过约束三角化表面并解耦纹理与光照,实现高保真视觉效果。

Comments Submitted to CVPR 2026. 21 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 1 篇

2508.17468 2025-12-19 cs.CV cs.AI cs.LG cs.RO 57%

A Synthetic Dataset for Manometry Recognition in Robotic Applications

用于机器人应用的测压识别合成数据集

Pedro Antonio Rabelo Saraiva, Enzo Ferreira de Souza, Joao Manoel Herrera Pinheiro, Thiago H. Segreto, Ricardo V. Godoy, Marcelo Becker

机构 * University of São Paulo(圣保罗大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本文提出了一种混合数据合成方法,通过结合过程渲染和AI驱动视频生成,提升机器人应用中测压识别的训练效果和可靠性。

Journal ref 2025 Latin American Robotics Symposium (LARS)

详情

展开后加载摘要…

URL PDF HTML 收藏