arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-09 至 2026-01-09 共收录 5 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 5 篇

2601.04778 2026-01-09 cs.CV cs.AI cs.CL cs.MM 88%

CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models

CounterVid: 通过生成反事实视频缓解视频-语言模型中动作和时间幻觉

Tobia Poppi, Burak Uzkent, Amanmeet Garg, Lucas Porto, Garin Kessler, Yezhou Yang, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara, Florian Schiffers

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(帕尔马大学) Amazon Prime Video(亚马逊Prime视频)

专题命中 视频生成 :video generation(title,abstract);video-language(title,abstract);分类 cs.CV、cs.MM

AI总结 CounterVid通过生成反事实视频缓解视频-语言模型中动作和时间幻觉问题,提出反事实视频生成框架和MixDPO方法,提升时间推理和动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01568 2026-01-09 cs.SD cs.AI cs.CV cs.MM eess.AS 81%

MM-Sonate: Multimodal Controllable Audio-Video Generation with Zero-Shot Voice Cloning

MM-Sonate: 多模态可控音频视频生成与零样本语音克隆

Chunyu Qiang, Jun Wang, Xiaopeng Wang, Kang Yin, Yuxin Guo

机构 * Kuaishou Technology(快手科技)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 MM-Sonate通过统一的指令-音素输入实现可控的音频视频联合生成与零样本语音克隆,显著提升唇形同步和语音可懂度,同时保持与专门文本到语音系统的语音克隆保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05239 2026-01-09 cs.CV 79%

Plenoptic Video Generation

光场视频生成

Xiao Fu, Shitao Tang, Min Shi, Xian Liu, Jinwei Gu, Ming-Yu Liu, Dahua Lin, Chen-Hsuan Lin

机构 * NVIDIA The Chinese University of Hong Kong(香港中文大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 PlenopticDreamer通过多输入单输出视频条件模型和相机引导检索策略,实现高质量多视角视频重绘,提升时空一致性和视角转换能力。

Comments Project Page: https://research.nvidia.com/labs/dir/plenopticdreamer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04359 2026-01-09 cs.CV 79%

PackCache: A Training-Free Acceleration Method for Unified Autoregressive Video Generation via Compact KV-Cache

PackCache: 一种无需训练的统一自回归视频生成加速方法通过紧凑的KV缓存

Kunyang Li, Mubarak Shah, Yuzhang Shang

机构 * Institute of Artificial Intelligence, University of Central Florida(人工智能学院,中央佛罗里达大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 PackCache通过动态压缩KV缓存提升统一自回归视频生成效率,显著加速长序列生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05241 2026-01-09 cs.CV cs.AI cs.RO 74%

RoboVIP: Multi-View Video Generation with Visual Identity Prompting Augments Robot Manipulation

RoboVIP: 多视角视频生成与视觉身份提示增强机器人操作

Boyang Wang, Haoran Zhang, Shujie Zhang, Jinkun Hao, Mingda Jia, Qi Lv, Yucheng Mao, Zhaoyang Lyu, Jia Zeng, Xudong Xu, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) University of Michigan(密歇根大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 RoboVIP通过引入视觉身份提示和可扩展的视觉身份池,提升机器人操控数据的质量与多样性,从而增强视觉语言-动作和视觉-运动政策模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏