arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-03 至 2025-12-03 共收录 1 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 1 篇

2512.02576 2025-12-03 cs.CV 74%

Co-speech Gesture Video Generation via Motion-Based Graph Retrieval

通过基于运动的图检索生成同步语音手势视频

Yafei Song, Peng Zhang, Bang Zhang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 动作与事件理解 :video generation(title);分类 cs.CV

AI总结 本文提出基于运动图检索和扩散模型生成同步语音手势视频,通过提取音频特征和运动分布提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏