arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-12 至 2025-12-12 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 2 篇

2512.10617 2025-12-12 cs.CV 57%

Lang2Motion: Bridging Language and Motion through Joint Embedding Spaces

Lang2Motion: 通过联合嵌入空间连接语言与运动

Bishoy Galoaa, Xiangyu Bai, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 Lang2Motion通过联合嵌入空间连接语言与运动,利用文本描述和视觉化监督生成高精度的轨迹,实现跨领域运动迁移和风格编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05537 2025-12-12 cs.CV cs.AI 57%

Towards Efficient Real-Time Video Motion Transfer via Generative Time Series Modeling

通过生成时间序列建模实现高效的实时视频运动迁移

Tasmiah Haque, Md. Asif Bin Syed, Byungheon Jeong, Xue Bai, Sumit Mohan, Somdyuti Paul, Imtiaz Ahmed, Srinjoy Das

机构 * Coupa Software(Coupa软件) Intel Corporation(英特尔公司)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本研究提出基于生成时间序列模型的实时视频运动迁移框架,通过关键点预测和光流模块实现高效低帧率视频传输,提升带宽效率与视频生成的可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏