arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-08-14 至 2025-08-14 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2 篇

2508.03034 2025-08-14 cs.CV 88%

MoCA: Identity-Preserving Text-to-Video Generation via Mixture of Cross Attention

Qi Xie, Yongjia Ma, Donglin Di, Xuehao Gao, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) Li Auto(利汽车) Northwestern Polytechnical University(西北工业大学)

专题命中 视频生成 :text-to-video(title,abstract);video generation(title);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12341 2025-08-14 cs.MM 57%

Multimodal LLM-based Query Paraphrasing for Video Search

Jiaxin Wu, Chong-Wah Ngo, Wing-Kwong Chan, Sheng-Hua Zhong, Xiong-Yong Wei, Qing Li

专题命中 视频生成 :text-to-video(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏