arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-08-14 至 2025-08-14 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2 篇

2508.03034 2025-08-14 cs.CV 88%

MoCA: Identity-Preserving Text-to-Video Generation via Mixture of Cross Attention

Qi Xie, Yongjia Ma, Donglin Di, Xuehao Gao, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) Li Auto(利汽车) Northwestern Polytechnical University(西北工业大学)

专题命中 视频生成 :text-to-video(title,abstract);video generation(title);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12341 2025-08-14 cs.MM 57%

Multimodal LLM-based Query Paraphrasing for Video Search

Jiaxin Wu, Chong-Wah Ngo, Wing-Kwong Chan, Sheng-Hua Zhong, Xiong-Yong Wei, Qing Li

专题命中 视频生成 :text-to-video(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频扩散模型 1 篇

2508.09667 2025-08-14 cs.CV 79%

GSFixer: Improving 3D Gaussian Splatting with Reference-Guided Video Diffusion Priors

Xingyilang Yin, Qi Zhang, Jiahao Chang, Ying Feng, Qingnan Fan, Xi Yang, Chi-Man Pun, Huaqi Zhang, Xiaodong Cun

机构 * University of Macau(澳门大学) VIVO CUHKSZ(香港中文大学) Xidian University(西安电子科技大学) GVC Lab, Great Bay University(大澳大学GVC实验室)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频数据与评测 1 篇

2503.18923 2025-08-14 cs.CV 79%

Video SimpleQA: Towards Factuality Evaluation in Large Video Language Models

Meng Cao, Pengfei Hu, Yingyao Wang, Jihao Gu, Haoran Tang, Haoze Zhao, Chen Wang, Jiahua Dong, Wangbo Yu, Ge Zhang, Jun Song, Xiang Li, Bo Zheng, Ian Reid, Xiaodan Liang

专题命中 视频数据与评测 :video language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏