arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-03 至 2026-02-03 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 4 篇

2602.01623 2026-02-03 cs.CV 83%

Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?

Omni-Judge: 能否将 Omni-LLMs 用作文本条件音频视频生成的人类对齐裁判?

Susan Liang, Chao Huang, Filippos Bellos, Yolo Yunlong Tang, Qianxiang Shen, Jing Bi, Luchuan Song, Zeliang Zhang, Jason Corso, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 Omni-Judge 评估 Omni-LLMs 是否能作为文本条件音频视频生成的人类对齐裁判,展现其在多模态评估中的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01814 2026-02-03 cs.CV 79%

GPD: Guided Progressive Distillation for Fast and High-Quality Video Generation

GPD: 用于快速高质量视频生成的引导渐进蒸馏

Xiao Liang, Yunzhu Zhang, Linchao Zhu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 GPD通过引导渐进蒸馏方法,减少视频生成的采样步骤,同时保持高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21408 2026-02-03 cs.CV 57%

MPF-Net: Exposing High-Fidelity AI-Generated Video Forgeries via Hierarchical Manifold Deviation and Micro-Temporal Fluctuations

MPF-Net:通过分层流形偏差和微时间波动暴露高保真AI生成视频伪造

Xinan He, Kaiqing Lin, Yue Zhou, Jiaming Zhong, Wei Ye, Wenhui Yi, Bing Fan, Feng Ding, Haodong Li, Bo Cao, Bin Li

机构 * Nanchang University(南昌大学) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen Key Laboratory of Media Security(广东省智能信息处理重点实验室、深圳媒体安全重点实验室) SZU AFS Joint Innovation Center for AI Technology, Shenzhen University(SZU AFS人工智能技术联合创新中心、深圳大学) Huazhong University of Science(华中科技大学) University of North Texas(北卡罗来纳州立大学) The Smart City Research institute of China Electronics Technology Group Corporation, shenzhen(中国电子科技集团有限公司智慧城市研究院,深圳)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 MPF-Net通过分层流形偏差和微时间波动检测高保真AI生成视频伪造。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10942 2026-02-03 cs.CV 57%

VL-JEPA: Joint Embedding Predictive Architecture for Vision-language

VL-JEPA:面向视觉-语言的联合嵌入预测架构

Delong Chen, Mustafa Shukor, Theo Moutakanni, Willy Chung, Jade Yu, Tejaswi Kasarla, Yejin Bang, Allen Bolourchi, Yann LeCun, Pascale Fung

机构 * Meta FAIR HKUST(香港科技大学) Sorbonne Université(索邦大学) NYU(纽约大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 VL-JEPA通过联合嵌入预测架构,在减少参数的情况下实现更强的视觉-语言性能,支持多种任务且无需架构修改。

详情

展开后加载摘要…

URL PDF HTML 收藏