arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-03 至 2026-02-03 共收录 15 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2602.02341 2026-02-03 cs.CV 70%

LongVPO: From Anchored Cues to Self-Reasoning for Long-Form Video Preference Optimization

LongVPO:从锚定线索到自我推理的长视频偏好优化

Zhenpeng Huang, Jiaqi Li, Zihan Jia, Xinhao Li, Desen Meng, Lingxue Song, Xi Chen, Liang Li, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) JIUTIAN Research(Jiutian研究) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 LongVPO通过两阶段直接偏好优化框架,利用合成数据和递归标注流程,在无需长视频标注的情况下实现高效长视频理解,优于现有开源模型并保持短视频性能。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01369 2026-02-03 cs.CV 57%

Exposing and Defending the Achilles' Heel of Video Mixture-of-Experts

揭示视频混合专家架构的薄弱环节

Songping Wang, Qinglong Liu, Yueming Lyu, Ning Li, Ziwen He, Caifeng Shan

机构 * Nanjing University(南京大学) China Mobile Information Technology Co., Ltd.(中国移动信息科技有限公司) Nanjing University of Information Science and Technology(南京信息科技大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出TLGA和J-TLAT方法,揭示视频MoE模型的独立和协作性弱点,并通过联合对抗训练提升其鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 4 篇

2602.01623 2026-02-03 cs.CV 83%

Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?

Omni-Judge: 能否将 Omni-LLMs 用作文本条件音频视频生成的人类对齐裁判?

Susan Liang, Chao Huang, Filippos Bellos, Yolo Yunlong Tang, Qianxiang Shen, Jing Bi, Luchuan Song, Zeliang Zhang, Jason Corso, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 Omni-Judge 评估 Omni-LLMs 是否能作为文本条件音频视频生成的人类对齐裁判,展现其在多模态评估中的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01814 2026-02-03 cs.CV 79%

GPD: Guided Progressive Distillation for Fast and High-Quality Video Generation

GPD: 用于快速高质量视频生成的引导渐进蒸馏

Xiao Liang, Yunzhu Zhang, Linchao Zhu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 GPD通过引导渐进蒸馏方法,减少视频生成的采样步骤,同时保持高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21408 2026-02-03 cs.CV 57%

MPF-Net: Exposing High-Fidelity AI-Generated Video Forgeries via Hierarchical Manifold Deviation and Micro-Temporal Fluctuations

MPF-Net:通过分层流形偏差和微时间波动暴露高保真AI生成视频伪造

Xinan He, Kaiqing Lin, Yue Zhou, Jiaming Zhong, Wei Ye, Wenhui Yi, Bing Fan, Feng Ding, Haodong Li, Bo Cao, Bin Li

机构 * Nanchang University(南昌大学) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen Key Laboratory of Media Security(广东省智能信息处理重点实验室、深圳媒体安全重点实验室) SZU AFS Joint Innovation Center for AI Technology, Shenzhen University(SZU AFS人工智能技术联合创新中心、深圳大学) Huazhong University of Science(华中科技大学) University of North Texas(北卡罗来纳州立大学) The Smart City Research institute of China Electronics Technology Group Corporation, shenzhen(中国电子科技集团有限公司智慧城市研究院,深圳)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 MPF-Net通过分层流形偏差和微时间波动检测高保真AI生成视频伪造。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10942 2026-02-03 cs.CV 57%

VL-JEPA: Joint Embedding Predictive Architecture for Vision-language

VL-JEPA:面向视觉-语言的联合嵌入预测架构

Delong Chen, Mustafa Shukor, Theo Moutakanni, Willy Chung, Jade Yu, Tejaswi Kasarla, Yejin Bang, Allen Bolourchi, Yann LeCun, Pascale Fung

机构 * Meta FAIR HKUST(香港科技大学) Sorbonne Université(索邦大学) NYU(纽约大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 VL-JEPA通过联合嵌入预测架构,在减少参数的情况下实现更强的视觉-语言性能,支持多种任务且无需架构修改。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 7 篇

2511.18537 2026-02-03 cs.CV 83%

Zero-Shot Video Deraining with Video Diffusion Models

无监督视频去雨与视频扩散模型

Tuomas Varanka, Juan Luis Gonzalez, Hyeongwoo Kim, Pablo Garrido, Xu Yao

机构 * University of Oulu(奥卢大学) Flawless AI Imperial College London(伦敦帝国理工学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出了一种无需合成数据和模型微调的无监督视频去雨方法,通过预训练文本到视频扩散模型,利用注意力切换机制提升动态场景中的去雨效果。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02092 2026-02-03 cs.CV 74%

FSVideo: Fast Speed Video Diffusion Model in a Highly-Compressed Latent Space

FSVideo: 一种在高度压缩潜在空间中的快速速度视频扩散模型

FSVideo Team, Qingyu Chen, Zhiyuan Fang, Haibin Huang, Xinwei Huang, Tong Jin, Minxuan Lin, Bo Liu, Celong Liu, Chongyang Ma, Xing Mei, Xiaohui Shen, Yaojie Shen, Fuwen Tan, Angtian Wang, Xiao Yang, Yiding Yang, Jiamin Yuan, Lingxi Zhang, Yuxin Zhang

机构 * FSVideo Team Intelligent Creation(FSVideo团队智能创作)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 FSVideo通过高度压缩的潜在空间和改进的扩散Transformer架构,在速度和质量上实现了高效视频生成。

Comments Project Page: https://kingofprank.github.io/fsvideo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00267 2026-02-03 cs.CV cs.AI 74%

PLACID: Identity-Preserving Multi-Object Compositing via Video Diffusion with Synthetic Trajectories

PLACID:通过视频扩散与合成轨迹实现身份保持的多物体合成

Gemma Canet Tarrés, Manel Baradad, Francesc Moreno-Noguer, Yumeng Li

机构 * Amazon Barcelona(亚马逊巴塞罗那)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 PLACID通过视频扩散与合成轨迹实现多物体合成,保持物体身份和背景细节,提升合成效果与视觉吸引力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01723 2026-02-03 cs.CV 57%

FastPhysGS: Accelerating Physics-based Dynamic 3DGS Simulation via Interior Completion and Adaptive Optimization

FastPhysGS: 通过内部补全与自适应优化加速基于物理的动态3DGS仿真

Yikun Ma, Yiqing Li, Jingwen Ye, Zhongkai Wu, Weidong Zhang, Lin Gao, Zhi Jin

机构 * School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University(中山大学智能系统工程学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Guangdong Provincial Key Laboratory of Fire Science(广东省消防科学与智能应急技术重点实验室) Guangdong Provincial Key Laboratory of Robotics(广东省机器人与数字智能制造技术重点实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 FastPhysGS通过内部补全与自适应优化,实现了基于物理的动态3DGS仿真的高效与稳健,提升了仿真精度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01340 2026-02-03 cs.CV 57%

MTC-VAE: Multi-Level Temporal Compression with Content Awareness

MTC-VAE:具有内容意识的多级时间压缩

Yubo Dong, Linchao Zhu

机构 * ReLER, CCAI, Zhejiang University(ReLER、CCAI、浙江大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 MTC-VAE通过多级时间压缩技术提升视频压缩效率,结合内容意识方法实现高效压缩与性能优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01329 2026-02-03 cs.CV 57%

FlowCast: Trajectory Forecasting for Scalable Zero-Cost Speculative Flow Matching

FlowCast: 为可扩展的零成本推测性流匹配进行轨迹预测

Divya Jyoti Bajpai, Shubham Agarwal, Apoorv Saxena, Kuldeep Kulkarni, Subrata Mitra, Manjesh Kumar Hanawal

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔分校) University of California, Berkeley(加州大学伯克利分校) Inception Labs(Inception实验室) Adobe Research India(Adobe印度研究)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 FlowCast通过利用流匹配模型保持恒定速度的特性,实现无需训练的高效推理,提升图像生成等任务的速度2.5倍,同时保持质量。

Comments Accepted at International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00440 2026-02-03 cs.CV cs.LG cs.RO 57%

DISK: Dynamic Inference SKipping for World Models

DISK:用于世界模型的动态推理跳过

Anugunj Naman, Gaibo Zhang, Ayushman Singh, Yaguang Zhang

机构 * Purdue University, West Lafayette, United States(普渡大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 DISK通过动态推理跳过技术,在无需训练的情况下提升自回归世界模型的视频和轨迹预测效率,同时保持预测精度和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 2 篇

2602.00268 2026-02-03 cs.CV cs.AI 88%

TokenTrim: Inference-Time Token Pruning for Autoregressive Long Video Generation

TokenTrim: 自回归长视频生成中的推理时标记修剪

Ariel Shaulov, Eitan Shaar, Amit Edenzon, Lior Wolf

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 TokenTrim通过在推理时修剪不稳定潜在标记,减少自回归长视频生成中的时序漂移,提升长时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01683 2026-02-03 cs.CV cs.AI 79%

FreshMem: Brain-Inspired Frequency-Space Hybrid Memory for Streaming Video Understanding

FreshMem: 基于大脑的频率-空间混合内存用于流视频理解

Kangcong Li, Peng Ye, Lin Zhang, Chao Wang, Huafeng Qin, Tao Chen

机构 * College of Future Information Technology, Fudan University, Shanghai, China(复旦大学未来信息科技学院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学)

专题命中 长视频与时序推理 :video understanding(title,abstract);分类 cs.CV

AI总结 FreshMem通过频率-空间混合内存网络,提升流视频理解的连续感知能力,实现短期保真与长期一致性的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏