arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-03 至 2026-02-03 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2602.02341 2026-02-03 cs.CV 70%

LongVPO: From Anchored Cues to Self-Reasoning for Long-Form Video Preference Optimization

LongVPO:从锚定线索到自我推理的长视频偏好优化

Zhenpeng Huang, Jiaqi Li, Zihan Jia, Xinhao Li, Desen Meng, Lingxue Song, Xi Chen, Liang Li, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) JIUTIAN Research(Jiutian研究) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 LongVPO通过两阶段直接偏好优化框架,利用合成数据和递归标注流程,在无需长视频标注的情况下实现高效长视频理解,优于现有开源模型并保持短视频性能。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01369 2026-02-03 cs.CV 57%

Exposing and Defending the Achilles' Heel of Video Mixture-of-Experts

揭示视频混合专家架构的薄弱环节

Songping Wang, Qinglong Liu, Yueming Lyu, Ning Li, Ziwen He, Caifeng Shan

机构 * Nanjing University(南京大学) China Mobile Information Technology Co., Ltd.(中国移动信息科技有限公司) Nanjing University of Information Science and Technology(南京信息科技大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出TLGA和J-TLAT方法,揭示视频MoE模型的独立和协作性弱点,并通过联合对抗训练提升其鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏