arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-06 至 2026-01-06 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2509.18754 2026-01-06 cs.CV cs.AI 57%

COLT: Enhancing Video Large Language Models with Continual Tool Usage

COLT: 通过持续工具使用增强视频大语言模型

Yuyang Liu, Meng Cao, Xinyuan Shi, Xiaondan Liang

机构 * University of Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed大学人工智能学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 COLT通过持续工具使用增强视频大语言模型,解决工具数据持续变化的问题,提升视频理解性能。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00887 2026-01-06 cs.CV 57%

VideoCuRL: Video Curriculum Reinforcement Learning with Orthogonal Difficulty Decomposition

VideoCuRL: 通过正交难度分解实现视频课程强化学习

Hongbo Jin, Kuanwei Lin, Wenhao Zhang, Yichen Jin, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 VideoCuRL通过正交分解视频理解中的视觉复杂性和认知复杂性,提出了一种新的课程强化学习框架,提升了视频推理和感知任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏