arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-24 至 2026-02-24 共收录 5 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 5 篇

2602.18702 2026-02-24 cs.CV cs.AI 89%

Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding

基于接地的思考:用于长视频理解的课程强化推理与视频接地

Houlun Chen, Xin Wang, Guangyao Li, Yuwei Zhou, Yihan Chen, Jia Jia, Wenwu Zhu

机构 * Tsinghua University(清华大学)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);video reasoning(abstract);分类 cs.CV

AI总结 Video-TwG通过课程强化框架和接地范式提升长视频理解,采用双阶段策略和TwG-GRPO算法优化推理与接地质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16210 2026-02-24 cs.CV cs.AI 85%

PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation

PyraTok: 用于视频理解和生成的语言对齐金字塔分词器

Onkar Susladkar, Tushar Prakash, Adheesh Juvekar, Kiet A. Nguyen, Dong-Hwan Jang, Inderjit S Dhillon, Ismini Lourentzou

专题命中 视频理解 :video understanding(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 PyraTok通过多尺度文本引导量化和全局自回归目标,实现了视频理解和生成中语言与视觉的紧密对齐,提升了视频重建和零样本迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16412 2026-02-24 cs.CV 79%

ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understanding

ReMoRa:基于精细运动表示的多模态大语言模型用于长视频理解

Daichi Yashima, Shuhei Kurita, Yusuke Oda, Komei Sugiura

机构 * Keio University(庆应大学) NII(日本信息处理学会) NII LLMC(日本信息处理学会语言模型中心)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 ReMoRa通过精细运动表示实现长视频理解,有效压缩视频数据并提升多模态大语言模型性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18977 2026-02-24 cs.CV 74%

Frame2Freq: Spectral Adapters for Fine-Grained Video Understanding

Frame2Freq: 用于细粒度视频理解的频谱适配器

Thinesh Thiyakesan Ponbagavathi, Constantin Seibold, Alina Roitberg

机构 * Institute for Artificial Intelligence, University of Stuttgart(斯图加特大学人工智能研究所) University Hospital Heidelberg, Diagnostic and Interventional Radiology(海德堡大学医院放射诊断与介入科) Intelligent Assistive Systems Lab, University of Hildesheim(希尔德斯海姆大学智能辅助系统实验室)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 Frame2Freq通过频谱编码提升细粒度视频理解,利用FFT和频率带嵌入改进动作识别性能。

Comments Accepted to CVPR 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19184 2026-02-24 cs.RO 50%

Human-to-Robot Interaction: Learning from Video Demonstration for Robot Imitation

人机交互:从视频演示中学习机器人模仿

Thanh Nguyen Canh, Thanh-Tuan Tran, Haolan Zhang, Ziyan Gao, Nak Young Chong, Xiem HoangVan

专题命中 视频理解 :video understanding(abstract)

AI总结 本研究提出了一种基于视频演示的机器人模仿学习方法,通过模块化框架结合时间位移模块和深度强化学习,实现机器人从无结构视频中学习基本操作技能。

详情

展开后加载摘要…

URL PDF HTML 收藏