arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-30 至 2025-12-30 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 2 篇

2507.05822 2025-12-30 cs.CV 57%

Video Event Reasoning and Prediction by Fusing World Knowledge from LLMs with Vision Foundation Models

通过融合来自LLM的世界知识与视觉基础模型进行视频事件推理与预测

L'ea Dubois, Klaus Schmidt, Chengyu Wang, Ji-Hoon Park, Lin Wang, Santiago Munoz

机构 * INRIA(法国国家信息与自动化研究所) Max Planck Institute for Intelligent Systems(人工智能研究所) San Francisco State University(旧金山州立大学) Seoul AI Institute (SAII)(首尔人工智能研究所) Vision & Robotics Center, Tsinghua University(清华大学视觉与机器人中心) Polytechnic University of Madrid(马德里理工大学)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出融合视觉基础模型与LLM的世界知识,以提升视频事件推理与预测能力,实现从简单识别到高级认知理解的突破。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22688 2025-12-30 cs.CV 57%

Autoregressive Flow Matching for Motion Prediction

自回归流匹配用于运动预测

Johnathan Xie, Stefan Stojanov, Cristobal Eyzaguirre, Daniel L. K. Yamins, Jiajun Wu

机构 * Stanford University(斯坦福大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 ARFM通过自回归流匹配方法,利用多样化视频数据集预测复杂运动,提升机器人和人类动作预测的下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏