arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-09-18 至 2025-09-18 共收录 1 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 1 篇

2405.19988 2025-09-18 cs.RO cs.AI cs.CL cs.CV cs.LG 79%

Video-Language Critic: Transferable Reward Functions for Language-Conditioned Robotics

Minttu Alakuijala, Reginald McLean, Isaac Woungang, Nariman Farsad, Samuel Kaski, Pekka Marttinen, Kai Yuan

机构 * Department of Computer Science, Aalto University(艾尔沃斯大学计算机科学系) Department of Computer Science, Toronto Metropolitan University(多伦多 Metropolitan 大学计算机科学系) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Intel Corporation(英特尔公司)

专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV

Comments 14 pages in the main text, 22 pages including references and supplementary materials. 3 figures and 3 tables in the main text, 6 figures and 3 tables in supplementary materials

Journal ref Transactions on Machine Learning Research (TMLR) (02/2025)

详情

展开后加载摘要…

URL PDF HTML 收藏