Gaussian Temporal Awareness Networks for Action Localization
专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV
Comments CVPR 2019 Oral
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV
Comments CVPR 2019 Oral
专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV
Comments CVPR-2019 (oral)
专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV
专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV
Comments Accepted for presentation at ICCV. Project Page: https://mwray.github.io/FGAR
专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV
Comments Accepted at ICCV 2019
专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV
Comments Accepted by IJCAI 2019 as a poster paper
专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV
Comments Accepted by CVPR'19
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
Comments CVPR 2019 Camera Ready
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
Comments CVPR Workshop on Computer Vision in Sports 2018
专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV
Comments 14 pages, 11 figures
专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV
Comments Accepted to ECCV 2018
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV
Comments ACM MM 2017
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
Comments IEEE International Conference on Computer Vision and Pattern Recognition CVPR 2017 Workshops
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
Comments IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2016
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
Comments CVPR 2016
专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV
Comments Technical report
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
Comments To appear in CVPR 2015
专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
Journal ref Computer and Information Sciences II Computer and Information Sciences II, pp 403-410, 2012
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
Comments 21 pages, 16 figures
保留未来,放弃展开:面向世界动作模型的RIFT
专题命中 动作与事件理解 :video generation(abstract)
AI总结 本文针对世界动作模型部署延迟问题,提出RIFT方法,通过学习的预期标记一次构建未来K/V缓存,在LIBERO、RoboTwin 2.0任务上实现高成功率且大幅降低动作块延迟。
无视觉前瞻:面向世界动作模型的潜在未来
机构 * Shanghai Jiao Tong University(上海交通大学) ; ACE Robotics(ACE机器人公司) ; Nanyang Technological University(南洋理工大学)
专题命中 动作与事件理解 :video generation(abstract)
AI总结 本文提出ForeWAM,一种动力学条件下的直接策略WAM,通过Future-KV和动力学寄存器在无需显式生成未来视频的情况下,使直接策略WAMs兼具高效动作预测与预测动力学暴露能力,在LIBERO和LIBERO-Plus上取得高成功率。
Comments 12 pages, 3 figures
TOPReward: 令牌概率作为机器人学中的隐式零样本奖励
机构 * University of Washington(华盛顿大学) ; Allen Institute for AI(人工智能研究所) ; Amazon(亚马逊) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 动作与事件理解 :video-language(abstract)
AI总结 TOPReward通过利用预训练视频视觉-语言模型的令牌概率,提供高效的零样本奖励估计,显著提升机器人任务进度评估的性能和泛化能力。
AeroAct:用于语言条件四旋翼飞行的以动作中心的世界-动作模型
机构 * School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) ; School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院)
专题命中 动作与事件理解 :video diffusion(abstract)
AI总结 研究语言条件下四旋翼飞行问题,提出AeroAct模型,利用预训练视频扩散Transformer,结合相关采集设备和程序获取数据,经实验验证该模型能提升四旋翼飞行的目标跟踪和物体搜索性能,且对应策略可在实体四旋翼上执行。