arXivDaily arXiv每日学术速递 周一至周五更新

作者

Ross Girshick

Computer Vision

共收录 76 篇
2511.04668 2025-11-17 cs.CV

SIMS-V: Simulated Instruction-Tuning for Spatial Video Understanding

SIMS-V:面向空间视频理解的模拟指令微调

Ellis Brown, Arijit Ray, Ranjay Krishna, Ross Girshick, Rob Fergus, Saining Xie

机构 * New York University(纽约大学) ; Boston University(波士顿大学) ; AllenAI ; Vercept

AI总结 针对多模态语言模型的时空空间推理难题,提出SIMS-V模拟数据生成框架,通过消融实验确定三类关键问题类别,仅用25K模拟样本微调的7B模型在真实空间推理基准上优于72B基线并媲美专有模型,实现高效迁移与泛化。

Comments Project page: https://ellisbrown.github.io/sims-v

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17146 2024-12-06 cs.CV cs.CL cs.LG

Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models

Molmo和PixMo:面向最先进视觉语言模型的开放权重与开放数据

Matt Deitke, Christopher Clark, Sangho Lee, Rohun Tripathi, Yue Yang, Jae Sung Park, Mohammadreza Salehi, Niklas Muennighoff, Kyle Lo, Luca Soldaini, Jiasen Lu, Taira Anderson, Erin Bransom, Kiana Ehsani, Huong Ngo, YenSung Chen, Ajay Patel, Mark Yatskar, Chris Callison-Burch, Andrew Head, Rose Hendrix, Favyen Bastani, Eli VanderBilt, Nathan Lambert, Yvonne Chou, Arnavi Chheda, Jenna Sparks, Sam Skjonsberg, Michael Schmitz, Aaron Sarnat, Byron Bischoff, Pete Walsh, Chris Newell, Piper Wolters, Tanmay Gupta, Kuo-Hao Zeng, Jon Borchardt, Dirk Groeneveld, Crystal Nam, Sophie Lebrecht, Caitlin Wittlif, Carissa Schoenick, Oscar Michel, Ranjay Krishna, Luca Weihs, Noah A. Smith, Hannaneh Hajishirzi, Ross Girshick, Ali Farhadi, Aniruddha Kembhavi

机构 * University of Washington(华盛顿大学) ; Allen Institute for AI(艾伦人工智能研究所)

AI总结 针对社区缺乏从零构建高性能VLMs基础认知的问题,本文提出开放VLM家族Molmo及未使用外部VLMs的PixMo数据集集合,其72B模型在开放类别中性能领先,还优于多款更大的专有模型,仅次于GPT-4o。

Comments Updated with ablations and more technical details

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00714 2024-10-29 cs.CV cs.AI cs.LG

SAM 2: Segment Anything in Images and Videos

SAM 2:在图像和视频中分割一切

Nikhila Ravi, Valentin Gabeur, Yuan-Ting Hu, Ronghang Hu, Chaitanya Ryali, Tengyu Ma, Haitham Khedr, Roman Rädle, Chloe Rolland, Laura Gustafson, Eric Mintun, Junting Pan, Kalyan Vasudev Alwala, Nicolas Carion, Chao-Yuan Wu, Ross Girshick, Piotr Dollár, Christoph Feichtenhofer

机构 * Meta FAIR

AI总结 本文提出支持图像与视频可提示分割的基础模型 SAM 2,通过交互式数据引擎构建最大视频分割数据集,并以带流式记忆的 transformer 实现更准、更快的分割性能。

Comments Website: https://ai.meta.com/sam2

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.20083 2024-07-01 cs.RO cs.CV

PoliFormer: Scaling On-Policy RL with Transformers Results in Masterful Navigators

PoliFormer:基于Transformer的大规模在线策略强化学习造就精通导航的智能体

Kuo-Hao Zeng, Zichen Zhang, Kiana Ehsani, Rose Hendrix, Jordi Salvador, Alvaro Herrasti, Ross Girshick, Aniruddha Kembhavi, Luca Weihs

机构 * Allen Institute for AI(艾伦人工智能研究所)

AI总结 PoliFormer提出一种基于视觉Transformer和因果解码器的纯RGB室内导航智能体,通过大规模仿真强化学习训练,在多种机器人形态和导航基准上取得最先进结果,并可零微调扩展至多种下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13496 2024-01-26 cs.CV cs.AI cs.LG

The effectiveness of MAE pre-pretraining for billion-scale pretraining

Mannat Singh, Quentin Duval, Kalyan Vasudev Alwala, Haoqi Fan, Vaibhav Aggarwal, Aaron Adcock, Armand Joulin, Piotr Dollár, Christoph Feichtenhofer, Ross Girshick, Rohit Girdhar, Ishan Misra

机构 * Meta AI

Comments ICCV 2023. Models available at https://github.com/facebookresearch/maws/

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.02643 2023-04-06 cs.CV cs.AI cs.LG

Segment Anything

Alexander Kirillov, Eric Mintun, Nikhila Ravi, Hanzi Mao, Chloe Rolland, Laura Gustafson, Tete Xiao, Spencer Whitehead, Alexander C. Berg, Wan-Yen Lo, Piotr Dollár, Ross Girshick

机构 * Meta AI Research, FAIR(Meta人工智能研究院(FAIR))

Comments Project web-page: https://segment-anything.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.16527 2022-06-13 cs.CV

Exploring Plain Vision Transformer Backbones for Object Detection

Yanghao Li, Hanzi Mao, Ross Girshick, Kaiming He

机构 * Facebook AI Research(脸书人工智能研究院)

Comments Tech report. arXiv v2: add RetinaNet results

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.08371 2022-04-05 cs.CV

Revisiting Weakly Supervised Pre-Training of Visual Perception Models

Mannat Singh, Laura Gustafson, Aaron Adcock, Vinicius de Freitas Reis, Bugra Gedik, Raj Prateek Kosaraju, Dhruv Mahajan, Ross Girshick, Piotr Dollár, Laurens van der Maaten

机构 * Meta AI

Comments CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.01066 2022-03-16 cs.CV

Evaluating Large-Vocabulary Object Detectors: The Devil is in the Details

Achal Dave, Piotr Dollár, Deva Ramanan, Alexander Kirillov, Ross Girshick

机构 * Carnegie Mellon University(卡内基梅隆大学) ; Facebook AI Research (FAIR)(脸书人工智能研究院)

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.06377 2021-12-21 cs.CV

Masked Autoencoders Are Scalable Vision Learners

Kaiming He, Xinlei Chen, Saining Xie, Yanghao Li, Piotr Dollár, Ross Girshick

机构 * Facebook AI Research (FAIR)(Facebook 人工智能研究院)

Comments Tech report. arXiv v2: add more transfer learning results; v3: add robustness evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.11429 2021-11-23 cs.CV

Benchmarking Detection Transfer Learning with Vision Transformers

Yanghao Li, Saining Xie, Xinlei Chen, Piotr Dollar, Kaiming He, Ross Girshick

机构 * Facebook AI Research (FAIR)(Facebook人工智能研究院)

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.09887 2021-11-19 cs.CV cs.LG

PyTorchVideo: A Deep Learning Library for Video Understanding

Haoqi Fan, Tullie Murrell, Heng Wang, Kalyan Vasudev Alwala, Yanghao Li, Yilei Li, Bo Xiong, Nikhila Ravi, Meng Li, Haichuan Yang, Jitendra Malik, Ross Girshick, Matt Feiszli, Aaron Adcock, Wan-Yen Lo, Christoph Feichtenhofer

机构 * Facebook AI

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.14881 2021-10-27 cs.CV

Early Convolutions Help Transformers See Better

Tete Xiao, Mannat Singh, Eric Mintun, Trevor Darrell, Piotr Dollár, Ross Girshick

机构 * Facebook AI Research (FAIR)(Facebook AI研究院) ; UC Berkeley(加州大学伯克利分校)

Comments NeurIPS 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.14558 2021-04-30 cs.CV cs.AI cs.LG

A Large-Scale Study on Unsupervised Spatiotemporal Representation Learning

Christoph Feichtenhofer, Haoqi Fan, Bo Xiong, Ross Girshick, Kaiming He

机构 * Facebook AI Research (FAIR)(脸书人工智能研究院(FAIR))

Comments CVPR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.16562 2021-03-31 cs.CV

Boundary IoU: Improving Object-Centric Image Segmentation Evaluation

Bowen Cheng, Ross Girshick, Piotr Dollár, Alexander C. Berg, Alexander Kirillov

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) ; Facebook AI Research (FAIR)(Facebook人工智能研究院)

Comments CVPR 2021, project page: https://bowenc0221.github.io/boundary-iou

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.06877 2021-03-12 cs.CV cs.LG

Fast and Accurate Model Scaling

Piotr Dollár, Mannat Singh, Ross Girshick

机构 * Facebook AI Research (FAIR)(Facebook人工智能研究(FAIR))

Comments CVPR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.07850 2020-08-10 eess.AS cs.CL cs.SD

Large scale weakly and semi-supervised learning for low-resource video ASR

Kritika Singh, Vimal Manohar, Alex Xiao, Sergey Edunov, Ross Girshick, Vitaliy Liptchinsky, Christian Fuegen, Yatharth Saraf, Geoffrey Zweig, Abdelrahman Mohamed

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.12056 2020-08-04 cs.CV cs.LG

Are Labels Necessary for Neural Architecture Search?

Chenxi Liu, Piotr Dollár, Kaiming He, Ross Girshick, Alan Yuille, Saining Xie

机构 * Johns Hopkins University(约翰霍普金斯大学) ; Facebook AI Research(Facebook人工智能研究院)

Comments To appear in ECCV 2020 as spotlight. Code release: https://github.com/facebookresearch/unnas

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.00998 2020-06-11 cs.CV

A Multigrid Method for Efficiently Training Video Models

Chao-Yuan Wu, Ross Girshick, Kaiming He, Christoph Feichtenhofer, Philipp Krähenbühl

Comments CVPR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.13678 2020-03-31 cs.CV cs.LG

Designing Network Design Spaces

Ilija Radosavovic, Raj Prateek Kosaraju, Ross Girshick, Kaiming He, Piotr Dollár

机构 * Facebook AI Research (FAIR)(脸书人工智能研究院)

Comments CVPR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.05722 2020-03-25 cs.CV

Momentum Contrast for Unsupervised Visual Representation Learning

Kaiming He, Haoqi Fan, Yuxin Wu, Saining Xie, Ross Girshick

机构 * Facebook AI Research (FAIR)(Facebook人工智能研究院(FAIR))

Comments CVPR 2020 camera-ready. Code: https://github.com/facebookresearch/moco

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.04297 2020-03-10 cs.CV

Improved Baselines with Momentum Contrastive Learning

Xinlei Chen, Haoqi Fan, Ross Girshick, Kaiming He

机构 * Facebook AI Research (FAIR)(Facebook人工智能研究院(FAIR))

Comments Tech report, 2 pages + references

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.08193 2020-02-18 cs.CV

PointRend: Image Segmentation as Rendering

Alexander Kirillov, Yuxin Wu, Kaiming He, Ross Girshick

机构 * Facebook AI Research (FAIR)(脸书人工智能研究院(FAIR))

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.12367 2020-02-18 cs.CL cs.LG cs.SD eess.AS

Training ASR models by Generation of Contextual Information

Kritika Singh, Dmytro Okhonko, Jun Liu, Yongqiang Wang, Frank Zhang, Ross Girshick, Sergey Edunov, Fuchun Peng, Yatharth Saraf, Geoffrey Zweig, Abdelrahman Mohamed

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.03195 2019-09-17 cs.CV

LVIS: A Dataset for Large Vocabulary Instance Segmentation

Agrim Gupta, Piotr Dollár, Ross Girshick

机构 * Facebook AI Research (FAIR)(Facebook人工智能研究院(FAIR))

Comments Extension of the CVPR'19 paper describing release v0.5, the LVIS Challenge, and baseline results

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.12174 2019-08-29 cs.CV

TensorMask: A Foundation for Dense Object Segmentation

Xinlei Chen, Ross Girshick, Kaiming He, Piotr Dollár

机构 * Facebook AI Research (FAIR)(Facebook人工智能研究院(FAIR))

Comments accepted to ICCV

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.05656 2019-08-16 cs.LG cs.AI stat.ML

PHYRE: A New Benchmark for Physical Reasoning

Anton Bakhtin, Laurens van der Maaten, Justin Johnson, Laura Gustafson, Ross Girshick

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.05038 2019-04-19 cs.CV

Long-Term Feature Banks for Detailed Video Understanding

Chao-Yuan Wu, Christoph Feichtenhofer, Haoqi Fan, Kaiming He, Philipp Krähenbühl, Ross Girshick

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Facebook AI Research (FAIR)(Facebook人工智能研究院(FAIR))

Comments Code and models are available at https://github.com/facebookresearch/video-long-term-feature-banks

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.02446 2019-04-12 cs.CV

Panoptic Feature Pyramid Networks

Alexander Kirillov, Ross Girshick, Kaiming He, Piotr Dollár

机构 * Facebook AI Research (FAIR)(脸书人工智能研究院(FAIR))

Comments accepted to CVPR 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.00868 2019-04-12 cs.CV

Panoptic Segmentation

Alexander Kirillov, Kaiming He, Ross Girshick, Carsten Rother, Piotr Dollár

机构 * Facebook AI Research (FAIR)(Facebook人工智能研究院(FAIR)) ; Heidelberg University(海德堡大学)

Comments accepted to CVPR 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
↑