arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7441 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7441 篇

2306.01286 2023-12-01 cs.CL cs.AI 57%

KL-Divergence Guided Temperature Sampling

Chung-Ching Chang, David Reitter, Renat Aksitov, Yun-Hsuan Sung

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17776 2023-11-30 cs.CV 57%

One-Shot Open Affordance Learning with Foundation Models

Gen Li, Deqing Sun, Laura Sevilla-Lara, Varun Jampani

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12476 2023-11-29 cs.CV 57%

Zero-shot Visual Relation Detection via Composite Visual Cues from Large Language Models

Lin Li, Jun Xiao, Guikun Chen, Jian Shao, Yueting Zhuang, Long Chen

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00397 2023-11-28 cs.CV 57%

Towards Omni-supervised Referring Expression Segmentation

Minglang Huang, Yiyi Zhou, Gen Luo, Guannan Jiang, Weilin Zhuang, Xiaoshuai Sun

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07637 2023-11-28 cs.LG cs.CL cs.HC cs.IR 57%

Text2Cohort: Facilitating Intuitive Access to Biomedical Data with Natural Language Cohort Discovery

Pranav Kulkarni, Adway Kanhere, Paul H. Yi, Vishwa S. Parekh

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments 5 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.06494 2023-11-21 cs.CV cs.RO 57%

Explicit3D: Graph Network with Spatial Inference for Single Image 3D Object Detection

Yanjun Liu, Wenming Yang

专题命中 视觉定位与Grounding :visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11925 2023-11-21 cs.CV 57%

LVM-Med: Learning Large-Scale Self-Supervised Vision Models for Medical Imaging via Second-order Graph Matching

Duy M. H. Nguyen, Hoang Nguyen, Nghiem T. Diep, Tan N. Pham, Tri Cao, Binh T. Nguyen, Paul Swoboda, Nhat Ho, Shadi Albarqouni, Pengtao Xie, Daniel Sonntag, Mathias Niepert

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12457 2023-11-21 cs.CV cs.MM 57%

Unsupervised Multi-view Pedestrian Detection

Mengyin Liu, Chao Zhu, Shiqi Ren, Xu-Cheng Yin

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11077 2023-11-21 cs.CV 57%

Unifying Tracking and Image-Video Object Detection

Peirong Liu, Rui Wang, Pengchuan Zhang, Omid Poursaeed, Yipin Zhou, Xuefei Cao, Sreya Dutta Roy, Ashish Shah, Ser-Nam Lim

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06242 2023-11-13 cs.CV 57%

Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks

Bin Xiao, Haiping Wu, Weijian Xu, Xiyang Dai, Houdong Hu, Yumao Lu, Michael Zeng, Ce Liu, Lu Yuan

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05779 2023-11-13 cs.RO cs.CV 57%

Language-guided Robot Grasping: CLIP-based Referring Grasp Synthesis in Clutter

Georgios Tziafas, Yucheng Xu, Arushi Goel, Mohammadreza Kasaei, Zhibin Li, Hamidreza Kasaei

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Poster CoRL 2023. Dataset and code available here: https://github.com/gtziafas/OCID-VLG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04260 2023-11-09 cs.RO cs.CL cs.CV 57%

Fully Automated Task Management for Generation, Execution, and Evaluation: A Framework for Fetch-and-Carry Tasks with Natural Language Instructions in Continuous Space

Motonari Kambara, Komei Sugiura

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted at presentation for CVPR 2023 Embodied AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.09375 2023-11-07 cs.LG 57%

Gray Learning from Non-IID Data with Out-of-distribution Samples

Zhilin Zhao, Longbing Cao, Chang-Dong Wang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12145 2023-11-03 cs.CV 57%

Efficient Feature Distillation for Zero-shot Annotation Object Detection

Zhuoming Liu, Xuefeng Hu, Ram Nevatia

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments WACV2024 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12035 2023-10-31 cs.CV 57%

RefEgo: Referring Expression Comprehension Dataset from First-Person Perception of Ego4D

Shuhei Kurita, Naoki Katsura, Eri Onami

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments 15 pages, 11 figures. ICCV2023. Codes are available at https://github.com/shuheikurita/RefEgo

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17140 2023-10-27 cs.CL cs.AI 57%

Symbolic Planning and Code Generation for Grounded Dialogue

Justin T. Chiu, Wenting Zhao, Derek Chen, Saujas Vaduguru, Alexander M. Rush, Daniel Fried

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments Accepted to EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17128 2023-10-27 cs.CV 57%

Task-driven Prompt Evolution for Foundation Models

Rachana Sathish, Rahul Venkataramani, K S Shriram, Prasad Sudhakar

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17054 2023-10-27 cs.CL cs.LG 57%

BOOST: Harnessing Black-Box Control to Boost Commonsense in LMs' Generation

Yufei Tian, Felix Zhang, Nanyun Peng

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16667 2023-10-26 cs.CV 57%

CoDet: Co-Occurrence Guided Region-Word Alignment for Open-Vocabulary Object Detection

Chuofan Ma, Yi Jiang, Xin Wen, Zehuan Yuan, Xiaojuan Qi

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14616 2023-10-25 cs.CL cs.CV 57%

Exploring Affordance and Situated Meaning in Image Captions: A Multimodal Analysis

Pin-Er Chen, Po-Ya Angela Wang, Hsin-Yu Chou, Yu-Hsiang Tseng, Shu-Kai Hsieh

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15129 2023-10-24 cs.CL cs.LG 57%

Location-Aware Visual Question Generation with Lightweight Models

Nicholas Collin Suwono, Justin Chih-Yao Chen, Tun Min Hung, Ting-Hao Kenneth Huang, I-Bin Liao, Yung-Hui Li, Lun-Wei Ku, Shao-Hua Sun

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15066 2023-10-24 cs.CV cs.CL 57%

Localizing Active Objects from Egocentric Vision with Symbolic World Knowledge

Te-Lin Wu, Yu Zhou, Nanyun Peng

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments In Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10975 2023-10-24 cs.CV 57%

NICE: Improving Panoptic Narrative Detection and Segmentation with Cascading Collaborative Learning

Haowei Wang, Jiayi Ji, Tianyu Guo, Yilong Yang, Yiyi Zhou, Xiaoshuai Sun, Rongrong Ji

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments 18 pages. 9 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15074 2023-10-24 cs.CL cs.AI 57%

Have LLMs Advanced Enough? A Challenging Problem Solving Benchmark For Large Language Models

Daman Arora, Himanshu Gaurav Singh, Mausam

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14497 2023-10-24 cs.AI 57%

Counterfactual Explanation Generation with s(CASP)

Sopam Dasgupta, Farhad Shakerin, Joaquín Arias, Elmer Salazar, Gopal Gupta

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments 18 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13619 2023-10-23 cs.CL cs.CV 57%

Semi-supervised multimodal coreference resolution in image narrations

Arushi Goel, Basura Fernando, Frank Keller, Hakan Bilen

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Long paper at EMNLP'23-Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13398 2023-10-23 cs.CV 57%

OpenAnnotate3D: Open-Vocabulary Auto-Labeling System for Multi-modal 3D Data

Yijie Zhou, Likun Cai, Xianhui Cheng, Zhongxue Gan, Xiangyang Xue, Wenchao Ding

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments The source code will be released at https://github.com/Fudan-ProjectTitan/OpenAnnotate3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13377 2023-10-23 cs.RO cs.AI cs.CL cs.HC 57%

A Human-Robot Mutual Learning System with Affect-Grounded Language Acquisition and Differential Outcomes Training

Alva Markelius, Sofia Sjöberg, Zakaria Lemhauori, Laura Cohen, Martin Bergström, Robert Lowe, Lola Cañamero

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments Preprint: This is the submitted version of a paper to be presented at The Proceedings of the 15th International Conference on Social Robotics (ICSR 2023). Please cite the official publication once it is available

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12520 2023-10-20 cs.CL cs.CV 57%

Lost in Translation: When GPT-4V(ision) Can't See Eye to Eye with Text. A Vision-Language-Consistency Analysis of VLLMs and Beyond

Xiang Zhang, Senyu Li, Zijun Wu, Ning Shi

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11958 2023-10-19 cs.CL cs.LG 57%

Emptying the Ocean with a Spoon: Should We Edit Models?

Yuval Pinter, Michael Elhadad

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments Findings of ACL: EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏