arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7441 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7441 篇

2401.15903 2024-01-30 cs.LG q-bio.GN stat.ME 57%

Toward the Identifiability of Comparative Deep Generative Models

Romain Lopez, Jan-Christian Huetter, Ehsan Hajiramezanali, Jonathan Pritchard, Aviv Regev

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments 45 pages, 3 figures

Journal ref Causal Learning and Reasoning 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14159 2024-01-26 cs.CV 57%

Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks

Tianhe Ren, Shilong Liu, Ailing Zeng, Jing Lin, Kunchang Li, He Cao, Jiayu Chen, Xinyu Huang, Yukang Chen, Feng Yan, Zhaoyang Zeng, Hao Zhang, Feng Li, Jie Yang, Hongyang Li, Qing Jiang, Lei Zhang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18612 2024-01-25 cs.LG 57%

Efficient kernel surrogates for neural network-based regression

Saad Qadeer, Andrew Engel, Amanda Howard, Adam Tsou, Max Vargas, Panos Stinis, Tony Chiang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments 35 pages. software used to reach results available upon request, approved for release by Pacific Northwest National Laboratory

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12503 2024-01-24 cs.CV 57%

Small Language Model Meets with Reinforced Vision Vocabulary

Haoran Wei, Lingyu Kong, Jinyue Chen, Liang Zhao, Zheng Ge, En Yu, Jianjian Sun, Chunrui Han, Xiangyu Zhang

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01141 2024-01-24 cs.CV 57%

VGDiffZero: Text-to-image Diffusion Models Can Be Zero-shot Visual Grounders

Xuyang Liu, Siteng Huang, Yachen Kang, Honggang Chen, Donglin Wang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted by ICASSP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.02317 2024-01-24 cs.CL cs.CV 57%

Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings

Daniel Rose, Vaishnavi Himakunthala, Andy Ouyang, Ryan He, Alex Mei, Yujie Lu, Michael Saxon, Chinmay Sonar, Diba Mirza, William Yang Wang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11228 2024-01-23 cs.CV 57%

Unifying Visual and Vision-Language Tracking via Contrastive Learning

Yinchao Ma, Yuyang Tang, Wenfei Yang, Tianzhu Zhang, Jinpeng Zhang, Mengxue Kang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.09773 2024-01-22 cs.CV 57%

Local-Global Context Aware Transformer for Language-Guided Video Segmentation

Chen Liang, Wenguan Wang, Tianfei Zhou, Jiaxu Miao, Yawei Luo, Yi Yang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted by TPAMI. Code, data: https://github.com/leonnnop/Locater

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.01061 2024-01-22 cs.CV 57%

Rethinking Cross-modal Interaction from a Top-down Perspective for Referring Video Object Segmentation

Chen Liang, Yu Wu, Tianfei Zhou, Wenguan Wang, Zongxin Yang, Yunchao Wei, Yi Yang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Champion solution in YouTube-VOS 2021 Track 3. Extended version published in https://ieeexplore.ieee.org/abstract/document/10083244

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08232 2024-01-17 cs.CV 57%

Multi-scale 2D Temporal Map Diffusion Models for Natural Language Video Localization

Chongzhi Zhang, Mingyuan Zhang, Zhiyang Teng, Jiayi Li, Xizhou Zhu, Lewei Lu, Ziwei Liu, Aixin Sun

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.08604 2024-01-17 cs.CL cs.AI 57%

NormSAGE: Multi-Lingual Multi-Cultural Norm Discovery from Conversations On-the-Fly

Yi R. Fung, Tuhin Chakraborty, Hao Guo, Owen Rambow, Smaranda Muresan, Heng Ji

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12682 2024-01-03 cs.AI 57%

SayCanPay: Heuristic Planning with Large Language Models using Learnable Domain Knowledge

Rishi Hazra, Pedro Zuidberg Dos Martires, Luc De Raedt

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments Accepted in AAAI 2024. Website: https://rishihazra.github.io/SayCanPay/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15610 2023-12-27 cs.CV 57%

Towards Learning Geometric Eigen-Lengths Crucial for Fitting Tasks

Yijia Weng, Kaichun Mo, Ruoxi Shi, Yanchao Yang, Leonidas J. Guibas

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments ICML 2023. Project page: https://yijiaweng.github.io/geo-eigen-length

Journal ref Proceedings of the 40th International Conference on Machine Learning, PMLR 202:36958-36977, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14465 2023-12-25 cs.CV 57%

FM-OV3D: Foundation Model-based Cross-modal Knowledge Blending for Open-Vocabulary 3D Detection

Dongmei Zhang, Chang Li, Ray Zhang, Shenghao Xie, Wei Xue, Xiaodong Xie, Shanghang Zhang

专题命中 视觉定位与Grounding :visual language model(abstract);分类 cs.CV

Comments Accepted by AAAI 2024. Code will be released at https://github.com/dmzhang0425/FM-OV3D.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11376 2023-12-20 cs.CV 57%

CLIM: Contrastive Language-Image Mosaic for Region Representation

Size Wu, Wenwei Zhang, Lumin Xu, Sheng Jin, Wentao Liu, Chen Change Loy

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10439 2023-12-20 cs.CV 57%

Simple Image-level Classification Improves Open-vocabulary Object Detection

Ruohuan Fang, Guansong Pang, Xiao Bai

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted at AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07374 2023-12-20 cs.CV 57%

Relax Image-Specific Prompt Requirement in SAM: A Single Generic Prompt for Segmenting Camouflaged Objects

Jian Hu, Jiayi Lin, Weitong Cai, Shaogang Gong

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted by AAAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.08012 2023-12-20 cs.CL cs.LG 57%

Meta-Referential Games to Learn Compositional Learning Behaviours

Kevin Denamganaï, Sondess Missaoui, James Alfred Walker

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10113 2023-12-19 cs.CV 57%

Focus on Your Instruction: Fine-grained and Multi-instruction Image Editing by Attention Modulation

Qin Guo, Tianwei Lin

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.15494 2023-12-19 cs.CL cs.AI cs.HC 57%

ETHER: Aligning Emergent Communication for Hindsight Experience Replay

Kevin Denamganaï, Daniel Hernandez, Ozan Vardal, Sondess Missaoui, James Alfred Walker

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.15521 2023-12-19 cs.CV 57%

What a MESS: Multi-Domain Evaluation of Zero-Shot Semantic Segmentation

Benedikt Blumenstiel, Johannes Jakubik, Hilde Kühne, Michael Vössing

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments 37th Conference on Neural Information Processing Systems (NeurIPS 2023) Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.05091 2023-12-19 cs.CL cs.AI cs.HC 57%

Knowledge-enhanced Agents for Interactive Text Games

Prateek Chhikara, Jiarui Zhang, Filip Ilievski, Jonathan Francis, Kaixin Ma

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments Published at K-CAP '23

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09158 2023-12-15 cs.CV 57%

General Object Foundation Model for Images and Videos at Scale

Junfeng Wu, Yi Jiang, Qihao Liu, Zehuan Yuan, Xiang Bai, Song Bai

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Project homepage: https://glee-vision.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08648 2023-12-15 cs.CV 57%

CLIP-guided Federated Learning on Heterogeneous and Long-Tailed Data

Jiangming Shi, Shanshan Zheng, Xiangbo Yin, Yang Lu, Yuan Xie, Yanyun Qu

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments This paper has been accepted by AAAI24

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08366 2023-12-14 cs.CV 57%

See, Say, and Segment: Teaching LMMs to Overcome False Premises

Tsung-Han Wu, Giscard Biamby, David Chan, Lisa Dunlap, Ritwik Gupta, Xudong Wang, Joseph E. Gonzalez, Trevor Darrell

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Project Page: https://see-say-segment.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04356 2023-12-13 cs.CV 57%

Fine-Grained Visual Prompting

Lingfeng Yang, Yueze Wang, Xiang Li, Xinlong Wang, Jian Yang

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05256 2023-12-12 eess.IV cs.AI 57%

Holistic Evaluation of GPT-4V for Biomedical Imaging

Zhengliang Liu, Hanqi Jiang, Tianyang Zhong, Zihao Wu, Chong Ma, Yiwei Li, Xiaowei Yu, Yutong Zhang, Yi Pan, Peng Shu, Yanjun Lyu, Lu Zhang, Junjie Yao, Peixin Dong, Chao Cao, Zhenxiang Xiao, Jiaqi Wang, Huan Zhao, Shaochen Xu, Yaonai Wei, Jingyuan Chen, Haixing Dai, Peilong Wang, Hao He, Zewei Wang, Xinyu Wang, Xu Zhang, Lin Zhao, Yiheng Liu, Kai Zhang, Liheng Yan, Lichao Sun, Jun Liu, Ning Qiang, Bao Ge, Xiaoyan Cai, Shijie Zhao, Xintao Hu, Yixuan Yuan, Gang Li, Shu Zhang, Xin Zhang, Xi Jiang, Tuo Zhang, Dinggang Shen, Quanzheng Li, Wei Liu, Xiang Li, Dajiang Zhu, Tianming Liu

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03805 2023-12-08 cs.CV 57%

SYNC-CLIP: Synthetic Data Make CLIP Generalize Better in Data-Limited Scenarios

Mushui Liu, Weijie He, Ziqian Lu, Yunlong Yu

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02153 2023-12-05 cs.CV 57%

Aligning and Prompting Everything All at Once for Universal Visual Perception

Yunhang Shen, Chaoyou Fu, Peixian Chen, Mengdan Zhang, Ke Li, Xing Sun, Yunsheng Wu, Shaohui Lin, Rongrong Ji

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01300 2023-12-04 cs.CV 57%

Revisiting DETR Pre-training for Object Detection

Yan Ma, Weicong Liang, Bohan Chen, Yiduo Hao, Bojian Hou, Xiangyu Yue, Chao Zhang, Yuhui Yuan

专题命中 视觉定位与Grounding :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏