arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7441 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7441 篇

2412.02978 2024-12-05 cs.CV 57%

Progressive Vision-Language Prompt for Multi-Organ Multi-Class Cell Semantic Segmentation with Single Branch

Qing Zhang, Hang Guo, Siyuan Yang, Qingli Li, Yan Wang

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00744 2024-12-05 cs.CV 57%

Collaborative Vision-Text Representation Optimizing for Open-Vocabulary Segmentation

Siyu Jiao, Hongguang Zhu, Jiannan Huang, Yao Zhao, Yunchao Wei, Humphrey Shi

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments ECCV 2024 oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02563 2024-12-04 cs.CL cs.AI 57%

Semantic Tokens in Retrieval Augmented Generation

Joel Suro

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16749 2024-12-03 cs.CV 57%

AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks

You Li, Fan Ma, Yi Yang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06892 2024-12-03 cs.CV cs.CL 57%

Real-time Transformer-based Open-Vocabulary Detection with Efficient Fusion Head

Tiancheng Zhao, Peng Liu, Xuan He, Lu Zhang, Kyusong Lee

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08464 2024-12-02 cs.CV 57%

VLTP: Vision-Language Guided Token Pruning for Task-Oriented Segmentation

Hanning Chen, Yang Ni, Wenjun Huang, Yezi Liu, SungHeon Jeong, Fei Wen, Nathaniel Bastian, Hugo Latapie, Mohsen Imani

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV

Comments Accepted at WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17995 2024-11-28 cs.CV 57%

Revisiting Misalignment in Multispectral Pedestrian Detection: A Language-Driven Approach for Cross-modal Alignment Fusion

Taeheon Kim, Sangyun Chung, Youngjoon Yu, Yong Man Ro

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17135 2024-11-27 cs.AI cs.CL 57%

LLM-Based Offline Learning for Embodied Agents via Consistency-Guided Reward Ensemble

Yujeong Lee, Sangwoo Shin, Wei-Jin Park, Honguk Woo

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments Findings of EMNLP-2024 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17066 2024-11-27 cs.CV cs.CL cs.SC 57%

Relations, Negations, and Numbers: Looking for Logic in Generative Text-to-Image Models

Colin Conwell, Rupert Tawiah-Quashie, Tomer Ullman

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12564 2024-11-26 cs.CV 57%

FTII-Bench: A Comprehensive Multimodal Benchmark for Flow Text with Image Insertion

Jiacheng Ruan, Yebin Yang, Zehao Lin, Yuchen Feng, Feiyu Xiong, Zeyun Tang, Zhiyu Li

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Work in progress. 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03634 2024-11-20 cs.CV 57%

SOWA: Adapting Hierarchical Frozen Window Self-Attention to Visual-Language Models for Better Anomaly Detection

Zongxiang Hu, Zhaosheng Zhang

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments 8 pages, 9 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07184 2024-11-19 cs.CV 57%

SAMPart3D: Segment Any Part in 3D Objects

Yunhan Yang, Yukun Huang, Yuan-Chen Guo, Liangjun Lu, Xiaoyang Wu, Edmund Y. Lam, Yan-Pei Cao, Xihui Liu

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

Comments Project Page: https://yhyang-myron.github.io/SAMPart3D-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10496 2024-11-19 cs.CV 57%

Vision-guided and Mask-enhanced Adaptive Denoising for Prompt-based Image Editing

Kejie Wang, Xuemeng Song, Meng Liu, Jin Yuan, Weili Guan

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10370 2024-11-19 cs.CV 57%

Grounded 3D-LLM with Referent Tokens

Yilun Chen, Shuai Yang, Haifeng Huang, Tai Wang, Runsen Xu, Ruiyuan Lyu, Dahua Lin, Jiangmiao Pang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16725 2024-11-15 cs.CV 57%

Category-Extensible Out-of-Distribution Detection via Hierarchical Context Descriptions

Kai Liu, Zhihang Fu, Chao Chen, Sheng Jin, Ze Chen, Mingyuan Tao, Rongxin Jiang, Jieping Ye

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted by 37th Conference on Neural Information Processing Systems (NeurIPS 2023). Code is available at https://github.com/alibaba/catex

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07584 2024-11-13 cs.CV 57%

Grounded Video Caption Generation

Evangelos Kazakos, Cordelia Schmid, Josef Sivic

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06702 2024-11-12 cs.CV 57%

Track Any Peppers: Weakly Supervised Sweet Pepper Tracking Using VLMs

Jia Syuen Lim, Yadan Luo, Zhi Chen, Tianqi Wei, Scott Chapman, Zi Huang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01846 2024-11-05 cs.CV 57%

KptLLM: Unveiling the Power of Large Language Model for Keypoint Comprehension

Jie Yang, Wang Zeng, Sheng Jin, Lumin Xu, Wentao Liu, Chen Qian, Ruimao Zhang

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14138 2024-11-05 cs.CV 57%

Visual Text Generation in the Wild

Yuanzhi Zhu, Jiawei Liu, Feiyu Gao, Wenyu Liu, Xinggang Wang, Peng Wang, Fei Huang, Cong Yao, Zhibo Yang

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

Comments Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.02464 2024-10-28 eess.SP cs.LG cs.SY eess.SY 57%

Universal Approximation of Linear Time-Invariant (LTI) Systems through RNNs: Power of Randomness in Reservoir Computing

Shashank Jere, Lizhong Zheng, Karim Said, Lingjia Liu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments This work has been accepted to IEEE Journal of Selected Topics in Signal Processing (JSTSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18938 2024-10-25 stat.ML cs.LG math.ST stat.TH 57%

A Random Matrix Theory Perspective on the Spectrum of Learned Features and Asymptotic Generalization Capabilities

Yatin Dandi, Luca Pesce, Hugo Cui, Florent Krzakala, Yue M. Lu, Bruno Loureiro

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19840 2024-10-25 cs.CV 57%

Textual Training for the Hassle-Free Removal of Unwanted Visual Data: Case Studies on OOD and Hateful Image Detection

Saehyung Lee, Jisoo Mok, Sangha Park, Yongho Shin, Dahuin Jung, Sungroh Yoon

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17331 2024-10-24 cs.CV cs.IR 57%

Offline Evaluation of Set-Based Text-to-Image Generation

Negar Arabzadeh, Fernando Diaz, Junfeng He

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15657 2024-10-22 cs.CV cs.CL 57%

CL-HOI: Cross-Level Human-Object Interaction Distillation from Vision Large Language Models

Jianjun Gao, Chen Cai, Ruoyu Wang, Wenyang Liu, Kim-Hui Yap, Kratika Garg, Boon-Siew Han

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15181 2024-10-22 cs.LG cs.HC 57%

GUIDE: Real-Time Human-Shaped Agents

Lingyu Zhang, Zhengran Ji, Nicholas R Waytowich, Boyuan Chen

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12982 2024-10-22 cs.LG cs.CL cs.IR 57%

Retrieval-Enhanced Machine Learning: Synthesis and Opportunities

To Eun Kim, Alireza Salemi, Andrew Drozdov, Fernando Diaz, Hamed Zamani

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14041 2024-10-21 cs.LG cs.CL 57%

From Barriers to Tactics: A Behavioral Science-Informed Agentic Workflow for Personalized Nutrition Coaching

Eric Yang, Tomas Garcia, Hannah Williams, Bhawesh Kumar, Martin Ramé, Eileen Rivera, Yiran Ma, Jonathan Amar, Caricia Catalani, Yugang Jia

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01576 2024-10-21 cs.CV cs.MM 57%

Learning Efficient Unsupervised Satellite Image-based Building Damage Detection

Yiyun Zhang, Zijian Wang, Yadan Luo, Xin Yu, Zi Huang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments ICDM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13823 2024-10-18 cs.CV 57%

Deep Generative Models Unveil Patterns in Medical Images Through Vision-Language Conditioning

Xiaodan Xing, Junzhi Ning, Yang Nan, Guang Yang

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted by AIM-FM Workshop of NeurIPS2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.09969 2024-10-16 cs.RO cs.LG cs.SY eess.SY 57%

Prompt a Robot to Walk with Large Language Models

Yen-Jen Wang, Bike Zhang, Jianyu Chen, Koushil Sreenath

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments Conference on Decision and Control (CDC), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏