arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7464 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7464 篇

2506.07848 2025-06-10 cs.CV cs.AI 73%

PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement

Teng Hu, Zhentao Yu, Zhengguang Zhou, Jiangning Zhang, Yuan Zhou, Qinglin Lu, Ran Yi

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan(腾讯文英) Zhejiang University(浙江大学)

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16149 2025-05-23 cs.CV cs.AI cs.CL 73%

When VLMs Meet Image Classification: Test Sets Renovation via Missing Label Identification

Zirui Pang, Haosheng Tan, Yuhan Pu, Zhijie Deng, Zhouan Shen, Keyu Hu, Jiaheng Wei

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Glasgow(格拉斯哥大学) Boston University(波士顿大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视觉定位与Grounding :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17045 2025-05-23 cs.CV cs.AI 73%

GeoBiked: A Dataset with Geometric Features and Automated Labeling Techniques to Enable Deep Generative Models in Engineering Design

Phillip Mueller, Sebastian Mueller, Lars Mikelsons

机构 * BMW Group(宝马集团) University of Augsburg(奥格斯堡大学)

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13399 2025-04-21 cs.CV cs.AI 73%

Towards a Multi-Agent Vision-Language System for Zero-Shot Novel Hazardous Object Detection for Autonomous Driving Safety

Shashank Shriram, Srinivasa Perisetla, Aryan Keskar, Harsha Krishnaswamy, Tonko Emil Westerhof Bossen, Andreas Møgelmose, Ross Greer

机构 * Machine Intelligence, Interaction, and Imagination (Mi 3 ) Laboratory(机器智能、交互与想象(Mi 3)实验室) University of California, Merced(加州大学默塞德分校) Aalborg Universitet(奥胡斯大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17422 2025-04-08 cs.CV cs.AI cs.RO 73%

Open-Vocabulary Action Localization with Iterative Visual Prompting

Naoki Wake, Atsushi Kanehira, Kazuhiro Sasabuchi, Jun Takamatsu, Katsushi Ikeuchi

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 9 pages, 5 figures, 6 tables. Published in IEEE Access. Last updated on April 7th, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00954 2025-04-02 cs.CV cs.AI 73%

IDMR: Towards Instance-Driven Precise Visual Correspondence in Multimodal Retrieval

Bangwei Liu, Yicheng Bao, Shaohui Lin, Xuhong Wang, Xin Tan, Yingchun Wang, Yuan Xie, Chaochao Lu

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14908 2025-03-20 cs.GR cs.AI cs.CV 73%

POSTA: A Go-to Framework for Customized Artistic Poster Generation

Haoyu Chen, Xiaojie Xu, Wenbo Li, Jingjing Ren, Tian Ye, Songhua Liu, Ying-Cong Chen, Lei Zhu, Xinchao Wang

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08549 2025-03-03 cs.CV cs.AI 73%

The Devil is in Temporal Token: High Quality Video Reasoning Segmentation

Sitong Gong, Yunzhi Zhuge, Lu Zhang, Zongxin Yang, Pingping Zhang, Huchuan Lu

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Journal ref CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20277 2025-02-28 cs.CV cs.AI 73%

Explainable, Multi-modal Wound Infection Classification from Images Augmented with Generated Captions

Palawat Busaranuvong, Emmanuel Agu, Reza Saadati Fard, Deepak Kumar, Shefalika Gautam, Bengisu Tulu, Diane Strong

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02746 2025-02-20 cs.CV cs.LG 73%

Contrastive Localized Language-Image Pre-Training

Hong-You Chen, Zhengfeng Lai, Haotian Zhang, Xinze Wang, Marcin Eichner, Keen You, Meng Cao, Bowen Zhang, Yinfei Yang, Zhe Gan

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07905 2025-02-13 cs.CV cs.LG 73%

DeepSeek on a Trip: Inducing Targeted Visual Hallucinations via Representation Vulnerabilities

Chashi Mahiul Islam, Samuel Jacob Chacko, Preston Horne, Xiuwen Liu

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15346 2025-02-11 cs.CV cs.AI 73%

YOLO-RD: Introducing Relevant and Compact Explicit Knowledge to YOLO by Retriever-Dictionary

Hao-Tang Tsui, Chien-Yao Wang, Hong-Yuan Mark Liao

专题命中 视觉定位与Grounding :VLM(abstract);visual language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14680 2024-12-30 cs.CV cs.AI cs.RO 73%

A Light-Weight Framework for Open-Set Object Detection with Decoupled Feature Alignment in Joint Space

Yonghao He, Hu Su, Haiyong Yu, Cong Yang, Wei Sui, Cong Wang, Song Liu

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17981 2024-12-20 cs.CV cs.AI 73%

From Training-Free to Adaptive: Empirical Insights into MLLMs' Understanding of Detection Information

Qirui Jiao, Daoyuan Chen, Yilun Huang, Yaliang Li, Ying Shen

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 32 pages, 22 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02262 2024-12-04 cs.CV cs.LG 73%

Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation

Sepand Dyanatkar, Angran Li, Alexander Dungate

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG

Comments Accepted to Climate Change AI Workshop at NeurIPS 2024. 9 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05256 2024-07-18 cs.CV cs.AI 73%

Unlocking Textual and Visual Wisdom: Open-Vocabulary 3D Object Detection Enhanced by Comprehensive Guidance from Text and Image

Pengkun Jiao, Na Zhao, Jingjing Chen, Yu-Gang Jiang

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments ECCV2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05814 2024-07-09 cs.CV cs.AI cs.MM 73%

Cross-domain Few-shot In-context Learning for Enhancing Traffic Sign Recognition

Yaozong Gan, Guang Li, Ren Togo, Keisuke Maeda, Takahiro Ogawa, Miki Haseyama

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12716 2024-06-11 cs.CV cs.CL cs.LG 73%

BloomVQA: Assessing Hierarchical Multi-modal Comprehension

Yunye Gong, Robik Shrestha, Jared Claypoole, Michael Cogswell, Arijit Ray, Christopher Kanan, Ajay Divakaran

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG

Comments Accepted by ACL Findings (2024). Dataset available at https://huggingface.co/datasets/ygong/BloomVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14230 2024-05-24 cs.CV cs.AI cs.CL 73%

Boosting Medical Image-based Cancer Detection via Text-guided Supervision from Reports

Guangyu Guo, Jiawen Yao, Yingda Xia, Tony C. W. Mok, Zhilin Zheng, Junwei Han, Le Lu, Dingwen Zhang, Jian Zhou, Ling Zhang

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01959 2024-04-09 cs.CV cs.CR cs.LG 73%

Bi-LORA: A Vision-Language Approach for Synthetic Image Detection

Mamadou Keita, Wassim Hamidouche, Hessen Bougueffa Eutamene, Abdenour Hadid, Abdelmalik Taleb-Ahmed

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05136 2024-03-12 cs.AI cs.CV 73%

InstructDET: Diversifying Referring Object Detection with Generalized Instructions

Ronghao Dang, Jiangyan Feng, Haodong Zhang, Chongjian Ge, Lin Song, Lijun Gong, Chengju Liu, Qijun Chen, Feng Zhu, Rui Zhao, Yibing Song

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 29 pages (include Appendix) Published in ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10945 2023-12-19 cs.CV cs.CL cs.LG 73%

LaViP:Language-Grounded Visual Prompts

Nilakshan Kunananthaseelan, Jing Zhang, Mehrtash Harandi

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG

Comments The 38th Annual AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12231 2023-05-23 eess.IV cs.CV cs.LG 73%

Bi-VLGM : Bi-Level Class-Severity-Aware Vision-Language Graph Matching for Text Guided Medical Image Segmentation

Chen Wenting, Liu Jie, Yuan Yixuan

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.12614 2023-01-31 cs.RO cs.AI cs.CV 73%

RREx-BoT: Remote Referring Expressions with a Bag of Tricks

Gunnar A. Sigurdsson, Jesse Thomason, Gaurav S. Sukhatme, Robinson Piramuthu

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.07643 2022-11-21 cs.CV cs.CL cs.LG 73%

Coarse-to-Fine Vision-Language Pre-training with Fusion in the Backbone

Zi-Yi Dou, Aishwarya Kamath, Zhe Gan, Pengchuan Zhang, Jianfeng Wang, Linjie Li, Zicheng Liu, Ce Liu, Yann LeCun, Nanyun Peng, Jianfeng Gao, Lijuan Wang

专题命中 视觉定位与Grounding :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG

Comments NeurIPS 2022. Project Website: https://ashkamath.github.io/FIBER_page

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.09874 2022-10-18 cs.RO cs.AI cs.CV 73%

Open-vocabulary Queryable Scene Representations for Real World Planning

Boyuan Chen, Fei Xia, Brian Ichter, Kanishka Rao, Keerthana Gopalakrishnan, Michael S. Ryoo, Austin Stone, Daniel Kappler

专题命中 视觉定位与Grounding :visual language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments v2, added references to concurrent work and acknowledgments

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.10126 2022-09-22 cs.CV cs.LG 73%

Exploring Modulated Detection Transformer as a Tool for Action Recognition in Videos

Tomás Crisol, Joel Ermantraut, Adrián Rostagno, Santiago L. Aggio, Javier Iparraguirre

专题命中 视觉定位与Grounding :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG

Comments 5 pages, 2 figures, 1 results chart

Journal ref JAIIO - JORNADAS ARGENTINAS DE INFORMATICA 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.12763 2021-10-13 cs.CV cs.CL cs.LG 73%

MDETR -- Modulated Detection for End-to-End Multi-Modal Understanding

Aishwarya Kamath, Mannat Singh, Yann LeCun, Gabriel Synnaeve, Ishan Misra, Nicolas Carion

专题命中 视觉定位与Grounding :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.04626 2021-01-13 cs.CV cs.AI 73%

Predicting Relative Depth between Objects from Semantic Features

Stefan Cassar, Adrian Muscat, Dylan Seychell

专题命中 视觉定位与Grounding :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06243 2026-01-21 cs.CL cs.AI 72%

CoT Referring: Improving Referring Expression Tasks with Grounded Reasoning

CoT Referring: 通过 grounded 推理改进指称表达任务

Qihua Dong, Luis Figueroa, Handong Zhao, Kushal Kafle, Jason Kuen, Zhihong Ding, Scott Cohen, Yun Fu

机构 * Adobe Research(Adobe研究院) Northeastern University(东北大学)

专题命中 视觉定位与Grounding :MLLM(abstract,comments);multimodal large language model(abstract);分类 cs.AI

AI总结 通过 grounded 推理改进指称表达任务,提出CoT Referring方法,提升多模态大语言模型在复杂指称场景中的性能。

Comments MLLM, Referring Expression Segmentation

详情

展开后加载摘要…

URL PDF HTML 收藏