arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7494 篇

2507.15846 2025-07-29 cs.LG cs.AI cs.CL cs.CV cs.HC 82%

GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding

Fei Tang, Zhangxuan Gu, Zhengxi Lu, Xuyang Liu, Shuheng Shen, Changhua Meng, Wen Wang, Wenqi Zhang, Yongliang Shen, Weiming Lu, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08049 2025-07-08 cs.CL 82%

EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding

Ao Li, Longwei Xu, Chen Ling, Jinghui Zhang, Pengwei Wang

机构 * Shandong University(山东大学) Xi’an Jiaotong University(西安交通大学)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17328 2025-06-24 cs.RO 82%

Reflective VLM Planning for Dual-Arm Desktop Cleaning: Bridging Open-Vocabulary Perception and Precise Manipulation

Yufan Liu, Yi Wu, Gweneth Ge, Haoliang Cheng, Rui Liu

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系) College of Aeronautics & Engineering, Kent State University(肯特州立大学航空与工程学院)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06752 2025-06-18 cs.RO 82%

Semantic Enhancement for Object SLAM with Heterogeneous Multimodal Large Language Model Agents

Jungseok Hong, Ran Choi, John J. Leonard

机构 * Computer Science and Artificial Intelligence Laboratory (CSAIL) at the Massachusetts Institute of Technology (MIT)(麻省理工学院计算机科学与人工智能实验室)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01377 2025-06-03 cs.CL cs.AI cs.CV cs.LG 82%

Improving Medical Large Vision-Language Models with Abnormal-Aware Feedback

Yucheng Zhou, Lingran Song, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(SKL-IOTSC、CIS、澳门大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22517 2025-05-29 cs.CL cs.MM 82%

Multi-MLLM Knowledge Distillation for Out-of-Context News Detection

Yimeng Gu, Zhao Tong, Ignacio Castro, Shu Wu, Gareth Tyson

机构 * Queen Mary University of London(伦敦玛丽女王大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学)

专题命中 视觉定位与Grounding :MLLM(title,abstract);multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06832 2025-05-13 cs.RO 82%

UniDiffGrasp: A Unified Framework Integrating VLM Reasoning and VLM-Guided Part Diffusion for Open-Vocabulary Constrained Grasping with Dual Arms

Xueyang Guo, Hongwei Hu, Chengye Song, Jiale Chen, Zilin Zhao, Yu Fu, Bowen Guan, Zhenze Liu

机构 * School of Communication Engineering, Jilin University(吉林大学通信工程学院) College of Software Engineering, Jilin University(吉林大学软件工程学院) School of Mathematics, Jilin University(吉林大学数学学院) College of Electronic Science and Engineering, Jilin University(吉林大学电子科学工程学院)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract)

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00684 2025-04-22 cs.CV cs.AI cs.LG 82%

Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding

Zilin Du, Haoxin Li, Jianfei Yu, Boyang Li

机构 * Nanyang Technological University(南洋理工大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12137 2025-04-17 cs.CV cs.AI cs.CL cs.LG 82%

Efficient Contrastive Decoding with Probabilistic Hallucination Detection - Mitigating Hallucinations in Large Vision Language Models -

Laura Fieback, Nishilkumar Balar, Jakob Spiegelberg, Hanno Gottschalk

机构 * Volkswagen AG(大众汽车集团) Technical University Berlin(柏林工业大学) University of Siegen(锡根大学)

专题命中 视觉定位与Grounding :vision language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09439 2025-04-15 cs.MM 82%

Identity-Aware Vision-Language Model for Explainable Face Forgery Detection

Junhao Xu, Jingjing Chen, Yang Jiao, Jiacheng Zhang, Zhiyu Tan, Hao Li, Yu-Gang Jiang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19331 2025-04-07 cs.CV cs.AI cs.LG 82%

CALICO: Part-Focused Semantic Co-Segmentation with Large Vision-Language Models

Kiet A. Nguyen, Adheesh Juvekar, Tianjiao Yu, Muntasir Wahed, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to CVPR 2025. Project page: https://plan-lab.github.io/calico/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01095 2025-04-02 cs.AI cs.CV cs.LG 82%

VERA: Explainable Video Anomaly Detection via Verbalized Learning of Vision-Language Models

Muchao Ye, Weiyang Liu, Pan He

机构 * The University of Iowa(爱荷华大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Auburn University(奥本大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted in CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24219 2025-04-01 cs.CV cs.AI cs.CL cs.LG cs.MM 82%

MB-ORES: A Multi-Branch Object Reasoner for Visual Grounding in Remote Sensing

Karim Radouane, Hanane Azzag, Mustapha lebbah

机构 * University Sorbonne Paris Nord(巴黎北索邦大学) University Paris-Saclay(巴黎-萨克雷大学) UVSQ(凡尔赛大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20348 2025-03-27 cs.CV cs.AI cs.CL cs.LG 82%

VideoGEM: Training-free Action Grounding in Videos

Felix Vogel, Walid Bousselham, Anna Kukleva, Nina Shvetsova, Hilde Kuehne

机构 * Goethe University Frankfurt(法兰克福大学) Tuebingen AI Center(蒂宾根人工智能中心) University of Tuebingen(蒂宾根大学) MPI for Informatics(马克斯·普朗克信息学研究所) MIT-IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16632 2025-03-24 cs.HC 82%

Benchmarking Visual Language Models on Standardized Visualization Literacy Tests

Saugat Pandey, Alvitta Ottley

专题命中 视觉定位与Grounding :visual language model(title,abstract);VLM(abstract)

Journal ref Computer Graphics forum Volume 44 (2025), Number 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05132 2025-03-24 cs.CV cs.AI cs.CL cs.LG cs.RO 82%

3D-GRAND: A Million-Scale Dataset for 3D-LLMs with Better Grounding and Less Hallucination

Jianing Yang, Xuweiyi Chen, Nikhil Madaan, Madhavan Iyengar, Shengyi Qian, David F. Fouhey, Joyce Chai

机构 * University of Michigan(密歇根大学) New York University(纽约大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments CVPR 2025. Project website: https://3d-grand.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05991 2025-03-11 eess.IV cs.AI cs.CV cs.LG 82%

GrInAdapt: Scaling Retinal Vessel Structural Map Segmentation Through Grounding, Integrating and Adapting Multi-device, Multi-site, and Multi-modal Fundus Domains

Zixuan Liu, Aaron Honjaya, Yuekai Xu, Yi Zhang, Hefu Pan, Xin Wang, Linda G Shapiro, Sheng Wang, Ruikang K Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02897 2025-03-06 cs.CV cs.AI cs.LG 82%

ClipGrader: Leveraging Vision-Language Models for Robust Label Quality Assessment in Object Detection

Hong Lu, Yali Bian, Rahul C. Shah

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19542 2025-02-25 cs.CV cs.AI cs.LG 82%

Interacted Object Grounding in Spatio-Temporal Human-Object Interactions

Xiaoyang Liu, Boran Wen, Xinpeng Liu, Zizheng Zhou, Hongwei Fan, Cewu Lu, Lizhuang Ma, Yulong Chen, Yong-Lu Li

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments To be published in the Proceedings of AAAI 2025. The first three authors contributed equally. Project: https://github.com/DirtyHarryLYL/HAKE-AVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19187 2025-02-20 cs.CL 82%

Beyond Logit Lens: Contextual Embeddings for Robust Hallucination Detection & Grounding in VLMs

Anirudh Phukan, Divyansh, Harshit Kumar Morj, Vaishnavi, Apoorv Saxena, Koustava Goswami

专题命中 视觉定位与Grounding :grounding(title,abstract);visual question answering(abstract)

Comments Accepted to NAACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19457 2025-02-10 cs.RO 82%

A Parameter-Efficient Tuning Framework for Language-guided Object Grounding and Robot Grasping

Houjian Yu, Mingen Li, Alireza Rezazadeh, Yang Yang, Changhyun Choi

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract)

Comments Accepted for ICRA 2025. Project page: https://sites.google.com/umn.edu/etog-etrg/home

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05155 2024-12-09 cs.CL 82%

Multimodal Fact-Checking with Vision Language Models: A Probing Classifier based Solution with Embedding Strategies

Recep Firat Cekinel, Pinar Karagoz, Cagri Coltekin

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract)

Comments Accepted to COLING2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14832 2024-11-25 cs.CV cs.AI cs.CL cs.LG 82%

VisGraphVar: A Benchmark Generator for Assessing Variability in Graph Analysis Using Large Vision-Language Models

Camilo Chacón Sartori, Christian Blum, Filippo Bistaffa

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11409 2024-11-19 cs.CV cs.AI cs.LG cs.RO 82%

IKEA Manuals at Work: 4D Grounding of Assembly Instructions on Internet Videos

Yunong Liu, Cristobal Eyzaguirre, Manling Li, Shubh Khanna, Juan Carlos Niebles, Vineeth Ravi, Saumitra Mishra, Weiyu Liu, Jiajun Wu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments NeurIPS 2024 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02902 2024-11-06 cs.CV cs.AI cs.CL cs.CR cs.LG 82%

Membership Inference Attacks against Large Vision-Language Models

Zhan Li, Yongtao Wu, Yihang Chen, Francesco Tonin, Elias Abad Rocamora, Volkan Cevher

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09874 2024-10-15 cs.RO 82%

ImagineNav: Prompting Vision-Language Models as Embodied Navigator through Scene Imagination

Xinxin Zhao, Wenzhe Cai, Likun Tang, Teng Wang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract)

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14096 2024-09-24 cs.RO 82%

VLM-Vac: Enhancing Smart Vacuums through VLM Knowledge Distillation and Language-Guided Experience Replay

Reihaneh Mirjalili, Michael Krawez, Florian Walter, Wolfram Burgard

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08966 2024-07-15 cs.CV cs.AI cs.LG 82%

LAPT: Label-driven Automated Prompt Tuning for OOD Detection with Vision-Language Models

Yabin Zhang, Wenjie Zhu, Chenhang He, Lei Zhang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments ECCV2024; Codes and Supp. are available at: https://github.com/YBZh/LAPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01851 2024-07-04 cs.CV cs.AI cs.LG eess.AS 82%

Meerkat: Audio-Visual Large Language Model for Grounding in Space and Time

Sanjoy Chowdhury, Sayan Nag, Subhrajyoti Dasgupta, Jun Chen, Mohamed Elhoseiny, Ruohan Gao, Dinesh Manocha

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19057 2024-07-02 cs.CV cs.AI cs.LG cs.RO 82%

Segment Anything Model for automated image data annotation: empirical studies using text prompts from Grounding DINO

Fuseini Mumuni, Alhassan Mumuni

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏