arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7409 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7409 篇

2606.17710 2026-06-23 cs.CV cs.AI cs.CL cs.LG 新提交 85%

Vision-language models for chest radiography do not always need the image

胸部X光片的视觉-语言模型并不总是需要图像

Mahshad Lotfinia, Sebastian Ziegelmayer, Lisa Adams, Daniel Truhn, Andreas Maier, Soroosh Tayebi Arasteh

机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃尔朗根-纽伦堡大学模式识别实验室) Department of Diagnostic and Interventional Radiology, TUM University Clinic, School of Medicine and Health, Klinikum rechts der Isar, Technical University of Munich(慕尼黑工业大学医学院与健康学院伊萨尔河右岸医院诊断与介入放射学系) Lab for AI in Medicine, RWTH Aachen University(亚琛工业大学医学人工智能实验室) Department of Diagnostic and Interventional Radiology, University Hospital RWTH Aachen(亚琛工业大学医院诊断与介入放射学系)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文通过因果审计方法,发现许多医学视觉-语言模型在胸部X光片任务中依赖文本先验而非图像,纯文本模型与多模态模型性能接近,并提出了基于图像依赖性的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04172 2026-06-04 cs.RO 85%

Affordance2Action: Task-Conditioned Scene-level Affordance Grounding for Real-Time Manipulation

Affordance2Action: 任务条件下的场景级功能区域定位用于实时操作

Litao Liu, Yifan Han, Pengfei Yi, Wenbo Yu, Hanqing Wang, Haoran Du, Enze Yuan, Zilin Yuan, Ruiding Feng, Michael Liu, Qi Zhang, Jingjin Yu

机构 * Department of Computer Science, Rutgers University-New Brunswick(罗格斯大学新布朗斯维尔回声分校计算机科学系) The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学(GZ)) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract,abstract_cn)

AI总结 提出Affordance2Action框架,通过构建A2A-Bench基准和A2A-AffordGen标注流程,解决场景级任务条件功能区域定位中的多区域对应问题,并支持实时操作。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08145 2026-06-01 cs.CV cs.AI cs.LG 85%

Self-Captioning Multimodal Interaction Tuning: Amplifying Exploitable Redundancies for Robust Vision Language Models

自描述多模态交互调优:放大可利用冗余以实现鲁棒的视觉语言模型

Yuriel Ryan, Hei Man Ip, Adriel Kuek, Paul Pu Liang, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡科技设计大学) DSO National Laboratories(国防部国家实验室) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉定位与Grounding :vision language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对视觉语言模型中的幻觉和鲁棒性问题,提出自描述多模态交互调优方法,通过放大模态间冗余信息来补偿受损模态,并设计多模态交互门机制将独特交互转化为冗余交互,实验表明该方法可减少38.3%的视觉诱导错误并提升16.8%的一致性。

Comments Accepted to ICML 2026. Code: https://github.com/yurielryan/Multimodal-Interaction-Tuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06484 2026-06-01 cs.CL 85%

ValueGround: Evaluating Culture-Conditioned Visual Value Grounding in MLLMs

ValueGround: 评估多模态大语言模型中文化条件化的视觉价值基础

Zhipin Wang, Christoph Leiter, Christian Frey, Mohamed Hesham Ibrahim Abdalla, Josif Grabocka, Steffen Eger

机构 * University of Technology Nuremberg (UTN)(图恩大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract_cn)

AI总结 提出ValueGround基准,通过最小对比图像对评估多模态大语言模型在文化条件化视觉价值判断中的表现,发现模型在可视化选项下准确率显著低于文本选项。

Comments Updated preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12686 2026-06-01 cs.RO 85%

SignScene: Visual Sign Grounding for Mapless Navigation

SignScene: 用于无地图导航的视觉标志接地

Nicky Zimmerman, Joel Loo, Benjamin Koh, Zishuo Wang, David Hsu

机构 * Smart Systems Institute, National University of Singapore, 3 Research Link, 117602, Singapore.(新加坡国立大学智能系统研究所) School of Computing, National University of Singapore, 13 Computing Drive, 117417, Singapore.(新加坡国立大学计算机学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract_cn)

AI总结 提出SignScene,一种以标志为中心的空间语义表示方法,利用视觉语言模型将标志的语义指令与场景元素和导航动作对应,实现无地图导航,在114个查询中达到88%的接地准确率。

Comments Under review for a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00061 2026-04-02 cs.RO cs.SY eess.SP eess.SY 85%

Advancing Multi-Robot Networks via MLLM-Driven Sensing, Communication, and Computation: A Comprehensive Survey

通过MLLM驱动的感知、通信与计算推进多机器人网络:综述

Hyun Jong Yang, Howon Lee, Kyuhong Shim, Jeongho Kwak, Hyunsoo Kim, Donghoon Kim, Khoa Anh Ngo, Sehyun Ryu, Jaehyun Choi, Youbin Kim, Chanjun Moon, Michael Ryoo, Byonghyo Shim

机构 * Seoul National University(首尔大学) Ajou University(亚洲大学) Sungkyunkwan University(成均馆大学) Korea University(高丽大学) POSTECH(浦项科技大学) Stony Brook University(石溪大学)

专题命中 视觉定位与Grounding :MLLM(title,abstract);grounding(abstract);multimodal large language model(abstract)

AI总结 本文综述了MLLM指导下的多机器人协调,探讨了集成设计对多机器人协作的影响,展示了四种端到端演示,强调了系统级指标的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20658 2026-02-25 cs.CV cs.AI cs.HC cs.LG 85%

Vision-Language Models for Ergonomic Assessment of Manual Lifting Tasks: Estimating Horizontal and Vertical Hand Distances from RGB Video

用于手动搬运任务的视觉-语言模型:从RGB视频估计水平和垂直手距

Mohammad Sadra Rajabi, Aanuoluwapo Ojelade, Sunwook Kim, Maury A. Nussbaum

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出利用视觉-语言模型从RGB视频中非侵入性估计搬运任务的水平和垂直手距,通过两种多阶段管道验证了该方法的可行性,并展示了分割技术在减少误差方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11007 2026-02-06 cs.CV cs.AI cs.LG 85%

VisMem: Latent Vision Memory Unlocks Potential of Vision-Language Models

VisMem: 通过潜在视觉记忆解锁视觉-语言模型的潜力

Xinlei Yu, Chengming Xu, Guibin Zhang, Zhangquan Chen, Yudong Zhang, Yongbo He, Peng-Tao Jiang, Jiangning Zhang, Xiaobin Hu, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) vivo

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 VisMem通过引入动态潜在视觉记忆模块,提升视觉-语言模型在复杂视觉任务中的性能,实现感知准确性和语义一致性之间的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15209 2025-12-02 cs.CV cs.AI cs.LG 85%

PRIMA: Multi-Image Vision-Language Models for Reasoning Segmentation

PRIMA:多图像视觉-语言模型用于推理分割

Muntasir Wahed, Kiet A. Nguyen, Adheesh Sunil Juvekar, Xinzhuo Li, Xiaona Zhou, Vedant Shah, Tianjiao Yu, Pinar Yanardag, Ismini Lourentzou

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 PRIMA通过整合像素级定位与多图像推理,提升了多图像分割任务的性能,其在Recall和S-IoU上分别优于现有基线7.83%和11.25%。

Comments Project page: https://plan-lab.github.io/prima

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23300 2025-12-01 cs.RO 85%

SafeHumanoid: VLM-RAG-driven Control of Upper Body Impedance for Humanoid Robot

SafeHumanoid: 通过VLM-RAG驱动的人形机器人上半身阻抗控制

Yara Mahmoud, Jeffrin Sam, Nguyen Khang, Marcelino Fernando, Issatay Tokmurziyev, Miguel Altamirano Cabrera, Muhammad Haris Khan, Artem Lykov, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology(斯克洛尔沃科学与技术研究所)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision language model(abstract);grounding(abstract)

AI总结 SafeHumanoid通过VLM-RAG结合自身视觉,实现人形机器人上半身阻抗控制,提升人机交互的安全性与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06836 2025-11-26 cs.CV cs.AI cs.LG 85%

Harnessing Vision-Language Models for Time Series Anomaly Detection

利用视觉语言模型进行时间序列异常检测

Zelin He, Sarah Alnegheimish, Matthew Reimherr

机构 * Amazon(亚马逊公司)

专题命中 视觉定位与Grounding :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出基于视觉语言模型的两阶段方法,无需时间序列训练即可提升时间序列异常检测的准确性和效率。

Comments Accepted at AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04976 2025-11-10 cs.RO 85%

iFlyBot-VLM Technical Report

Xin Nie, Zhiyuan Cheng, Yuan Zhang, Chao Ji, Jiajia Wu, Yuhan Zhang, Jia Pan

机构 * iFlyTek Reasearch and Development Group(iFlyTek 研发部)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15685 2025-11-04 cs.RO 85%

From Grounding to Manipulation: Case Studies of Foundation Model Integration in Embodied Robotic Systems

Xiuchao Sui, Daiying Tian, Qi Sun, Ruirui Chen, Dongkyu Choi, Kenneth Kwok, Soujanya Poria

机构 * IHPC, Agency for Science, Technology and Research, Singapore(科技研究局智能技术中心,新加坡) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);multimodal large language model(abstract)

Comments EMNLP 2025 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13365 2025-10-22 cs.CV cs.AI cs.LG 85%

VLLFL: A Vision-Language Model Based Lightweight Federated Learning Framework for Smart Agriculture

Long Li, Jiajia Li, Dong Chen, Lina Pu, Haibo Yao, Yanbo Huang

机构 * Department of Electrical and Computer Engineering, The University of Alabama(电气与计算机工程系,阿拉巴马大学) Electrical and Computer Engineering, Michigan State University(电气与计算机工程,密歇根州立大学) Agricultural and Biological Engineering, Mississippi State University(农业与生物工程,密苏里州立大学) Department of Computer Science, University of Alabama(计算机科学系,阿拉巴马大学) USDA-ARS Genetics and Sustainbale Agriculture(美国农业部ARS基因与可持续农业)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13993 2025-10-17 cs.CV cs.AI cs.LG 85%

Efficient Few-Shot Learning in Remote Sensing: Fusing Vision and Vision-Language Models

Jia Yun Chua, Argyrios Zolotas, Miguel Arana-Catania

机构 * Cranfield University(克兰菲尔德大学) University of Oxford(牛津大学)

专题命中 视觉定位与Grounding :vision-language model(title);vision language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 11 pages, 7 figures, 8 tables. To be published in Applied AI Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08209 2025-10-17 cs.CV cs.AI cs.LG 85%

Emergent Visual Grounding in Large Multimodal Models Without Grounding Supervision

Shengcao Cao, Liang-Yan Gui, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉定位与Grounding :grounding(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments ICCV 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23745 2025-09-25 cs.CV cs.AI cs.LG 85%

To Trust Or Not To Trust Your Vision-Language Model's Prediction

Hao Dong, Moru Liu, Jian Liang, Eleni Chatzi, Olga Fink

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07939 2025-07-23 cs.CL 85%

SAGE: A Visual Language Model for Anomaly Detection via Fact Enhancement and Entropy-aware Alignment

Guoxin Zang, Xue Li, Donglin Di, Lanshun Nie, Dechen Zhan, Yang Song, Lei Fan

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of New South Wales(新南威尔士大学)

专题命中 视觉定位与Grounding :visual language model(title);vision-language model(abstract);VLM(abstract);visual reasoning(abstract)

Comments Accepted by ACMMM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14538 2025-04-02 eess.IV cs.AI cs.CV cs.LG 85%

Vision-Language Models for Acute Tuberculosis Diagnosis: A Multimodal Approach Combining Imaging and Clinical Data

Ananya Ganapthy, Praveen Shastry, Naveen Kumarasami, Anandakumar D, Keerthana R, Mounigasri M, Varshinipriya M, Kishore Prasath Venkatesh, Bargava Subramanian, Kalyan Sivasailam

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08722 2025-03-18 cs.CV cs.AI cs.LG 85%

A Recipe for Improving Remote Sensing VLM Zero Shot Generalization

Aviad Barzilai, Yotam Gigi, Amr Helmy, Vered Silverman, Yehonathan Refael, Bolous Jaber, Tomer Shekel, George Leifman, Genady Beryozkin

专题命中 视觉定位与Grounding :VLM(title,abstract);visual language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06912 2025-03-04 cs.CV cs.AI cs.LG 85%

Compositional Entailment Learning for Hyperbolic Vision-Language Models

Avik Pal, Max van Spengler, Guido Maria D'Amely di Melendugno, Alessandro Flaborea, Fabio Galasso, Pascal Mettes

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted as oral paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04559 2024-10-28 cs.CL cs.AI cs.CV cs.LG 85%

Not (yet) the whole story: Evaluating Visual Storytelling Requires More than Measuring Coherence, Grounding, and Repetition

Aditya K Surikuchi, Raquel Fernández, Sandro Pezzelle

专题命中 视觉定位与Grounding :grounding(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

Comments In proceedings of EMNLP 2024 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19696 2024-05-01 cs.CV cs.AI cs.CL cs.LG 85%

Naturally Supervised 3D Visual Grounding with Language-Regularized Concept Learners

Chun Feng, Joy Hsu, Weiyu Liu, Jiajun Wu

专题命中 视觉定位与Grounding :grounding(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

Comments CVPR 2024. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10093 2023-11-08 cs.CV cs.AI cs.CL cs.LG 85%

Investigating the Role of Attribute Context in Vision-Language Models for Object Recognition and Detection

Kyle Buettner, Adriana Kovashka

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at Winter Conference on Applications of Computer Vision (WACV), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.06403 2022-07-14 cs.CV cs.AI cs.CL cs.GR cs.LG 85%

3D Concept Grounding on Neural Fields

Yining Hong, Yilun Du, Chunru Lin, Joshua B. Tenenbaum, Chuang Gan

专题命中 视觉定位与Grounding :grounding(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project page: http://3d-cg.csail.mit.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15925 2025-11-19 cs.CV cs.AI 84%

MiniGPT-Pancreas: Multimodal Large Language Model for Pancreas Cancer Classification and Detection

Andrea Moglia, Elia Clement Nastasio, Luca Mainardi, Pietro Cerveri

机构 * Department of Electronics, Information, and Bioengineering(电子、信息与生物工程系) Polytechnic University of Milan(米兰理工学院) Department of Industrial, and Information Engineering(工业与信息工程系) University of Pavia(帕维亚大学)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Journal ref Moglia, A., Nastasio, E.C., Mainardi, L. et al. MiniGPT-Pancreas: Multimodal Large Language Model for Pancreas Cancer Observation and Localization in CT Images. J Healthc Inform Res (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19294 2025-10-01 cs.CV cs.AI cs.CL 84%

Object Detection with Multimodal Large Vision-Language Models: An In-depth Review

Ranjan Sapkota, Manoj Karkee

专题命中 视觉定位与Grounding :vision-language model(title,abstract);vision language model(abstract);分类 cs.CV、cs.AI

Comments First Peer Reviewed Review Paper for Object Detection with Vision-Language Models (VLMs)

Journal ref Information Fusion, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09480 2025-04-15 cs.CV cs.AI 84%

Vision-Language Model for Object Detection and Segmentation: A Review and Evaluation

Yongchao Feng, Yajie Liu, Shuai Yang, Wenrui Cai, Jinqing Zhang, Qiqi Zhan, Ziyue Huang, Hongxi Yan, Qiao Wan, Chenguang Liu, Junzhe Wang, Jiahui Lv, Ziqi Liu, Tengyuan Shi, Qingjie Liu, Yunhong Wang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments A Review and Evaluation about Vision-Language Model for Object Detection and Segmentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01525 2024-07-18 cs.CV cs.AI cs.CL 84%

ScanReason: Empowering 3D Visual Grounding with Reasoning Capabilities

Chenming Zhu, Tai Wang, Wenwei Zhang, Kai Chen, Xihui Liu

专题命中 视觉定位与Grounding :grounding(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted by ECCV 2024. A comprehensive and hierarchical 3D reasoning grounding benchmark in the era of foundation models. Project page: https://zcmax.github.io/projects/ScanReason

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.05704 2024-04-24 cs.CV cs.AI cs.CL 84%

Visual Grounding Methods for VQA are Working for the Wrong Reasons!

Robik Shrestha, Kushal Kafle, Christopher Kanan

专题命中 视觉定位与Grounding :grounding(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

Comments Published in ACL 2020 under the title "A negative case analysis of visual grounding methods for VQA"

详情

展开后加载摘要…

URL PDF HTML 收藏