arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7473 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7473 篇

2606.13435 2026-06-12 cs.RO 新提交 78%

GIVE: Grounding Human Gestures in Vision-Language-Action Models

GIVE:在视觉-语言-动作模型中接地人类手势

Pengfei Liu, Gen Li, Junqiao Fan, Boyu Ma, Jindou Jia, Yang Xiao, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 针对VLA模型忽略手势导致意图理解不准的问题,提出GIVE方法,通过视觉和语义双路径增强手势理解,在真实HRI实验中目标识别准确率提升40%,任务成功率提升80%。

Comments Project page: https://luis-cloud-sg.github.io/GIVE-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03855 2026-06-11 cs.SD 版本更新 78%

A Sensitivity Analysis of Multi-Event Audio Grounding in Audio LLMs

音频大语言模型中多事件音频定位的敏感性分析

Taehan Lee, Jaehan Jung, Hyukjun Lee

机构 * Sogang University(ソンガン大学)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 通过大规模评估,发现音频大语言模型在复杂声学场景中事件数量增加会导致真阳性率下降和假阳性率上升,提示词则引入权衡,模型对多事件音频更不确定。

Comments 6 pages, Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06506 2026-06-08 physics.app-ph 新提交 78%

Dynamic Modeling of Magneto-Active Grounding Electrodes under Transient Conditions

瞬态条件下磁活性接地电极的动态建模

José M. Campos-Salazar

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 针对瞬态条件下接地系统的非线性行为,提出一种考虑电磁耦合、电热效应和电离机制的磁活性接地电极非线性动态模型,并在MATLAB/Simulink中验证其动态阻抗特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02277 2026-06-02 cs.RO 78%

RoboSemanticBench: Diagnosing Semantic Grounding in Action Prediction for VLA Models

RoboSemanticBench: 诊断 VLA 模型在动作预测中的语义基础

Bin Yu, Yao Zhang, Haishan Liu, Shijie Lian, Yuliang Wei, Xiaopeng Lin, Zhaolong Shen, Changti Wu, Ruina Hu, Bailing Wang, Cong Huang, Kai Chen

机构 * HIT(哈尔滨工业大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢集团智能计算研究所) WHU(武汉大学) HUST(华中科技大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ECNU(华东师范大学) DeepCybo

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 提出 RoboSemanticBench 基准,通过多选问答任务评估 VLA 模型是否利用指令语义选择正确物体,发现模型在语义正确选择上接近随机,揭示语义理解与动作预测之间的差距。

Comments GitHub: https://github.com/ZGC-EmbodyAI/RoboSemanticBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19420 2026-05-20 cs.RO 78%

Beyond Waypoints: Dual-Heatmap Grounding for Cross-Embodiment Semantic Navigation

超越航点:双热图接地用于跨具身语义导航

Kaijie Yun, Yue Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) JD AI Research(京东人工智能研究院)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 本文提出一种统一的视觉-语言框架,通过双热图表示替代单点回归,以解决语义指令与物理可达性之间的差距,从而提升跨具身语义导航的鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07818 2026-04-27 cs.MA 78%

Open-Ended Video Game Glitch Detection with Agentic Reasoning and Temporal Grounding

基于代理推理和时间定位的开放式视频游戏漏洞检测

Muyang Zheng, Tong Zhou, Geyang Wu, Zihao Lin, Haibo Wang, Lifu Huang

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 本文提出VideoGlitchBench基准和GliDe框架,通过代理推理和时间定位检测视频游戏中的漏洞,提升语义理解和时间定位能力。

Comments 16 pages, 10 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08246 2026-03-13 cs.RO 78%

FSAG: Enhancing Human-to-Dexterous-Hand Finger-Specific Affordance Grounding via Diffusion Models

FSAG: 通过扩散模型增强人对灵巧手手指特定 affordance 的 grounding

Yifan Han, Yichuan Peng, Pengfei Yi, Junyan Li, Hanqing Wang, Gaojing Zhang, Qi Peng Liu, Wenzhao Lian

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 本文提出FSAG框架,通过扩散模型提取语义affordance,实现稳定多接触抓取,无需硬件特定数据集,且单模态深度信息即可实现高性能抓取合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02484 2026-03-04 cs.RO math.OC 78%

COLREGs Compliant Collision Avoidance and Grounding Prevention for Autonomous Marine Navigation

自主水运船舶的碰撞规避与搁浅预防:符合国际海上避碰规则

Mayur S. Patil, Nataraj Sudharsan, Veneela Ammula, Jude Tomdio, Jin Wang, Michael Kei, Sivakumar Rathinam, Prabhakar R. Pagilla

机构 * Department of Mechanical Engineering, Texas A&M University, College Station, USA(德克萨斯A&M大学机械工程系) American Bureau of Shipping, Spring, TX, USA(美国船舶局)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 本文提出了一种基于凸优化的运动规划方法,用于自主水运船舶的碰撞规避、COLREGs合规性和搁浅预防。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24143 2026-03-02 cs.RO 78%

Robust Skills, Brittle Grounding: Diagnosing Restricted Generalization in Vision-Language Action Policies via Multi-Object Picking

稳健的技能,脆弱的接地:通过多对象拾取诊断视觉语言动作策略中的受限泛化

David Emukpere, Romain Deffayet, Jean-Michel Renders

机构 * Naver Labs Europe(纳维尔实验室欧洲)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 通过多对象拾取实验发现,视觉语言动作策略在复杂环境下执行基本操作比遵循指令更可靠,表明技能获取与指令遵循脱节,需改进基准测试以更准确诊断泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18031 2026-02-23 cs.CV cs.AI cs.LG 78%

ViGText: Deepfake Image Detection with Vision-Language Model Explanations and Graph Neural Networks

ViGText: 基于视觉-语言模型解释和图神经网络的深度伪造图像检测

Ahmad ALBarqawi, Mahmoud Nazzal, Issa Khalil, Abdallah Khreishah, NhatHai Phan

机构 * New Jersey Institute of Technology(新泽西理工学院) Old Dominion University(旧 Dominion 大学)

专题命中 视觉定位与Grounding :vision-language model(title);分类 cs.CV、cs.AI、cs.LG

AI总结 ViGText结合视觉-语言模型解释和图神经网络,提升深度伪造检测的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13800 2026-02-17 cs.RO cs.HC 78%

Ontological grounding for sound and natural robot explanations via large language models

通过大语言模型实现声音和自然的机器人解释的本体论基础

Alberto Olivares-Alarcos, Muhammad Ahsan, Satrio Sanjaya, Hsien-I Lin, Guillem Alenyà

机构 * Institute of Electrical and Control Engineering, National Yang Ming Chiao Tung University(电子与控制工程研究所,国立阳明交通大学)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 本文提出结合本体推理与大语言模型的框架,以生成自然且语义准确的机器人解释,提升人机交互的透明度和可解释性。

Comments An extended abstract of this article is accepted for presentation at AAMAS 2026: Olivares-Alarcos, A., Muhammad, A., Sanjaya, S., Lin, H. and Alenyà, G. (2026). Blending ontologies and language models to generate sound and natural robot explanations. In Proceedings of the International Conference on Autonomous Agents and Multiagent Systems. IFAAMAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07497 2026-02-13 cs.CL 78%

From Native Memes to Global Moderation: Cross-Cultural Evaluation of Vision-Language Models for Hateful Meme Detection

从本土迷因到全球监管:跨文化评估视觉-语言模型在仇恨迷因检测中的应用

Mo Wang, Kaixuan Ren, Pratik Jalan, Ahmed Ashraf, Tuong Vy Vu, Rahul Seetharaman, Shah Nawaz, Usman Naseem

机构 * Macquarie University(麦考瑞大学) Nile University(尼罗大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Johannes Kepler University(约翰尼斯·开普勒大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract)

AI总结 本文通过跨文化评估揭示视觉-语言模型在仇恨迷因检测中的文化偏见问题,并提出本土语言提示和一样本学习等改进策略以提升模型的公平性和鲁棒性。

Comments 12 pages, 5 figures, Proceedings of the ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10399 2026-02-12 cs.RO 78%

LocoVLM: Grounding Vision and Language for Adapting Versatile Legged Locomotion Policies

LocoVLM:为适应多功能腿式运动策略而 grounding 视觉和语言

I Made Aswin Nahrendra, Seunghyun Lee, Dongkyu Lee, Hyun Myung

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(电气工程学院,韩国科学技术院)

专题命中 视觉定位与Grounding :grounding(title);vision-language model(abstract)

AI总结 LocoVLM通过整合高层常识推理和视觉语言模型,实现了基于指令的实时腿式运动策略适应,准确率达87%。

Comments Project page: https://locovlm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23129 2026-02-02 cs.CL 78%

Evaluating the Utility of Grounding Documents with Reference-Free LLM-based Metrics

评估基于参考-free LLM的文档接地的效用

Yilun Hua, Giuseppe Castellucci, Peter Schulam, Heba Elfardy, Kevin Small

机构 * Department of Computer Science and Cornell Tech, Cornell University(计算机科学系和Cornell Tech,康奈尔大学)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 本文提出GroGU,一种无需注释的模型特定指标,用于评估RAG中文档接地的效用,通过优化查询重写器提升了检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18323 2026-01-27 cs.RO 78%

TC-IDM: Grounding Video Generation for Executable Zero-shot Robot Motion

TC-IDM:为可执行零样本机器人运动实现视频生成

Weishi Mi, Yong Bao, Xiaowei Chi, Xiaozhu Ju, Zhiyuan Qin, Kuangzhi Ge, Kai Tang, Peidong Jia, Shanghang Zhang, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) State Key Laboratory of Multimedia Information Processing(多媒体信息处理国家重点实验室) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 视觉定位与Grounding :grounding(title);vision-language model(abstract)

AI总结 TC-IDM通过工具中心逆动力学模型实现视频生成,提升机器人零样本任务的执行能力与泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07645 2026-01-13 cs.CL 78%

PlaM: Training-Free Plateau-Guided Model Merging for Better Visual Grounding in MLLMs

PlaM: 无需训练的高原引导模型融合以提升多模态大语言模型的视觉语义

Zijing Wang, Yongkang Liu, Mingyang Wang, Ercong Nie, Deyuan Chen, Zhengjie Zhao, Shi Feng, Daling Wang, Xiaocui Yang, Yifei Zhang, Hinrich Schütze

机构 * Northeastern University, China(东北大学) CIS, LMU Munich, Germany(慕尼黑大学计算机学院) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心)

专题命中 视觉定位与Grounding :grounding(title);multimodal large language model(abstract)

AI总结 PlaM通过无需训练的高原引导模型融合方法,提升多模态大语言模型的视觉语义表现。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03669 2026-01-08 cs.CL 78%

eTracer: Towards Traceable Text Generation via Claim-Level Grounding

eTracer:通过声明级 grounding 实现可追溯的文本生成

Bohao Chu, Qianli Wang, Hendrik Damm, Hui Wang, Ula Muhabbek, Elisabeth Livingstone, Christoph M. Friedrich, Norbert Fuhr

机构 * University of Duisburg-Essen(杜伊斯堡-埃森大学) Technische Universität Berlin(柏林技术大学) University of Applied Sciences and Arts Dortmund(多特蒙德应用科学大学) University Hospital Essen(埃森大学医院)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 eTracer 通过声明级 grounding 提升文本生成的可追溯性和可信度,改进了生物医学领域响应的验证效率。

Comments ACL 2026 Conference Submission (8 main pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00168 2026-01-05 physics.hist-ph 78%

From Grounding to Stabilisation: Adequacy as a Criterion for Scientific Explanation

从基础到稳定化:充足性作为科学解释的标准

Jonathon Sendall

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 本文提出基于稳定化的科学解释标准,通过可测量不变性测试解决无限倒退问题,统一理论变化、量子测量和数学有效性等核心问题。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.01481 2025-12-11 cs.CL 78%

The Vector Grounding Problem

向量语义问题

Dimitri Coelho Mollo, Raphaël Millière

机构 * Umeå University(乌梅大学) University of Oxford(牛津大学)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 本文探讨了大型语言模型是否能通过指涉 grounding 实现对现实世界的联系,提出了基于因果-信息关系和选择历史的判断标准。

Comments Accepted for publication in Philosophy and the Mind Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13247 2025-12-05 cs.CL 78%

Grounding LLM Reasoning with Knowledge Graphs

通过知识图谱 grounding 大语言模型的推理

Alfonso Amayuelas, Joy Sain, Simerjot Kaur, Charese Smiley

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) JP Morgan AI Research(摩根大通人工智能研究)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 通过知识图谱 grounding 大语言模型的推理,提升推理的准确性和可解释性

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18270 2025-11-25 cs.RO 78%

Skypilot: Fine-Tuning LLM with Physical Grounding for AAV Coverage Search

Skypilot: 通过物理现实 grounding 提升 LLM 在 AAV 覆盖搜索中的微调

Zhongkai Chen, Yihao Sun, Chao Yan, Han Zhou, Xiaojia Xiang, Jie Jiang

机构 * College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学) College of Automation Engineering, Nanjing University of Aeronautics and Astronautics(自动化工程学院,南京航空航天大学) China Academy of Launch Vehicle Technology(中国运载火箭技术研究院)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 Skypilot通过结合MCTS和物理感知奖励函数,提升LLM在AAV覆盖搜索中的微调效果,实现高效且高质量的决策与路径规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08546 2025-11-21 cs.RO 78%

Grounding LLMs For Robot Task Planning Using Closed-loop State Feedback

通过闭环状态反馈接地LLMs用于机器人任务规划

Vineet Bhat, Ali Umut Kaypak, Prashanth Krishnamurthy, Ramesh Karri, Farshad Khorrami

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 本文提出BrainBody-LLM方法,通过闭环反馈机制提升LLMs在机器人任务规划中的鲁棒性,实现在复杂任务中的显著性能提升。

Comments Preprint version. Accepted full paper available here: https://advanced.onlinelibrary.wiley.com/doi/10.1002/adrr.202500072

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10912 2025-10-16 cs.RO 78%

More than A Point: Capturing Uncertainty with Adaptive Affordance Heatmaps for Spatial Grounding in Robotic Tasks

Xinyu Shao, Yanzhe Tang, Pengwei Xie, Kaiwen Zhou, Yuzheng Zhuang, Xingyue Quan, Jianye Hao, Long Zeng, Xiu Li

机构 * Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) Noah’s Ark Lab, Huawei, China(华为诺亚实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract)

Comments More details and videos can be found at https://robo-map.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07019 2025-09-26 cs.HC 78%

Case Law Grounding: Using Precedents to Align Decision-Making for Humans and AI

Quan Ze Chen, Amy X. Zhang

专题命中 视觉定位与Grounding :grounding(title,abstract)

Comments Accepted at ACM Collective Intelligence 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15837 2025-09-22 cs.CL 78%

The Curious Case of Visual Grounding: Different Effects for Speech- and Text-based Language Encoders

Adrian Sauter, Willem Zuidema, Marianne de Heer Kloots

机构 * Institute for Logic, Language and Computation(逻辑、语言与计算研究所) University of Amsterdam(阿姆斯特丹大学)

专题命中 视觉定位与Grounding :grounding(title,abstract)

Comments 5 pages, 3 figures, Submitted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11068 2025-08-18 cs.CL 78%

Approaching the Source of Symbol Grounding with Confluent Reductions of Abstract Meaning Representation Directed Graphs

Nicolas Goulet, Alexandre Blondin Massé, Moussa Abdendi

专题命中 视觉定位与Grounding :grounding(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01408 2025-08-05 cs.CY 78%

Artificial Intelligence and Misinformation in Art: Can Vision Language Models Judge the Hand or the Machine Behind the Canvas?

Tarian Fu, Javier Conde, Gonzalo Martínez, Pedro Reviriego, Elena Merino-Gómez, Fernando Moral

专题命中 视觉定位与Grounding :vision language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06493 2025-08-05 stat.AP 78%

Near-real-time ship grounding damage assessment using Bayesian networks

Dimitris G. Georgiadis, Manolis S. Samuelides, Daniel Straub

专题命中 视觉定位与Grounding :grounding(title,abstract)

Comments Preprint submitted to Elsevier journal

Journal ref Ocean Engineering 339 (2025) 122132

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07501 2025-08-04 cs.DB 78%

Data-CASE: Grounding Data Regulations for Compliant Data Processing Systems

Vishal Chakraborty, Stacy Ann-Elvy, Sharad Mehrotra, Faisal Nawab, Mohammad Sadoghi, Shantanu Sharma, Nalini Venkatsubhramanian, Farhan Saeed

专题命中 视觉定位与Grounding :grounding(title,abstract)

Comments To appear in EDBT '24

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14851 2025-07-22 cs.CV cs.AI cs.LG eess.IV 78%

Grounding Degradations in Natural Language for All-In-One Video Restoration

Muhammad Kamran Janjua, Amirhosein Ghasemabadi, Kunlin Zhang, Mohammad Salameh, Chao Gao, Di Niu

机构 * Huawei Technologies, Canada(华为技术有限公司,加拿大) ECE Department, University of Alberta, Canada(阿尔伯塔大学电子工程系,加拿大)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV、cs.AI、cs.LG

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏