arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7464 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7464 篇

2406.16860 2024-12-05 cs.CV 72%

Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs

Shengbang Tong, Ellis Brown, Penghao Wu, Sanghyun Woo, Manoj Middepogu, Sai Charitha Akula, Jihan Yang, Shusheng Yang, Adithya Iyer, Xichen Pan, Ziteng Wang, Rob Fergus, Yann LeCun, Saining Xie

专题命中 视觉定位与Grounding :MLLM(abstract,comments);grounding(abstract);分类 cs.CV

Comments NeurIPS 2024 (Oral). Website at https://cambrian-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17177 2026-08-25 cs.SE 版本更新 71%

Grounding AI Agents in Contracts: An Empirical Evaluation of Spec-Driven Test Generation

将AI智能体建立在契约基础上:对规范驱动测试生成的实证评估

Michele Tufano, James McClure, José Cambronero, Runxiang Cheng, Sherry Y. Shi, Renyao Wei, Dorothy Chen, Franjo Ivančić, Livio Dalloro, Pat Rondon

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本研究针对LLM智能体生成测试时易遗漏契约相关边界的问题,提出规范驱动测试生成方法,经Google生产缺陷评估,其缺陷检测率、分支覆盖率均优于基线,测试套件质量也显著更高。

Comments To appear in Proceedings of the 1st International Workshop on Specification-Driven Development Life Cycle (SpecOps 2026), co-located with SPLASH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21031 2026-08-24 cs.RO 新提交 71%

PhysCaP: Grounding Code-as-Policy Agent with Physics-Informed Exploration

PhysCaP:基于物理引导探索的代码即策略智能体

Chen-Yu Lin, Jing-Wen Chen, Hsueh-En Chang, Hung-An Chen, Sheng-Hsun Chang, Chi-Pin Huang, Fu-En Yang, Min-Hung Chen, Yi-Ting Chen, Yu-Chiang Frank Wang, Shao-Hua Sun

机构 * National Taiwan University(台湾大学) NVIDIA Research(英伟达研究院) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 PhysCaP是一种带物理引导探索层的代码即策略智能体,采用双智能体设计,可高效估算物体物理属性,在桌面操纵及LIBERO模拟任务中性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19673 2026-08-21 cs.HC 新提交 71%

Grounding Mindfulness in Embodied Tangibles: A Scoping Review & Theoretical Framework for HCI Design

将正念建立在具身实体之上:面向人机交互设计的范围综述与理论框架

Tharaka Sachintha Ratnayake, Samangi Wadinambiarachchi, Sarah Schömbs, Jonathan Eden, Denny Oetomo, Wafa Johal

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本研究通过对65项正念实体设备的HCI范围综述,提出基于S-ART框架的理论及ESE、ESA模型,为HCI中正念技术的设计、评估及未来研究提供原则性基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01785 2026-08-17 cs.CL cs.SE 版本更新 71%

Seeing is Coding: On the Effectiveness of Vision Language Models in Code Understanding

CodeOCR: 关于视觉语言模型在代码理解中的有效性

Yuling Shi, Chaoxiang Xie, Zhensu Sun, Yeheng Chen, Chenxu Zhang, Longfei Yun, Chengcheng Wan, Hongyu Zhang, David Lo, Xiaodong Gu

机构 * Shanghai Jiao Tong University China Hohai University China Singapore Management University Singapore Imperial College London United Kingdom East China Normal University \& Shanghai Innovation Institute China Chongqing University China Shanghai Jiao Tong University Hohai University Singapore Management University Imperial College London East China Normal University \& Shanghai Innovation Institute Chongqing University

专题命中 视觉定位与Grounding :vision language model(title)

AI总结 本文探讨多模态大语言模型在代码理解中的有效性,发现其可通过图像压缩显著提升效率,并在代码克隆检测等任务中表现出更强的抗压缩能力。

Comments ISSTA 2026 camera ready. Code and data are available at https://github.com/YerbaPage/CodeOCR

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05061 2026-08-12 cs.CL 版本更新 71%

No Free Labels: Limitations of LLM-as-a-Judge Without Human Grounding

无免费标签:缺乏人类基准的LLM作为评判的局限性

Michael Krumdick, Charles Lovering, Varshini Reddy, Seth Ebner, Chris Tanner

机构 * Kensho Technologies MIT(麻省理工学院)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出BFF-Bench基准测试,通过专家评估LLM响应的正确性,揭示LLM作为评判在无人类基准时的局限性,显示当无正确参考时,LLM评判与人类专家的高一致性仅限于LLM能正确回答的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00669 2026-08-04 cs.IR 新提交 71%

GARDRec: Decision-Level Graph Grounding for Large Language Model Recommendation

GARDRec:面向大语言模型推荐的决策级图接地方法

Yong Wang, Hongliang Sun, Jinlan Liu, Hua Zhang, Dianbo Sui, Dianhui Chu, Zhiying Tu

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文针对现有图增强型LLM推荐器排序决策受用户-物品关系约束弱的问题,提出GARDRec框架,通过图接地技术提升下一项推荐的候选排序性能,经实验验证其优于代表性基线。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27136 2026-07-30 cs.IR 新提交 71%

KAMR: Grounding Generation via Knowledge-Aligned Multi-hop Retrieval

KAMR:基于知识对齐多跳检索的接地生成

Xiaochen Wang, Yuan Zhong, Haoyu Wang, Ting Wang, Fenglong Ma

专题命中 视觉定位与Grounding :grounding(title)

AI总结 该研究针对多跳检索中三元组排序与监督缺失问题,提出KAMR知识对齐多跳检索器,通过构建部分对齐数据集优化对比目标,在多基准与LLM主干上提升了多跳检索和下游问答性能。

Comments Accepted by COLM'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21574 2026-07-24 cs.CL 新提交 71%

Surprisal Theory is Tautological (without Rational Grounding)

惊奇理论是同义反复的(缺乏理性基础)

Ryan Cotterell

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 研究惊奇理论,指出其在无额外约束时是同义反复,任何难度模式都与某语言模型一致,无法证伪。长期被隐含假设掩盖,近期实证削弱该假设。结论是打破同义反复需理性主义干预,相关语言模型应源自非经验驱动模型。

Comments Under "Review" at ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01293 2026-07-03 cs.CL 新提交 71%

RuleChef: Grounding LLM Task Knowledge in Human-Editable Rules

RuleChef:将LLM任务知识扎根于可人工编辑的规则

Ádám Kovács, Nadia Verdha, Gábor Recski

机构 * KR Labs(KR实验室) TU Wien(维也纳工业大学)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 提出RuleChef框架,利用大语言模型为NLP任务生成可执行规则,并通过示例和人工反馈迭代优化,最终得到快速、确定且可检查的规则系统。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00895 2026-07-02 cs.CL 新提交 71%

Beyond Document Grounding: Span-Level Hallucination Detection over Code, Tool Output, and Documents

超越文档基础:代码、工具输出和文档上的跨度级幻觉检测

Ádám Kovács, Bowei He, Xue Liu, István Boros, Szilveszter Tóth, Gábor Recski

机构 * KR Labs(KR实验室) MBZUAI(穆罕默德·本·扎耶德人工智能大学) McGill University(麦吉尔大学) TU Wien(维也纳工业大学)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 提出一个统一的跨度级幻觉检测基准,涵盖代码、工具输出、结构化文档和自然语言RAG数据,通过微调Qwen3.5-2B模型在跨域场景下显著优于现有方法。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24208 2026-06-24 cs.RO 新提交 71%

Grounding Generative Policies in Physics: Optimization-Guided Diffusion for Robot Control

将生成式策略基于物理:面向机器人控制的优化引导扩散

Sabrina Bodmer, René Zurbrügg, Tifanny Portela, Hao Ma, Alexandre Didier, Marco Hutter, Colin Jones, Melanie Zeilinger

机构 * ETH Zurich(苏黎世联邦理工学院) EPFL(洛桑联邦理工学院)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 提出推理时优化框架,通过将扩散引导建模为约束优化问题,在采样中施加物理可行性约束,无需重训练即可提升机器人任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18134 2026-06-17 eess.AS 新提交 71%

Grounding Spoken LLMs in Multi-Speaker Audio via Diarization Conditioning

通过说话人日志条件将口语大语言模型扩展到多说话人音频

Alexander Polok, Samuele Cornell, Sathvik Udupa, Jan Černocký, Shinji Watanabe, Lukáš Burget

专题命中 视觉定位与Grounding :grounding(title)

AI总结 提出基于说话人日志条件的口语语言模型,通过条件化声学编码器提取目标说话人表示,避免序列化输出训练导致的灾难性遗忘,在多个数据集上显著提升说话人属性转录性能。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10696 2026-05-22 cs.RO 71%

VRA: Grounding Discrete-Time Joint Acceleration in Voltage-Constrained Actuation

VRA:在电压受限致动器中接地离散时间联合加速度

Lingwei Zhang, Jiaming Wang, Tianlin Zhang, Zhitao Song, Xuanqi Zeng, Weipeng Xia, Zhongyu Li, Yun-hui Liu

机构 * Department of Mechanical and Automation Engineering(机械与自动化工程系) Hong Kong Embodied AI Lab(香港具身AI实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出VRA方法,通过将运动学加速度与电压受限致动器物理相联系,解决在电压受限情况下不可实现的加速度问题,实验表明该方法能消除不可实现的加速度,恢复一致的近约束执行并减少约束引起的振荡。

Comments 10 pages, Accepted by RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18653 2026-05-19 cs.MM 71%

Will It Go Viral? Grounding Micro-Video Popularity Prediction on the Open Web

它会流行吗?基于开放网络的微视频流行度预测

Ryang Heo, Dongha Lee

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出了一种基于开放网络的微视频流行度预测方法,通过引入实时开放网络上下文来提升预测准确性,展示了WEBSHORTS数据集和SHORTS-CAST框架在预测微视频流行度方面的有效性。

Comments Working Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05687 2026-05-11 cs.RO 71%

Contact-Grounded Policy: Dexterous Visuotactile Policy with Generative Contact Grounding

接触导向策略:具备生成接触基础的灵活视觉-触觉策略

Zhengtong Xu, Yeping Wang, Ben Abbatematteo, Jom Preechayasomboon, Sonny Chan, Nick Colonnese, Amirhossein H. Memar

机构 * Purdue University(普渡大学) Meta Reality Labs Research(Meta现实实验室) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出Contact-Grounded Policy,通过预测机器人状态和触觉反馈的耦合轨迹,生成接触基础的灵活视觉-触觉策略,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03059 2026-04-14 cs.HC cs.CL cs.ET cs.IR 71%

From Speech-to-Spatial: Grounding Utterances on A Live Shared View with Augmented Reality

从语音到空间:利用增强现实进行共享视图中话语的定位

Yoonsang Kim, Divyansh Pradhan, Devshree Jadeja, Arie Kaufman

机构 * Center for Visual Computing, Stony Brook University(石溪大学视觉计算中心)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出Speech-to-Spatial框架,通过语音指令生成空间定位的AR指导,无需额外线索或人工标注,提升任务效率和可用性。

Comments 11 pages, 6 figures. This is the author's version of the article that appeared at the IEEE Conference on Virtual Reality and 3D User Interfaces (IEEE VR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09470 2026-04-13 cs.CL 71%

Agentic Jackal: Live Execution and Semantic Value Grounding for Text-to-JQL

代理Jackal:用于文本到JQL的实时执行与语义价值接地

Vishnu Murali, Anmol Gulati, Elias Lumer, Kevin Frank, Sindy Campagna, Vamse Kumar Subbiah

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出Jackal基准,通过实时执行和语义检索工具提升文本到JQL的准确性,验证了代理方法在解决语义歧义中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07592 2026-04-10 cs.RO 71%

Spatio-Temporal Grounding of Large Language Models from Perception Streams

从感知流中对大语言模型进行时空 grounding

Jacob Anderson, Bardh Hoxha, Georgios Fainekos, Hideki Okamoto, Danil Prokhorov

机构 * Toyota Motor North America Research & Development(丰田北美研发中心)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出FESTS框架,通过将自然语言查询转化为SpRE,为大语言模型注入可验证的时空监督,提升时空推理能力,使30亿参数模型在27k数据上实现87.5%的帧级F1分数,接近GPT-4.1性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01630 2026-04-03 cs.CL 71%

Grounding AI-in-Education Development in Teachers' Voices: Findings from a National Survey in Indonesia

将教育中的AI发展扎根于教师的声音:来自印度尼西亚全国调查的结果

Nurul Aisyah, Muhammad Dehan Al Kautsar, Arif Hidayat, Fajri Koto

机构 * Quantic School of Business and Technology(昆蒂克商业与技术学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Indonesia University of Education(印度尼西亚教育大学)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 研究通过全国性调查揭示印尼教师对AI在教育中的应用现状,发现AI在教学、内容开发和教学媒体中日益普及,但应用不均,教师更倾向于利用AI减轻教学准备负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27562 2026-03-31 cs.HC 71%

VoxAnchor: Grounding Speech Authenticity in Throat Vibration via mmWave Radar

VoxAnchor:通过毫米波雷达接地语音真实性 via 喉部振动

Mingda Han, Huanqi Yang, Chaoqun Li, Wenhao Li, Guoming Zhang, Yanni Yang, Yetong Cao, Weitao Xu, Pengfei Hu

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出VoxAnchor系统,通过毫米波雷达捕捉喉部振动,结合语音声学与雷达信号,实现细粒度语音真实性验证,有效检测编辑、拼接等伪造手段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23972 2026-03-26 cs.CL cs.IR 71%

Grounding Arabic LLMs in the Doha Historical Dictionary: Retrieval-Augmented Understanding of Quran and Hadith

以多哈历史词典为基础 grounding Arabic LLMs:检索增强的古兰经和圣训理解

Somaya Eltanbouly, Samer Rashwani

机构 * College of Islamic Studies, Hamad bin Khalifa University(哈马德·本·哈利法大学伊斯兰学院)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出基于多哈历史词典的检索增强生成框架,提升阿拉伯语LLM对历史宗教文本的理解能力,实验表明在Fanar和ALLaM模型上准确率超过85%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06933 2026-03-19 cs.CE cs.CL cs.HC 71%

TxSum: User-Centered Ethereum Transaction Understanding with Micro-Level Semantic Grounding

TxSum: 基于微粒语义锚定的用户导向以太坊交易理解

Zifan Peng, Jingyi Zheng, Yule Liu, Huaiyu Jia, Qiming Ye, Jingyu Liu, Xufeng Yang, Mingchen Li, Qingyuan Gong, Xuechao Wang, Xinlei He

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Wuhan University(武汉大学) University of North Texas(北卡罗来纳州立大学) Fudan University(复旦大学)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出TxSum任务,通过构建187个复杂以太坊交易数据集,引入MATEX框架提升交易解释质量,使用户对复杂交易的理解率从52.9%提升至76.5%,恶意交易拒绝率提升至88%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21045 2026-02-25 cs.HC cs.CL 71%

PaperTrail: A Claim-Evidence Interface for Grounding Provenance in LLM-based Scholarly Q&A

PaperTrail: 一种用于在基于大语言模型的学术问答中建立溯源的声明-证据接口

Anna Martin-Boyle, Cara A. C. Leckey, Martha C. Brown, Harmanpreet Kaur

机构 * University of Minnesota(明尼苏达大学) NASA Langley Research Center(NASA兰利研究中心)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 PaperTrail通过分解LLM回答和源文档为声明与证据,帮助学术领域更严谨地验证LLM的可信度,并揭示其信任worthiness。

Comments 25 pages, 3 figures. Accepted at the ACM CHI conference on Human Factors in Computing Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04047 2026-02-05 cs.HC 71%

From Crafting Text to Crafting Thought: Grounding AI Writing Support to Writing Center Pedagogy

从文本创作到思维创作:将AI写作支持 grounded 到写作中心教学法

Yijun Liu, John Gallagher, Sarah Sterman, Tal August

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出Writor工具,旨在通过目标设定、平衡反馈和对话来支持写作,而非直接生成文本,以促进学生批判性思维和保留其声音。

Comments Conditionally accepted to CHI 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02948 2026-01-09 cs.DB cs.CL 71%

Grounding Natural Language to SQL Translation with Data-Based Self-Explanations

通过数据驱动的自我解释实现自然语言到SQL翻译

Yuankai Fan, Tonghui Ren, Can Huang, Zhenying He, X. Sean Wang

机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出CycleSQL框架,通过数据驱动的自我解释提升自然语言到SQL翻译的准确性和可解释性。

Comments ICDE2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13387 2025-10-17 cs.CL cs.GT 71%

Make an Offer They Can't Refuse: Grounding Bayesian Persuasion in Real-World Dialogues without Pre-Commitment

Buwei He, Yang Liu, Zhaowei Zhang, Zixia Jia, Huijia Wu, Zhaofeng He, Zilong Zheng, Yipeng Kang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Peking University(北京大学)

专题命中 视觉定位与Grounding :grounding(title)

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15476 2025-09-22 cs.CL cs.MM 71%

Evaluating Multimodal Large Language Models on Spoken Sarcasm Understanding

Zhu Li, Xiyuan Gao, Yuqing Zhang, Shekhar Nayak, Matt Coler

机构 * University of Groningen, The Netherlands(Groningen大学,荷兰)

专题命中 视觉定位与Grounding :multimodal large language model(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04918 2025-09-08 physics.hist-ph 71%

Holistic Versus Fragmented Multiverses: Empirical Access via Causal and Grounding Signatures

Baptiste Le Bihan

专题命中 视觉定位与Grounding :grounding(title)

Comments Chapter draft for the Blackwell Companion to the Philosophy and the Multiverse

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13357 2025-08-26 cs.CL 71%

Adaptive Linguistic Prompting (ALP) Enhances Phishing Webpage Detection in Multimodal Large Language Models

Atharva Bhargude, Ishan Gonehal, Dave Yoon, Kaustubh Vinnakota, Chandler Haney, Aaron Sandoval, Kevin Zhu

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 视觉定位与Grounding :multimodal large language model(title)

Comments Published at ACL 2025 SRW, 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏