arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7464 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7464 篇

2007.11660 2020-08-05 astro-ph.SR 71%

Detection and characterisation of two VLM binaries: LP 1033-31 and LP 877-72

Subhajeet Karmakar, A. S. Rajpurohit, F. Allard, D. Homeier

专题命中 视觉定位与Grounding :VLM(title)

Comments 14 pages, 6 figures, accepted for publication in MNRAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.04428 2020-07-10 cs.CL 71%

Discourse Coherence, Reference Grounding and Goal Oriented Dialogue

Baber Khalid, Malihe Alikhani, Michael Fellner, Brian McMahan, Matthew Stone

专题命中 视觉定位与Grounding :grounding(title)

Comments Accepted for Publishing at SemDial 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.02177 2020-01-17 cs.CL 71%

NERO: A Neural Rule Grounding Framework for Label-Efficient Relation Extraction

Wenxuan Zhou, Hongtao Lin, Bill Yuchen Lin, Ziqi Wang, Junyi Du, Leonardo Neves, Xiang Ren

专题命中 视觉定位与Grounding :grounding(title)

Comments Accepted by WWW2020. Code available at https://github.com/INK-USC/NERO

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.11279 2019-08-30 cs.CL 71%

Grounded Agreement Games: Emphasizing Conversational Grounding in Visual Dialogue Settings

David Schlangen

专题命中 视觉定位与Grounding :grounding(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.13595 2019-08-01 gr-qc 71%

A Local Resolution of the Problem of Time. XIV. Grounding on Lie's Mathematics

Edward Anderson

专题命中 视觉定位与Grounding :grounding(title)

Comments 44 pages including 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.03228 2019-07-09 cs.CL 71%

Zero-Shot Open Entity Typing as Type-Compatible Grounding

Ben Zhou, Daniel Khashabi, Chen-Tse Tsai, Dan Roth

专题命中 视觉定位与Grounding :grounding(title)

Comments 16 pages, 5 figures, Accepted at EMNLP 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.07078 2019-04-16 cs.CL cs.SD eess.AS 71%

Semantic query-by-example speech search using visual grounding

Herman Kamper, Aristotelis Anastassiou, Karen Livescu

专题命中 视觉定位与Grounding :grounding(title)

Comments Accepted to ICASSP 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.03865 2019-02-21 cs.CL 71%

Multimodal Grounding for Sequence-to-Sequence Speech Recognition

Ozan Caglayan, Ramon Sanabria, Shruti Palaskar, Loïc Barrault, Florian Metze

专题命中 视觉定位与Grounding :grounding(title)

Comments ICASSP 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.09055 2018-05-24 cs.CL 71%

Grounding the Semantics of Part-of-Day Nouns Worldwide using Twitter

David Vilares, Carlos Gómez-Rodríguez

专题命中 视觉定位与Grounding :grounding(title)

Comments In PEOPLES2018 short papers (NAACL workshop), 6 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
1607.07565 2016-07-27 cs.CL 71%

Grounding Dynamic Spatial Relations for Embodied (Robot) Interaction

Michael Spranger, Jakob Suchan, Mehul Bhatt, Manfred Eppe

专题命中 视觉定位与Grounding :grounding(title)

Comments in: Pham, D.-N. and Park, S.-B., editors, PRICAI 2014: Trends in Artificial Intelligence, volume 8862 of Lecture Notes in Computer Science, pages 958-971. Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
1504.04901 2015-10-29 math.ST stat.TH 71%

Theoretical Grounding for Estimation in Conditional Independence Multivariate Finite Mixture Models

Xiaotian Zhu, David R. Hunter

专题命中 视觉定位与Grounding :grounding(title)

Comments 21 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
1403.3295 2014-09-30 quant-ph 71%

Relational causality and classical probability: Grounding quantum phenomenology in a superclassical theory

Gerhard Groessing, Siegfried Fussy, Johannes Mesa Pascasio, Herbert Schwabl

专题命中 视觉定位与Grounding :grounding(title)

Comments 22 pages, 5 figures; talk presented at the 2nd international symposium on "Emergent Quantum Mechanics" (Vienna, Austria, 3-6 October, 2013), http://www.emqm13.org/. To be published in J. Phys.: Conf. Ser. (2014)

Journal ref J. Phys.: Conf. Ser. (2014) 504 012006

详情

展开后加载摘要…

URL PDF HTML 收藏
quant-ph/0102105 2009-12-01 quant-ph 71%

On the grounding of spin effects in theory of synchrotron radiation

V. A. Bordovitsyn, A. N. Myagkii

专题命中 视觉定位与Grounding :grounding(title)

Comments 6 pages, LATEX

Journal ref Nucl. Instr. and Meth. A448 (2000) 81-84

详情

展开后加载摘要…

URL PDF HTML 收藏
0706.2522 2009-12-01 quant-ph 71%

Grounding Bohmian Mechanics in Weak Values and Bayesianism

H. M. Wiseman

专题命中 视觉定位与Grounding :grounding(title)

Comments 11 pages

Journal ref New J. Phys. 9 165 (2007)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24281 2026-08-26 cs.CV 新提交 70%

Example-based Robust Abnormality Detection with Minimal Annotations using Exemplar Med-DETR

基于范例的、使用最少标注的鲁棒异常检测:Exemplar Med-DETR

Sheethal Bhat, Bogdan Georgescu, Awais Mansoor, Mathias Zinnen, Pranjal Sahu, Florin C. Ghesu, Sasa Grbic, Andreas Maier

机构 * Friedrich-Alexander-Universität(弗里德里希-亚历山大大学) Siemens Healthineers(西门子医疗) Siemens Medical Solutions(西门子医疗解决方案)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对医学目标检测标注需求高的问题,扩展EM-DETR框架提出Exemplar Med-DETR方法,结合基于范例的特征生成与领域感知对比优化,用不足10%标注数据实现接近SOTA的胸部X射线异常检测性能,适配新疾病发现且无需大量重训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24212 2026-08-26 cs.CV 新提交 70%

NeoWorld-Pro: Programming Interactive Scenes from Monocular Images for Embodied Simulation

NeoWorld-Pro:从单目图像编程交互式场景以实现具身仿真

Yumeng He, Yichen Song, Xiaotian Yang, Weijia Zhang, Zanwei Zhou, Junru Gong, Xiaokang Yang, Yunbo Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 针对具身AI中图像转仿真场景的物理与交互性不足问题,提出NeoWorld-Pro框架,通过MLLMs将单目图像转为可执行程序,结合物理在环机制优化,性能优于现有方法并支持复杂下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23845 2026-08-26 cs.CV 新提交 70%

Object Counting Across Modalities: Taxonomies, Benchmarks, Applications, and Open Challenges

跨模态物体计数:分类体系、基准、应用及开放挑战

Joana Konadu Owusu, Shivanand Venkanna Sheshappanavar

机构 * University of Wyoming(怀俄明大学) Geometric Intelligence Research Lab.(几何智能研究实验室)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本综述针对跨模态物体计数领域,提出五轴分类体系,梳理应用领域挑战,给出路线图,强调需构建稳健评估基础设施区分开放世界泛化与基准优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22883 2026-08-25 cs.CV 新提交 70%

FOVEA: Focused On-Demand Visual Evidence Adaptation for Cache-Friendly Multimodal Speculative Decoding

FOVEA:面向缓存友好型多模态推测解码的聚焦式按需视觉证据适配

Hengjie Zhu, Dayan Wu, Zihao Zhang, Xinze Liu, Jingxuan Yu, Peng Fu, Zheng Lin, Weiping Wang, Ding Wang

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 FOVEA是一种缓存友好型多模态推测解码方法,通过动态检索视觉记忆子集提升草稿接受率,使多模态生成速度最高提升2.13倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21476 2026-08-25 cs.SE cs.CV 新提交 70%

From Subjective Judgments to Auditable Standards:Protocol-Guided AI Auditing of Website Redundancy

从主观判断到可审计标准:协议引导的网站冗余度AI审计

Ge Kong, Yongtong Cao

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出CORA审计方法,通过多维度测量分离网站冗余的不同含义,在测试台上表现优于基线,对不达标工具弃权自动评分,是受控基准的可审计候选程序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31192 2026-08-25 cs.CV 版本更新 70%

Specialist-Generalist Fusion with Outcome-Supervised Rationales for Deepfake Detection

语言训练深度伪造检测器的正则化能力

Benedikt Hopf, Zongwei Wu, Radu Timofte

机构 * Computer Vision Lab, CAIDAS, University of Würzburg(计算机视觉实验室,CAIDAS,乌尔姆大学)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出利用多模态大语言模型的双编码器架构和两阶段训练,通过语言正则化缓解过拟合,提升深度伪造检测的泛化性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13433 2026-08-25 cs.RO cs.AI 70%

Spatially Grounded Long-Horizon Task Planning in the Wild

在真实环境中进行具有长时域的任务规划

Sehun Jung, HyunJee Song, Dong-Hee Kim, Reuben Tan, Jianfeng Gao, Yong Jae Lee, Donghyun Kim

机构 * Korea University(韩国大学) Microsoft Research(微软研究院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 本文提出了一种基于空间的规划任务,引入了GroundedPlanBench基准,评估机器人在真实环境中的长时域动作规划能力,并通过V2GP框架提升空间接地规划性能。

Comments 9 pages, 7 figures

Journal ref 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20831 2026-08-24 cs.CL cs.AI 新提交 70%

STAR-OPD: Structured Aspect-Cascade-Aware On-Policy Reward Distillation for ABSA Quadruple Extraction

STAR-OPD:面向ABSA四元组抽取的结构化级联感知在线策略奖励蒸馏

Tong Sun, Mingyang Ma, Jiayang Yu

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对ABSA四元组抽取中蒸馏模型的结构错误问题,提出STAR-OPD方法,通过在线策略蒸馏结合级联感知集结构奖励,在多个数据集上优于基线,缩小了学生-教师差距并提升了推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16806 2026-08-20 cs.RO cs.AI 版本更新 70%

Breaking Planner Integrity Boundary: Enviroment State-Text Injection Attack on LLM-Driven Embodied Agents

当状态成为攻击面:大语言模型驱动的具身智能体中的状态语义注入

Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao, Chi Guo, Keyan Guo, Hongxin Hu

机构 * Wuhan University(武汉大学) University at Buffalo(布法罗大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 该文聚焦LLM驱动的具身智能体,梳理其技术演进与现有模型,指出其需结合多类信息完成任务落地后执行,为后续状态语义注入攻击研究奠定基础。

Comments submitted to USENIX Security 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16794 2026-08-20 cs.RO cs.AI cs.CL 版本更新 70%

Neurosymbolic Embodied Agents

神经符号具身智能体

Mohammad Albinhassan, Yuming Feng, Alessandra Russo, Pranava Madhyastha

机构 * Imperial College London(帝国理工学院) Johns Hopkins University(约翰斯·霍普金斯大学) City, University of London(伦敦城市大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 该研究提出一种神经符号具身智能体,将长周期家庭任务分解为视觉探索与符号规划,在VirtualHome、ALFWorld基准测试中表现优异,约束与搜索结合可大幅提升任务解决率,且无需专门训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15685 2026-08-18 cs.CV 新提交 70%

Counterfactual Sensitivity Is Not Repairability: Auditing Replay Probes for Video Evidence

反事实敏感性不等于可修复性:针对视频证据的重播探针审计

Rama AlHamidi, Rasul Khanbayov, Erchin Serpedin, Hasan Kurban

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本研究提出黑盒反事实探针 CARVE,通过对比 SHAM 与 DESTROY 重播下的答案变化,审计视频智能体的证据依赖,在 LVBench 上取得准确率提升,验证了反事实敏感性与可修复性的差异。

Comments 23 pages, 2 figures. Code: https://github.com/KurbanIntelligenceLab/CARVE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27856 2026-08-18 cs.CV 版本更新 70%

Benchmarking Foundation and Large Language Models for Few-Shot Medical Image Segmentation

基准测试用于小样本医学图像分割的基础模型与大语言模型

Jinghong Liu, Yuchuan Deng, Fanping Liu, Meng Huang, Xirong Li

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究推出统一基准FAME,涵盖四类模型,含14958个样本,评估得出小样本分割的关键规律,助力开发更有效的小样本医学分割方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11427 2026-08-18 cs.CV 版本更新 70%

Comprehension of Multilingual Expressions Referring to Target Objects in Visual Inputs

视觉输入中指代目标对象的多语言表达式理解

Francisco Nogueira, Alexandre Bernardino, Bruno Martins

机构 * Instituto Superior Técnico(技术高等学院)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本研究针对多语言指代表达式理解问题,构建了含10种语言的统一多语言数据集,提出基于多语言SigLIP2编码器的注意力锚定高效架构,验证了该模型在多语言视觉定位任务上的竞争力与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14148 2026-08-17 cs.CV 新提交 70%

SCVIB: Editable State-Conditioned Visual Instance Binding forMulti-Turn Personalized Localization

SCVIB:面向多轮个性化定位的可编辑状态条件视觉实例绑定

Xiongtai Yang, Ziyan He, Tao Wang

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 该研究提出多轮个性化定位设置SCVIB,结合TT-VG与VEGA方法构建测试平台,解决多轮定位中支持证据利用不足问题,相关指标优于对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01189 2026-08-17 cs.AI 版本更新 70%

NEURON: A Neuro-symbolic System for Grounded Clinical Explainability

NEURON:一种面向临床可解释性的神经符号系统

Anuradha Chandrasekaran, Dimitrios Zikos, Mutlu Mete, Alan Pang, Brady D. Lund, Kewei Sha

机构 * University of North Texas(北卡罗来纳大学达顿分校) Texas Tech University Health Sciences Center(德克萨斯农工大学健康科学中心)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 NEURON结合医学本体和机器学习模型,提升预测可靠性与临床可解释性,通过RAG层生成自然语言解释,在MIMIC-IV数据集上提升AUC至0.84-0.88。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13129 2026-08-14 cs.AI 新提交 70%

Numeracy in Large Language Models: Fundamental Limitations and Paths to Improvement

大型语言模型中的数字能力:基本局限与改进路径

Aoxin Ni

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 本研究针对LLMs在基础数值任务中的不可靠性,提出数值基础框架(NGF)并结合三大基准评估前沿模型,给出改进数值能力的部署建议与研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏