arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26403 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7473 篇

2604.24564 2026-05-01 cs.CL cs.IR cs.IT math.IT 90%

MEG-RAG: Quantifying Multi-modal Evidence Grounding for Evidence Selection in RAG

MEG-RAG: 多模态证据 grounding 的量化研究以提升 RAG 中的证据选择

Xihang Wang, Zihan Wang, Chengkai Huang, Quan Z. Sheng, Lina Yao

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家信息与自动化研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室) Zhejiang University(浙江大学) Peking University(北京大学) University of New South Wales(新南威尔士大学) Macquarie University(麦考瑞大学) CSIRO’s Data61(CSIRO 数据61)

专题命中 视觉定位与Grounding :grounding(title,title_cn);multimodal large language model(abstract)

AI总结 本文提出 MEG-RAG 框架,通过语义感知的多模态证据 grounding 方法提升 RAG 中的证据选择准确性与多模态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10554 2026-05-05 cs.CV 90%

Grounding Everything in Tokens for Multimodal Large Language Models

基于令牌的多模态大语言模型的 grounding

Xiangxuan Ren, Zhongdao Wang, Liping Hou, Pin Tang, Guoqing Wang, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence(人工智能混合专家模型关键实验室) AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院) Central Research Institute, Huawei(华为中央研究院)

专题命中 视觉定位与Grounding :grounding(title,title_cn);multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文提出GETok方法,通过整合可学习的令牌词汇提升多模态大语言模型在2D空间中的物体定位能力,实验显示其在多种指引用例任务中表现更优。

Comments 19 pages, 16 figures, 12 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03278 2025-03-06 cs.CV cs.CL 90%

Enhancing Abnormality Grounding for Vision Language Models with Knowledge Descriptions

Jun Li, Che Liu, Wenjia Bai, Rossella Arcucci, Cosmin I. Bercea, Julia A. Schnabel

专题命中 视觉定位与Grounding :grounding(title,abstract);vision language model(title);VLM(abstract);visual language model(abstract)

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18996 2026-08-20 cs.CV cs.AI 新提交 90%

GrabVG: Graph-Attentive Binding for Visual Grounding in UAV Imagery

GrabVG:面向无人机图像视觉 grounding 的图注意力绑定方法

Chaowei Wang, Yan Di, Jingjun Sun, Baozhe Liu, Jiaxu Tian, Yuheng Li, Guangqian Guo, Shan Gao

机构 * Northwestern Polytechnical University(西北工业大学) Harbin Institute of Technology(哈尔滨工业大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV、cs.AI

AI总结 本文针对无人机图像视觉 grounding 的冗余与拓扑歧义问题,提出 GrabVG 框架,通过预注意假设搜索与图注意力特征绑定实现目标定位,在 AerialVG、AerialSense 数据集上精度显著优于基线且精度-速度权衡良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29879 2026-07-01 cs.CV cs.AI 版本更新 90%

LWDrive: Layer-Wise World-Model-Guided Vision-Language Model Planning for Autonomous Driving

LWDrive: 基于逐层世界模型的视觉-语言模型自动驾驶规划

Chen Yang, Yuhao Wei, Ze Xu, Ziheng Zou, Shuang Liang, Delin Ouyang, Lingfeng Qi, Jie Li, Guofa Li

机构 * Chongqing University(重庆大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出LWDrive框架,通过逐层世界模型引导,将VLM输出的粗轨迹逐步细化为几何精确、多视角感知的规划轨迹,在NAVSIM基准上取得92.0分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11479 2026-06-12 cs.LG cs.AI cs.MA 版本更新 90%

Grammar of the Wave: Towards Explainable Multivariate Time Series Event Detection via Neuro-Symbolic VLM Agents

波的语法:通过神经符号VLM智能体实现可解释的多变量时间序列事件检测

Sky Chenwei Wan, Yifei Y. Wang, Tianjun Hou, Xiqing Chang, Aymeric Jan

机构 * AI Lab, SLB(SLB人工智能实验室) Télécom Paris, Institut Polytechnique de Paris, France(巴黎电信学院,巴黎高等理工学院,法国)

专题命中 视觉定位与Grounding :VLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出语言引导的时间序列事件检测(TSED)任务,通过事件逻辑树(ELT)将文本描述转化为结构化时序逻辑,并构建神经符号VLM智能体SELA,实现零/少样本事件检测与可解释推理。

Comments 8 pages (main text), 28 pages total including appendix. 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23883 2026-05-25 cs.CV cs.AI 90%

PGT: Procedurally Generated Tasks for improving visual grounding in MLLMs

PGT: 用于提升多模态大语言模型视觉定位的程序化生成任务

Rim Assouel, Amir Bar, Michal Drozdzal, Adriana Romero-Soriano

机构 * Mila - Qu\'ebec AI Institute FAIR at Meta Superintelligence Labs McGill University Canada CIFAR AI Chair

专题命中 视觉定位与Grounding :grounding(title,summary_cn);LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出程序化生成任务(PGT)框架,通过叠加几何基元生成密集监督信号,解耦视觉定位能力与语义先验,显著提升多模态大语言模型在细粒度理解任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22034 2026-05-22 cs.CV cs.AI 90%

AgroVG: A Large-Scale Multi-Source Benchmark for Agricultural Visual Grounding

AgroVG:一个大规模多源基准用于农业视觉 grounding

Haocheng Li, Juepeng Zheng, Zenghao Yang, Kaiqi Du, Guilong Xiao, Gengmeng Pu, Haohuan Fu, Jianxi Huang

机构 * China Agricultural University(中国农业大学) Sun Yat-sen University(中山大学) Tianjin University(天津大学) Tsinghua University(清华大学) Southwest Jiaotong University(西南交通大学) National Supercomputing Center in Shenzhen(深圳国家超算中心)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV、cs.AI

AI总结 本文提出AgroVG基准,用于评估农业视觉 grounding能力,通过多源数据集和任务特定协议,评估模型在多目标、多实例和无目标场景下的性能,揭示了现有模型在农业视觉 grounding任务中的不足。

Comments 45 pages,12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21954 2026-05-22 cs.CV cs.AI 90%

MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues

MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues

Dazhao Du, Liao Duan, Jian Liu, Tao Han, Yujia Zhang, Eric Liu, Xi Chen, Song Guo

机构 * Hong Kong University of Science and Technology(香港理工大学) Xi’an Jiaotong University(西安交通大学) Tencent(腾讯)

专题命中 视觉定位与Grounding :grounding(title,title_cn);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了多模态大语言模型(MLLMs)在视频时间定位中的感知与生成之间的差距,提出了一种推理阶段的读取-再生成框架,通过利用注意力线索来提高时间定位的准确性,从而在三个视频时间定位基准上提升了MiMo-VL-7B、Qwen3-VL-8B和TimeLens-8B的性能。

Comments Project Website: https://ddz16.github.io/mllmsknowwhen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16871 2026-04-21 cs.AI cs.LG 90%

GRAIL: Autonomous Concept Grounding for Neuro-Symbolic Reinforcement Learning

GRAIL:自主概念 grounding 用于神经符号强化学习

Hikaru Shindo, Henri Rößler, Quentin Delfosse, Kristian Kersting

机构 * Technical University of Darmstadt(达姆施塔特技术大学) Google Intrinsic(谷歌内在) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Centre for Cognitive Science, TU Darmstadt(达姆施塔特技术大学认知科学中心)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.AI、cs.LG

AI总结 GRAIL通过环境交互自主 grounding 关系概念,利用大语言模型提供弱监督,提升在稀疏奖励和概念对齐问题中的性能,实验显示其在Atari游戏中表现优异。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13013 2024-04-22 cs.CV cs.AI cs.CL cs.LG 90%

Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models

Chuofan Ma, Yi Jiang, Jiannan Wu, Zehuan Yuan, Xiaojuan Qi

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24671 2026-08-26 cs.CV 新提交 90%

ReGround-Surg: Reliability-Guided Anchor Grounding for Referring Surgical Video Segmentation

ReGround-Surg:用于指代手术视频分割的可靠性引导锚点 grounding

Jiaxin Wen, Ming Yin, Lu Liu, Zeyu Fu

机构 * University of Exeter(埃克塞特大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV

AI总结 本文针对手术视频分割中初始锚点错误导致跟踪误差传播的问题,提出 ReGround-Surg 框架,通过可靠性引导锚点 grounding 改进 SAM2,在 Ref-EndoVis 数据集上实现优于 SOTA 的性能且速度损失极小。

Comments 15 pages, 5 figures, accepted at PRCV 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21605 2026-08-25 cs.AI 新提交 90%

Generate in the Chart, Not on the Boundary: Function-Symbol Grounding for Hard Constraints in LTN-GANs

在图表中生成,而非在边界上:LTN-GAN中硬约束的函数符号 grounding

Nijesh Upreti, Vaishak Belle

机构 * The University of Edinburgh(爱丁堡大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.AI

AI总结 本研究针对LTN-GAN的硬约束问题,提出将公理以函数符号而非谓词 grounding 的方法,对比约束层发现其能保留余量分布,通过分辨率比R诊断 grounding 的学习能力,可生成真实有效样本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15238 2026-08-18 cs.CV 新提交 90%

UC-VLM: Consistency-Driven Learning for AI-Generated Image Detection with Vision-Language Large Models

UC-VLM:基于一致性驱动学习的视觉语言大模型生成图像检测方法

Lei Tan, Shuwei Li, Mohan Kankanhalli, Robby T. Tan

机构 * National University of Singapore(新加坡国立大学)

专题命中 视觉定位与Grounding :VLM(title,title_cn);分类 cs.CV

AI总结 UC-VLM是仅依赖二元监督的多阶段框架,通过复用真实性标签实现视觉适配与文本生成,在GenImage、Chameleon等数据集上显著提升了AI生成图像检测的准确率。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14107 2026-08-17 cs.AI 新提交 90%

Retrieval Grounding Latent Reasoning for Dense Retrieval

用于密集检索的检索 grounding 潜在推理

Gang Zhou, Xiongxi Yu, Hu Tian, Yang Wei, Lu Pan, Ke Zeng, Shibiao Xu, Xiaolong Zheng

机构 * Meituan(美团)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.AI

AI总结 本文提出用于密集检索的 RGLT 框架,结合过程监督蒸馏与检索 grounding 监督优化潜在推理轨迹,在推理密集型检索基准上优于基线且保持高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10981 2026-08-12 cs.CV 新提交 90%

ThinkAfford: Affordance-Centric Reasoning for Fine-Grained 3D Grounding in Cluttered Scenes

ThinkAfford:面向杂乱场景中细粒度3D grounding的以可供性为中心的推理

Xinrui Lin, Sha Zhang, Shumin Wang, Zenghuan Zhu, Jiajun Deng, Yanyong Zhang

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV

AI总结 该研究提出ThinkAfford模型,通过解耦可供性提议生成与指令推理,结合GRPO优化,在SceneFun3D验证集上的3D grounding指标优于基线方法。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06799 2026-08-10 cs.RO cs.CV 新提交 90%

Is Forward Prediction Enough? Physical State Grounding for JEPA World Models

前向预测足够吗?面向JEPA世界模型的物理状态 grounding

Haodong Yan, Jiaguan Zhu, Mingyuan Jia, Ruiqing Yin, Junjie He, Zhide Zhong, Junfeng Li, Jinxuan Lu, Hengtao Li, Tianran Zhang, Jiayi Chen, Wenxuan Song, Wen Chen, Yuxiang Gao, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) COCO Matrix

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV

AI总结 针对JEPA世界模型前向预测未明确物理状态可识别性的问题,提出PSG-JEPA模型,通过训练阶段的两个grounding目标提升性能,在三个评估层面均优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12738 2026-08-10 cs.CV 版本更新 90%

Direct Visual Grounding by Directing Attention of Visual Tokens

通过引导视觉令牌注意力实现直接视觉 grounding

Parsa Esmaeilkhani, Longin Jan Latecki

机构 * Temple University(特拉华大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);vision language model(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对VLMs中视觉令牌注意力不足的问题,提出KL注意力损失,结合下一个令牌预测损失,在多个视觉任务上取得显著提升,还引入了用于评估VLMs线条追踪能力的新数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04568 2026-08-06 cs.CV 新提交 90%

Talk2Sensors: 3D Visual Grounding in Autonomous Driving via Sensor-Adaptive Physical Cue Matching

Talk2Sensors:基于传感器自适应物理线索匹配的自动驾驶3D视觉 grounding

Runwei Guan, Di Tian, Ningwei Ouyang, Ruixiao Zhang, Shaofeng Liang, Haocheng Zhao, Lianqing Zheng, Xiaokai Bai, Guotao Wang, Daizong Liu, Henghui Ding, Hui Xiong

机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能学域) MMLab, CUHK(香港中文大学MMLab) School of Transportation Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学交通科学与工程学院) School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西交利物浦大学先进技术学院) School of Electronics and Computer Science, University of Southampton(南安普顿大学电子与计算机科学学院) School of Intelligent Manufacturing and Smart Transportation, Suzhou City University(苏州城市学院智能制造与智能交通学院) Qingdao University of Science and Technology(青岛科技大学) Institute for Math & AI, Wuhan University(武汉大学数学与人工智能研究院) Institute of Big Data, Fudan University(复旦大学大数据研究院)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV

AI总结 针对现有室外3D视觉 grounding 未充分利用多传感器互补物理属性的问题,提出首个多传感器数据集Talk2Sensors及TSFormer框架,在相关基准上实现了最优性能。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04480 2026-08-06 cs.CV 新提交 90%

REZE: Recognition-Based Zero-Shot Extraction for Video Temporal Grounding

REZE:基于识别的视频时间定位零样本提取方法

Boyang Li, Chenhui Gou, Jianfei Cai

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract,abstract_cn);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究提出无训练的REZE方法,通过拆分视频为片段并聚合模型置信度,适配多种VTG任务,在多个数据集上优于现有无训练方法,部分指标超全监督SoTA,还能让旧模型性能接近同家族新模型。

Comments 18 pages, 7 figures, 13 tables. Appendices included

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22868 2026-08-04 cs.CV 版本更新 90%

Seeing the Unseen: Towards Training-Free Inspection for Wind Turbine Blades Using Knowledge-Augmented Vision Language Models

看见不可见:基于知识增强视觉语言模型的无训练风机叶片检测方法

Yang Zhang, Qianyu Zhou, Farhad Imani, Jiong Tang

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision language model(title);vision-language model(abstract,abstract_cn);分类 cs.CV

AI总结 该研究提出结合RAG与VLM的零样本风机叶片检测框架,构建多模态知识库,在小样本测试中表现优于基线,为工业检测提供数据高效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29267 2026-06-30 cs.CV 90%

Enhancing Part-Level Point Grounding for Any Open-Source MLLMs

增强任意开源多模态大语言模型的部件级点定位能力

Jin-Cheng Jhang, Fu-En Wang, Xin Yang, Nan Qiao, Lu Xia, Min Sun, Cheng-Hao Kuo

机构 * National Tsing Hua University(国立清华大学) Amazon(亚马逊)

专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出一种通用方法,通过冻结原模型参数并引入Q-Synth模块和注意力到点解码器,为任意开源MLLM赋予精确的2D部件级点定位能力,显著提升部件级定位精度。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12620 2026-06-17 cs.CV 90%

BusterX: MLLM-Powered AI-Generated Video Forgery Detection and Explanation

BusterX:基于MLLM的AI生成视频伪造检测与解释

Haiquan Wen, Yiwei He, Zhenglin Huang, Tianxiao Li, Zihan Yu, Xingru Huang, Lu Qi, Baoyuan Wu, Xiangtai Li, Guangliang Cheng

机构 * University of Liverpool, UK(利物浦大学) Nanyang Technological University, SG(南洋理工大学) The Chinese University of Hong Kong, Shenzhen, Guangdong, China(香港中文大学(深圳)) Wuhan University(武汉大学) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 视觉定位与Grounding :MLLM(title,title_cn);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出BusterX,一种基于多模态大语言模型的视频伪造检测系统,通过改进数据集和评估基准,提升检测准确性和解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06261 2026-06-05 cs.NI cs.AI cs.ET cs.MA 90%

DAST: A VLM-LLM Framework for Cross-Interface Anomaly Detection in O-RAN

DAST: 面向O-RAN跨接口异常检测的VLM-LLM框架

Francesco Spinelli, Esteban Municio, Pau Baguer, Gines Garcia-Aviles, Xavier Costa-Perez

机构 * i2CAT Foundation(i2CAT基金会) NEC Laboratories Europe(NEC欧洲实验室) ICREA

专题命中 视觉定位与Grounding :VLM(title,title_cn);分类 cs.AI

AI总结 提出DAST,一种零样本多智能体框架,通过VLM→LLM→VLM三级流水线将多变量KPI流转换为视觉表示,结合领域知识进行跨接口异常检测,在真实O-RAN测试平台上优于现有TSAD方法。

Comments 7 pages, 5 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22067 2026-06-05 cs.AI 90%

Semantic Partial Grounding via LLMs

通过大语言模型实现语义部分 grounding

Giuseppe Canonaco, Alberto Pozanco, Daniel Borrajo

机构 * Department of Computer Science, University of Cambridge(剑桥大学计算机科学系)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.AI

AI总结 本文提出SPG-LLM,利用大语言模型分析领域和问题文件,提前识别可能不相关的对象、动作和谓词,从而减少grounding任务的规模,提升grounding效率并在某些领域实现更优的计划成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01750 2026-05-14 cs.MA cs.AI 90%

Talk is Cheap, Communication is Hard: Dynamic Grounding Failures and Repair in Multi-Agent Negotiation

言者无罪,沟通艰难:多智能体谈判中的动态 grounding 故障与修复

Yiheng Yao, Chelsea Zou, Robert D. Hawkins

机构 * Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.AI

AI总结 本文研究多智能体谈判中动态 grounding 的故障与修复,通过多轮谈判游戏揭示四类失败模式,发现协调瓶颈在于动态 grounding 而非个体推理或信息不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08828 2026-05-13 cs.AI 90%

When Agents Overtrust Environmental Evidence: An Extensible Agentic Framework for Benchmarking Evidence-Grounding Defects in LLM Agents

当智能体过度信任环境证据:一个可扩展的智能体框架,用于基准测试LLM智能体中的证据 grounding 缺陷

Strick Sheng, Ziyue Wang, Liyi Zhou

机构 * The University of Sydney(悉尼大学) Nanjing University(南京大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.AI

AI总结 本文提出EnvTrustBench框架,用于评估智能体在环境证据过时、错误或恶意时的可靠性问题,通过生成多个任务场景并验证结果,揭示证据 grounding 是智能体可靠性的重要挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24036 2026-04-30 cs.CV eess.IV 90%

Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues

通过语言引导的语义线索实现对遮挡和小物体的鲁棒接地

Beomchan Park, Seongho Kim, Hyunjun Kim, Sungjune Park, Yong Man Ro

机构 * Integrated Vision Language Lab.(集成视觉语言实验室)

专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出通过语言引导的语义线索提升MLLM在拥挤场景中的接地能力,通过语义线索提取器和文本嵌入引导优化对象语义,实验表明能有效提高接地精度。

Comments 4 pages, 2 figures, ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23366 2026-04-28 cs.AI cs.MA 90%

GSAR: Typed Grounding for Hallucination Detection and Recovery in Multi-Agent LLMs

GSAR:多智能体大语言模型中基于类型的 grounding 检测与恢复

Federico A. Kamelhar

机构 * Agentic AI Oracle Corporation(Agentic AI Oracle公司)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.AI

AI总结 GSAR 提出了一种 grounding 评估与规划框架,通过四类分类、证据权重分配、矛盾惩罚评分和三层决策函数,实现多智能体大语言模型中的 hallucination 检测与恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11244 2026-04-16 cs.CV 90%

Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding

Script-a-Video: 通过因子化流和关系 grounding 实现深度结构化音频视觉描述

Tencent Hunyuan Team

机构 * Tencent Hunyuan Team(腾讯文言团队)

专题命中 视觉定位与Grounding :grounding(title,title_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出MTSS框架,通过因子化流和关系 grounding 解决视频描述中信息耦合问题,提升视频理解与生成性能,实验显示在多个基准测试中均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏