Towards Addressing the Misalignment of Object Proposal Evaluation for Vision-Language Tasks via Semantic Grounding
专题命中 视觉定位与Grounding :grounding(title,abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted to WACV 2024 (Round 1)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉定位与Grounding :grounding(title,abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted to WACV 2024 (Round 1)
专题命中 视觉定位与Grounding :grounding(title,abstract);visual question answering(abstract);分类 cs.CV
Comments 12 pages, 10 figures
专题命中 视觉定位与Grounding :grounding(title,abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted to CVPR 2022 VizWiz Workshop
专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV
Comments Work in progress
专题命中 视觉定位与Grounding :grounding(title,abstract);visual reasoning(abstract);分类 cs.CV
Comments AAAI 2022 Accepted
专题命中 视觉定位与Grounding :grounding(title,abstract);visual reasoning(abstract);分类 cs.CV
专题命中 视觉定位与Grounding :grounding(title,abstract);visual reasoning(abstract);分类 cs.CV
Comments Accepted at ICCV 2019 (Oral); Code available at https://github.com/daqingliu/NMTree
专题命中 视觉定位与Grounding :grounding(title,abstract);visual reasoning(abstract);分类 cs.CV
Comments Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (T-PAMI)
激活至关重要:基于视觉语言模型的测试时激活负标签用于分布外检测
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Stanford University(斯坦福大学)
专题命中 视觉定位与Grounding :vision-language model(title);VLM(abstract,comments);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出测试时激活负标签(TANL)方法,通过动态评估激活水平和测试批次内的激活信息,提升分布外检测的性能和鲁棒性,实验表明其在ImageNet基准上显著降低FPR95。
Comments CVPR 2026 main track, Codes are available at https://github.com/YBZh/OpenOOD-VLM
专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);VLM(comments)
Comments COLM 2025 & CVinW @ CVPR 2025 (Spotlight). Homepage: https://vlm-reg.github.io/
专题命中 视觉定位与Grounding :grounding(title);vision language model(abstract);VLM(abstract);vision-language model(comments)
Comments Accepted to Vision-Language Models for Navigation and Manipulation (VLMNM) Workshop (ICRA 2024)
SemComp-Bench:视频生成中的语义任务完成基准
机构 * University of Science and Technology of China(中国科学技术大学) ; Sun Yat-sen University(中山大学)
专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出面向结果的视频生成任务语义任务完成,构建SemComp-Data数据集与SemComp-Bench基准,发现代表性视频生成模型在兼顾结果实现与参考图像语义基础上仍具挑战。
PWLR:用于边界感知分布外检测的成对见证局部拒绝
机构 * Guangdong Provincial Key Laboratory of Stomatology(广东省口腔医学重点实验室) ; Key Laboratory of Machine Intelligence and Advanced Computing, MOE(教育部机器智能与先进计算重点实验室)
专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);分类 cs.CV、cs.LG
AI总结 针对视觉语言检测器极少用语言作为混淆ID类别边界证据的问题,提出PWLR方法,结合MLLM生成的局部线索与全局类别得分,在多基准上改进了视觉语言基线的OOD检测性能。
Comments Accepted by ACM MM 2026
学习多模态伪标签以实现鲁棒的开放词汇实例和全景分割
机构 * Seoul National University of Science and Technology(首尔科技大学) ; Chung-Ang University(中央大学)
专题命中 视觉定位与Grounding :LLaVA(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对开放词汇实例分割与开放集全景分割的痛点,提出多模态框架,结合预训练视觉语言模型生成伪标签并优化训练目标,在COCO数据集上取得优于现有SOTA的性能。
Comments 14 pages
Journal ref Neurocomputing, 2026
基于大语言模型的符号图形编程
机构 * The Chinese University of Hong Kong(香港中文大学) ; Westlake University(西湖大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)
专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.CV、cs.LG
AI总结 本文针对大语言模型生成符号图形程序(SGP)能力不足的问题,提出带可验证奖励的强化学习方法,在Qwen-2.5-7B上实现与前沿系统相当的SVG生成性能,揭示SGP是跨模态 grounding 的有效视角。
Comments Accepted by Transactions on Machine Learning Research. (32 pages, 12 figures.) This version refines the paper structure, adds experimental results. Project page: https://spherelab.ai/SGP-Gen/
用于多模态大语言模型的几何增强部分估计
专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 研究针对多模态大语言模型部分估计弱的问题,提出用精确部分头部增强冻结商业MLLM的方法,该头部基于DINOv2主干构建,无需深度传感器和微调,在三个基准测试中降低部分误差,优于旗舰MLLM及原图像模型。
Prompting-MammAlps:用于相机陷阱数据的细粒度文本到视频检索
机构 * Ecole Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) ; Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所) ; University of Konstanz(康斯坦茨大学)
专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 针对相机陷阱数据自动检索视频的难题,提出Prompting-MammAlps基准及细粒度可解释TVR方法,训练视觉变压器并结合大语言模型处理查询,在基准测试中取得较好成绩,优于零样本VLM。
Comments Accepted at ECCV 2026; Project page: https://cnai.epfl.ch/prompting-mammalps
CCRC:面向图像变化描述与分割的变化感知描述与推理链
机构 * College of Computer Science and Electronic Engineering, Hunan University, China(湖南大学计算机科学与电子工程学院,中国) ; Guangxi Minzu University, China(广西民族大学,中国) ; National University of Defense Technology, China(国防科学技术大学,中国)
专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 提出变化感知描述与推理链(CCRC),通过双链框架解耦语义推理与空间分割,实现图像变化描述与分割(ICCS)任务,在合成和真实基准上达到最优性能。
InSight: 通过可引导的VLA实现自主技能获取
机构 * Stanford University(斯坦福大学) ; Princeton University(普林斯顿大学)
专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 提出InSight框架,通过将VLA模型在基本动作层面变得可引导,实现自主技能获取,包括自动分割演示为基本动作和VLM引导的数据飞轮,无需人类演示即可学习新技能。
Comments Project website: https://insight-vla.github.io
CheXpercept: 评估胸部X光片中专家级病变感知的基准
机构 * KAIST(韩国科学技术院) ; Samsung Medical Center(三星医疗中心) ; Konkuk University Medical Center(建国大学医疗中心)
专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出CheXpercept基准,通过粗粒度检测、细粒度轮廓评估与修正、语义级属性提取三个层次评估视觉语言模型在胸部X光片上的专家级病变感知能力,发现当前模型仅在粗粒度任务上表现良好。
GRAZE:基于 grounded 的细化与运动感知的零样本事件定位
机构 * Kansas State University(堪萨斯州立大学) ; Albright College(阿尔比恩学院)
专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 本文提出GRAZE,一种无需标注数据的零样本事件定位方法,通过结合Grounding DINO和SAM2实现运动感知的接触定位,有效应对复杂场景。
Comments 9 pages, 5 figures, accepted to the CVPR 2026 Workshop on Computer Vision in Sports (CVSports) code: https://github.com/AhsanZaidi12/GRAZE
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pp. 10087-10095, June 2026
Bernini: 视频扩散中的潜在语义规划
机构 * Bernini Team(伯尼尼团队)
专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出Bernini框架,通过将大规模多模态语言模型用于语义规划,扩散模型用于像素生成,实现了视频生成与编辑的统一方法,提升了编辑任务的泛化能力。
Comments Project Page: https://bernini-ai.github.io/
定位后检查:基于区域的推理提升AI生成图像的检测
机构 * Shanghai Jiao Tong University(上海交通大学) ; Ant Group(蚂蚁集团)
专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出LTE框架,通过定位可疑区域并重新检查以提升AI生成图像检测的准确性和鲁棒性,提供可理解的区域级解释。
Comments 18 pages, 11 figures (including supplementary material)
人机协作中的鸿沟
机构 * University of Oxford(牛津大学)
专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 本文探讨了人机协作中稳定性不足的问题,提出三种工作结构并强调 grounding 条件的重要性。
Comments Accepted as a conference paper at ECSCW 2026, Germany
V-Reflection:将多模态大语言模型从被动观察者转变为主动提问者
机构 * AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)人工智能方向) ; International Digital Economy Academy(国际数字经济学院) ; MedVisAI Lab, Lee Kong Chian School of Medicine, Nanyang Technological University, and Centre of AI in Medicine(医学视觉人工智能实验室,南洋理工大学Lee Kong Chian医学院,以及人工智能在医学中的中心) ; South China University of Technology(华南理工大学) ; Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系)
专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出V-Reflection框架,通过'思考后再观察'的视觉反思机制,使多模态大语言模型能主动提问视觉特征空间,提升细粒度任务的感知能力。
Comments Main paper 14 pages with supplementary 7 pages
Mini-BEHAVIOR-Gran:揭示指令粒度对语言引导的具身智能体的影响
机构 * Faculty of Information Technology, Monash University(信息技术学院,莫纳什大学)
专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.AI
AI总结 本文提出Mini-BEHAVIOR-Gran基准,通过多级指令变体研究指令粒度对具身智能体性能的影响,发现粒度与性能呈非单调U型关系,粗粒度性能反弹与浅层 grounding 有关。
Comments 23 pages, Keywords: Language Grounding, Language Granularity, Instruction Following Agent, Width-based Planning Research Area: Multimodality and Language Grounding to Vision, Robotics and Beyond Research Area Keywords: vision language navigation, multimodality, neurosymbolic approaches
VIG-RL:学习搜索与插入以实现可验证的图像定位
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 本文针对现有检索增强框架无法动态推理视觉证据插入时机与位置的问题,提出自主智能体框架VIG-RL,将相关工作流建模为主动决策过程,经强化学习优化后实现SOTA性能。
通过轻量级流匹配实现大象启发式软躯干运动的全身语义到驱动的基础
专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract)
AI总结 针对近距离人机交互中类似躯干机器人关联开放词汇响应难的问题,提出基于轻量级流匹配的全身语义到驱动基础框架,将多模态大语言模型响应转换为元组,参数化轨迹并采样运动,实验显示其提升关联正确性、减少推理时间,还提升了人机交互满意度。
SciLens: 多模态科学声明验证的智能蕴含与归因框架
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Hong Kong Baptist University(香港浸会大学) ; NVIDIA AI Technology Center(英伟达人工智能技术中心)
专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract)
AI总结 提出SciLens框架,通过将声明分解为原子命题并归因到表格/图表证据,实现多模态科学声明验证,在SciClaimEval上达到79.2%宏F1和63.1%配对准确率。
Comments KDD 2026 SciSoc Agents & LLMs (Oral)
通过提示实现视觉语言模型发射后能力扩展用于在轨航天器检测
机构 * Florida Institute of Technology(佛罗里达理工学院) ; University of Florida(佛罗里达大学)
专题命中 视觉定位与Grounding :vision-language model(title);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 研究利用提示驱动的视觉语言模型在轨扩展语义能力,无需修改权重即可通过自然语言提示检测新航天器部件,在129张图像上零样本实例分割达到0.385 mAP@0.5。
Comments 5 pages, 1 figure, 2 tables. Equal contribution by Nicholas A. Welsh and Lennon Shikhman. Published in the CVPR2026 Workshop on AI4Space