arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 782 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 782 篇

2606.20946 2026-06-23 cs.CL cs.CV 新提交 87%

Scaling Diverse Language Generation for 3D Visual Grounding

面向3D视觉定位的多样化语言生成扩展

Austin T. Wang, Dongchen Yang, Angel X. Chang

机构 * Simon Fraser University(西蒙菲莎大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 提出ViGiL3D++方法,通过场景图约束采样与LLM语言生成结合,生成多样化视觉定位查询,提升3DVG模型泛化能力并揭示VLM局限性。

Comments 39 pages, 14 figures, 16 tables. Project Page: https://3dlg-hcvc.github.io/vigil3dpp

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16124 2026-06-16 cs.CV 新提交 87%

Training-Free Open-Vocabulary Visual Grounding for Remote Sensing Images and Videos

面向遥感图像与视频的无训练开放词汇视觉定位

Ke Li, Di Wang, Yongshan Zhu, Ting Wang, Weiping Ni, Tao Lei, Quan Wang, Xinbo Gao

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Interdisciplinary Institute of Artificial Intelligence, Xidian University(西安电子科技大学跨学科人工智能研究院) School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) Northwest Institute of Nuclear Technology(西北核技术研究所) School of Physics and Information Engineering, Fuzhou University(福州大学物理与信息工程学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出无训练框架RSVG-ZeroOV,利用冻结的通用基础模型通过概览-聚焦-演化范式实现零样本开放词汇遥感视觉定位,并扩展至视频时空定位,在多个基准上超越现有零样本方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16122 2026-06-16 cs.AI 新提交 87%

Thinking with Visual Grounding

视觉锚定思维

Junkai Zhang, Yihe Deng, Kai-Wei Chang, Wei Wang

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract_cn);visual reasoning(abstract)

AI总结 提出视觉锚定思维方法,让视觉语言模型在推理时交替生成自然语言和视觉锚点(点或框),并通过合成数据管道和锚定感知强化学习训练,在计数和空间推理任务上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24730 2026-07-28 cs.CV cs.AI 新提交 87%

KANEx: Translating Kolmogorov-Arnold Networks' Interpretability to Medical Explainability

KANEx:将柯尔莫哥洛夫-阿诺德网络的可解释性转化为医学可解释性

Krithi Shailya, Ananya Lakshmi Ravi, Venkatanathan K. V., Sowmya S. Sundaram, Gokul S. Krishnan, Aditi Anand, Balaraman Ravindran

机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯分校) Vanderbilt University School of Medicine(范德堡大学医学院)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究针对医学应用中视觉模型黑箱问题,提出KANEx框架,利用柯尔莫哥洛夫-阿诺德网络的符号透明度为VLM推理奠基,设计KAN-Map热图生成方法,经实验验证该方法能提升语义相似度、视觉定位及推理质量,为可信医学人工智能发展助力。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21579 2026-06-23 cs.CV cs.AI 新提交 87%

The Unreasonable Effectiveness of VLMs for Zero-shot Procedural Mistake Detection

VLM在零样本程序性错误检测中的惊人有效性

Serdar Ozsoy, Lars Doorenbos, Federico Spurio, Gianpiero Francesca, Juergen Gall

机构 * University of Bonn(波恩大学) Toyota Motor Europe(丰田欧洲公司) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习和人工智能研究所)

专题命中 视觉定位与Grounding :VLM(title_cn,summary_cn);分类 cs.CV、cs.AI

AI总结 提出ZeProM框架,利用单个预训练VLM同时解决零样本程序性错误检测和时间动作分割,在EgoPER和CaptainCook4D基准上接近或超越全监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18573 2026-08-20 cs.CV 新提交 86%

PATE-Forensics: Perception-as-Tool for Explainable Deepfake Forensics with General-Purpose MLLMs

PATE-Forensics:以通用多模态大语言模型(MLLM)为工具的可解释深度伪造取证方法

Yaqi Li, Jielun Peng, Yabin Wang, Jincheng Liu, Xiaopeng Hong

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉定位与Grounding :MLLM(title_cn,summary_cn);分类 cs.CV

AI总结 本研究提出PATE-Forensics,采用“感知即工具”范式,基于DINOv3构建取证感知工具,结合通用MLLM实现可解释深度伪造取证,在DDL-X Track 3数据集上取得0.89的最佳官方分数,较次席高出0.19分。

Comments 9 pages, 3 figures, 2 tables; DDL-X Track 3, IJCAI 2026 AI Safety Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17926 2026-08-19 cs.CV 新提交 86%

PerFact: Perception-Derived Fact Prompting for 3D Brain MRI Report Generation

PerFact:用于3D脑部MRI报告生成的感知衍生事实提示方法

Jianyu Sun, Zhenxuan Zhang, Guang Yang, Peter J. Lally

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 该研究针对3D脑部MRI报告生成,提出PerFact方法,以上游3D分割分类输出的结构化事实提示LoRA适配的视觉语言模型,证实grounding信息是报告质量的主导因素而非模型选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07117 2026-08-10 cs.CV 新提交 86%

Beyond Fluency: A Clinical Benchmark and Anomaly-Enhanced Baseline for Spine MRI Report Generation

超越流畅性:脊柱MRI报告生成的临床基准与异常增强基线

Bruno Palau, Franziska Vogt, Daria Laslo, Haobo Li, Ender Konukoglu, Maria Monzon, Catherine R. Jutzeler

机构 * ETH Zurich(苏黎世联邦理工学院) Swiss Institute of Bioinformatics (SIB)(瑞士生物信息学研究所)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 该研究针对放射学报告的耗时与阅片差异问题,构建腰椎MRI的VLM临床基准,提出半监督U-Net++生成异常热图增强VLM的框架,提升诊断可靠性与可解释性。

Comments Maria Monzon and Catherine R. Jutzeler contributed equally as shared last authors. Accepted at the CV4Clinic Workshop, CVPR 2026

Journal ref Proc. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 6759-6770

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00920 2026-07-03 cs.CV 新提交 86%

GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images

GMO-E$^2$DIT:面向电商图像的接地多操作编辑

Zipeng Guo, Xiaoan Liu, Lichen Ma, Cheng Wang, Yu He, Xiaolong Fu, Jingling Fu, Xinyuan Shan, Shaojie Guo, Luohang Liu, Junshi Huang, Yan Li

机构 * Wuhan University(武汉大学) Xi’an Jiaotong University(西安交通大学) Sun Yat-sen University(中山大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出GMO-E$^2$DIT框架,通过VLM代理构建区域接地编辑议程,结合掩码条件图像编辑器和反思循环,实现多操作、可审计的电商图像编辑,在指令准确性和编辑保真度上超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19218 2026-08-21 cs.CL cs.AI cs.LG 新提交 86%

Time-Series Retrieval for Grounding Multimodal Language Models in Remaining Useful Life

用于将多模态语言模型与剩余使用寿命关联的时间序列检索

Valeriu Dimidov, Raphaël Frank

机构 * University of Luxembourg(卢森堡大学)

专题命中 视觉定位与Grounding :grounding(title);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出时间序列检索关联的多模态大语言模型框架,在C-MAPSS基准FD001分区实验显示,该方法可提升RUL预测的误差与稳定性,且效果随模型容量变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04726 2026-08-06 cs.AI cs.CV 新提交 86%

When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning

当提示词成为像素:面向多模态推理的提示词-区域定位

Yongxin Wang, Ruizhe Zhou, Yueling Tang, Yingying Zhu, Xuemin Zhao, Xiaojun Chang, Xiaodan Liang

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究针对多模态大语言模型在视觉化任务语义场景下的准确率下降问题,提出提示词-区域定位方法,有效提升了基准测试准确率且无需OCR或区域元数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10826 2026-07-14 cs.CV cs.AI cs.GR 新提交 86%

3D-DefectBench: A Controlled Factorial Study of Vision-Language Model Evaluation Pipelines for Fine-Grained 3D Generation Defects

3D-缺陷基准:用于细粒度3D生成缺陷的视觉语言模型评估管道的控制因子研究

Zhenyu Zhao, Nanshan Jia, Jihyeon Je, Yifu Tang, Alvin Chan, Michael Spedden, Michael V. Palleschi, Sui Huang, Jingshen Wang, Zeyu Zheng

机构 * Roblox Corporation(罗布乐思公司) Berkeley AI Research Lab & Department of Industrial Engineering and Operations Research, University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究实验室及工业工程与运筹学系) Computer Science Department, Stanford University(斯坦福大学计算机科学系) Division of Biostatistics, University of California, Berkeley(加州大学伯克利分校生物统计学系)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 研究基于视觉语言模型的3D缺陷检测管道评估,引入3D-DefectBench基准框架,通过平衡因子设计改变多个管道因素进行实验,发现模型选择影响最大,各因素相互作用,还得出一些协议表现及评判与人工标注对比情况等结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06696 2026-06-08 cs.CV cs.AI 新提交 86%

MMBU: A Massive Multi-modal Biomedical Understanding Benchmark to Probe the Perception Capabilities of Vision-Language Models

MMBU: 大规模多模态生物医学理解基准,用于探测视觉语言模型的感知能力

Ryan D'Cunha, Alejandro Lozano, Xiaoxiao Sun, Daniel Vela Jarquin, Min Woo Sun, Josiah Aklilu, James Burgess, Yuhui Zhang, Ryan Nayebi, Paola Avila, Robayo, Jin Ye, Ming Hu, Zhongying Deng, Junjun He, Xin Chen, Yue Yao, Robert Tibshirani, Jeffrey J. Nirschl, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Instituto Tecnológico de Monterrey(蒙特雷技术学院) Monash University(墨尔本大学) University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract_cn);vision-language model(title);分类 cs.CV、cs.AI

AI总结 提出MMBU基准,涵盖35个子模态,通过分类、定位和检测任务系统评估VLM在生物医学领域的视觉感知和泛化能力,发现高准确率可能掩盖感知缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16658 2026-06-16 cs.CV 新提交 86%

Vision-Language Models as Zero-Annotation Oracles in Histopathology

视觉-语言模型作为组织病理学中的零标注预言机

Vishal Jain, Giorgio Buzzanca, Sarah Cechnicka, Maarten Naesens, Priyanka Koshy, Tri Nguyen, Jesper Kers, Candice Roufosse, Bernhard Kainz

机构 * Imperial College London(帝国理工学院) Leiden University Medical Center(莱顿大学医学中心) KU Leuven(鲁汶大学) University Hospitals Leuven(鲁汶大学医院) University Medical Center Utrecht(乌得勒支大学医学中心) Friedrich-Alexander University Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出一种粗到细方法,利用通用视觉-语言模型作为零标注预言机进行前景分割,在特殊染色上优于监督基线,并通过伪标签蒸馏轻量学生模型。

Comments 11 pages, 1 figure, 6 tables. Code available at https://github.com/VishalJ99/vlm-wsi-auto-context

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01079 2026-07-02 cs.RO 新提交 86%

Where Am I? Semantic Map Grounding via Vision-Language Models for Multi-Modal Localization

我在哪里?基于视觉-语言模型的语义地图定位用于多模态定位

Suraj Borate, Aarav Shah, Madhu Vadali

机构 * IIT Gandhinagar(印度理工学院甘地讷格尔分校)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title)

AI总结 将机器人定位重构为语义推理任务,使用微调的Qwen2.5-VL-7B模型融合摄像头、LiDAR和语义地图预测位姿,在室内数据集上达到98.23%位置精度,并展现出跨模态互补性和对新场景的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11201 2026-08-12 cs.CV 新提交 85%

VidForensics-M1: Meta-Detection Reinforcement Learning with Verifiable Temporal Grounding for AI-Generated Video Forensics

VidForensics-M1:用于AI生成视频取证的、具备可验证时间定位的元检测强化学习

Bowei Liu, Zheng Lu, Yuhan Bian, Xinchen Zhang, Xingming Shui, Yuesheng Huang, Xuhuan Li, Zihao Liu, Yifan Yang, Jun Zhou, Xiu Li

机构 * Tsinghua University(清华大学) Peking University(北京大学) Renmin University of China(中国人民大学) Microsoft(微软公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对AI生成视频检测泛化性不足的问题,首次将元检测引入该领域,提出结合可验证时间证据的VidForensics-M1模型及相关机制,实现了鲁棒可泛化的检测。

Comments 27 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08867 2026-08-11 cs.CV 新提交 85%

Zero-Shot Traffic Accident Detection via a Coarse-to-Fine VLM-Tracking Pipeline

基于粗到细VLM跟踪流水线的零样本交通事故检测

Dipit Saha, Shah Mohammad Abdul Mannan, Mohammad Raihan Rashid, Ruwad Naswan, Ahnaf Tahmid

机构 * Bangladesh University of Engineering and Technology(孟加拉工程技术大学)

专题命中 视觉定位与Grounding :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的双通粗到细流水线,结合Qwen3-VL-32B-Instruct、YOLO11x与BoT-SORT,在零样本约束下于ACCIDENT @ CVPR基准测试中实现22%相对优势,达成0.504的三方调和均值得分。

Comments Accepted at the AUTOPILOT Workshop, CVPR 2026, Denver, CO

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01008 2026-08-04 cs.AI 新提交 85%

Toward Fine-Grained Forgetting:Attribute Unlearning for Multimodal Large Language Models

面向细粒度遗忘:多模态大语言模型的属性遗忘

Junkai Lin, Junkai Chen, Siqi Hou, Yuhao He, Ruiqi Liu, Chenhan Jin, Shengze Xu, Tieyong Zeng

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 针对多模态大语言模型(MLLMs)属性遗忘的细粒度需求,提出轻量级训练无关框架CLRP,通过激活修补定位因果层并应用保留感知投影,实现目标属性遗忘同时保留同一身份信息,在多种MLLMs上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23962 2026-07-28 cs.CV cs.CR 新提交 85%

Development of Vision-Language Model-based GNSS Spoofing Detection for Autonomous Vehicle Navigation

基于视觉语言模型的自动驾驶车辆导航GNSS欺骗检测技术发展

Mohammed Aldeen, Muhammad Sami Irfan, Sagar Dasgupta, Long Cheng, Mizanur Rahman, Mashrur Chowdhury

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 研究自动驾驶车辆GNSS欺骗检测问题,提出基于视觉语言模型的框架,融合多源数据,经三阶段微调及自适应推理策略,大幅提升检测准确率与效率,并生成数据集验证跨区域泛化能力,为自动驾驶提供实用道路防御层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23951 2026-07-28 cs.CV 新提交 85%

TimePLE: Rethinking Temporal Representation for Video Temporal Grounding

TimePLE:重新思考视频时间定位的时间表示

Yuhui Zeng, Xinyu Mao, Xiaokun Liu, Xin Tao, Jinfa Huang, Jiayi Ji, Xiawu Zheng

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 研究视频时间定位问题,提出TimePLE方法,通过预测有效时间区间的联合分布将VTG从端点预测转为区间原生定位,经实验验证该方法优于端点预测基线,在短和中等持续时间事件上表现出色。

Comments 25 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23132 2026-07-28 cs.CV 新提交 85%

DispatchRAG: Grounding Emergency Dispatch Decisions in Real-World Protocols from Traffic Accident Video

DispatchRAG:基于交通事故视频中的现实世界协议进行应急调度决策

Muhammad Sulthan Adhipradhana, Ehsan Javanmardi, Naren Bao, Manabu Tsukada

机构 * Graduate School of Information Science and Technology, University of Tokyo(东京大学信息科学与技术研究生院)

专题命中 视觉定位与Grounding :grounding(title);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 研究旨在通过DispatchRAG框架,利用基于RAG的检索机制和大型语言模型驱动的推理器,根据日本现实交通事故响应协议进行事故评估和调度,引入事故调度数据集验证框架,为自动驾驶车辆事故报告提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21065 2026-07-24 cs.CV 新提交 85%

Do Pathology Vision-Language Models Truly See Pathology?

病理学视觉语言模型真的能‘看到’病理学吗?

Chengyang Zhang, Wenchuan Zhang, Bo Li, Xinyu Liu, Jiaming Yang, Mengran Li, Chenxun Deng, Jie Chen, Yang Zhang, Wei Ju, Yuhao Yi, Hong Bu, Jiancheng Lv

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract,abstract_cn);分类 cs.CV

AI总结 研究病理学视觉语言模型评估中被忽视的问题,提出含多类型样本的PathBind基准,通过对多个VLMs评估发现,当前病理学VLMs在答案性能与视觉语义绑定间有显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11598 2026-07-14 cs.AI 新提交 85%

Interaction Scaling: Grounding the Third Axis of Test-Time Compute

交互缩放:奠定测试时计算的第三轴基础

Bojie Li, Noah Shi

机构 * Pine AI(松树人工智能公司) University of Washington(华盛顿大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 研究测试时增加计算量的新方法,提出交互缩放概念,通过模型与外部仪器交互突破传统方法局限,在硬编码任务和视觉工件处理上展现优势,表明交互缩放真实且区别于推理和采样,需反馈和度量基于实际。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25160 2026-06-25 cs.RO cs.CV 新提交 85%

Toward Low-Latency Vision-Language Models with Doubly-Correct Predictions in Egocentric Visual Understanding

面向低延迟视觉语言模型:在自我中心视觉理解中实现双重正确预测

Qitong Wang, Fan Du, Pranav Maneriker, Jihui Jin, Christopher Rasmussen

机构 * Dolby Laboratories, Inc.(杜比实验室公司) University of Delaware(特拉华大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对人机协作中低延迟需求,提出基于双重正确预测的剪枝策略,在保持证据定位的同时提升预测准确性,在自我中心视频数据集上实现最高精度与双重正确性。

Comments International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19053 2026-06-18 cs.CV 新提交 85%

Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: From Evaluation to Diagnosis

大规模视觉-语言模型在细粒度图像任务上的基准测试:从评估到诊断

Hong-Tao Yu, Chen-Wei Xie, Yuxin Peng, Serge Belongie, Xiu-Shen Wei

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院,中国) Alibaba Group(阿里巴巴集团) School of Computer Science and Engineering, School of Intelligence Science and Engineering, and Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, China(东南大学计算机科学与工程学院、智能科学与工程学院以及新一代人工智能技术及其交叉应用关键实验室,中国) Wangxuan Institute of Computer Technology, National Key Laboratory for Multimedia Information Processing, Peking University, China(北京大学王轩计算机技术研究所、多媒体信息处理国家重点实验室,中国) University of Copenhagen, Denmark(丹麦哥本哈根大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV

AI总结 提出FG-BMK基准,含101万问题和28万图像,通过人机双范式评估LVLM的细粒度语义识别与视觉判别能力,诊断失败原因,发现视觉表示、语义对齐等瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15320 2026-06-16 cs.CV 新提交 85%

Conditional Multi-Event Temporal Grounding in Long-Form Video

长视频中的条件多事件时间定位

Yuanhao Zou, Arthad Kulkarni, Lucas Tonanez, Lincoln Spencer, Guangyu Sun, Tianxingjian Ding, Andong Deng, Yi Li, Shuangjun Liu, Yuan Li, Dashan Gao, Ning Bi, Taotao Jing, Shuai Zhang, Chen Chen

机构 * University of Central Florida(中佛罗里达大学) Qualcomm AI Research(高通人工智能研究院)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 提出CoMET-Bench基准和CoMET-Agent框架,解决长视频中基于组合时空条件定位所有事件的任务,F1@0.5提升6.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09132 2026-06-09 cs.AI 新提交 85%

Vision Language Model Helps Private Information De-Identification in Vision Data

视觉语言模型助力视觉数据中的隐私信息去标识化

Tiejin Chen, Pingzhi Li, Kaixiong Zhou, Tianlong Chen, Hua Wei

机构 * Arizona State University(亚利桑那州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) North Carolina State University(北卡罗来纳州立大学)

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);VLM(abstract_cn);visual language model(abstract)

AI总结 提出VisShield框架,通过专用指令微调数据集OPTIC和训练策略,使视觉语言模型精准定位并掩码敏感文本,有效保护医学图像等视觉数据中的隐私信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13690 2026-08-17 cs.CV cs.AI 新提交 85%

MedPlex: Deep Vision-Language Co-Adaptation for Clinically Grounded Medical Segmentation

MedPlex:用于临床基础医学分割的深度视觉-语言协同适配

Rafi Ibn Sultan, Hui Zhu, Chengyin Li, Dongxiao Zhu

机构 * Wayne State University(韦恩州立大学) Henry Ford Health(亨利福特医疗集团) Institute for AI and Data Science Wayne State University(韦恩州立大学人工智能与数据科学研究院)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 MedPlex是一种端到端VLM框架,通过双向融合和两级概念对齐,实现医学图像分割的视觉-语言协同适配,在CT、MR的多类医学分割任务中达到最优性能。

Comments Accepted By BMVC-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16582 2026-07-21 cs.RO cs.AI cs.CV 新提交 85%

Autonomous VR-Based Risk Detection for Situational Awareness in Dangerous Settings

基于自主虚拟现实的危险环境态势感知风险检测

Mohammad Eskandari, Murali Krishna Varma Indukuri, Stephanie M. Lukin, Cynthia Matuszek

机构 * Interactive Robotics and Language Lab, University of Maryland Baltimore County(马里兰大学巴尔的摩县分校交互式机器人与语言实验室) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 研究在高风险环境中,提出基于VR的人机交互框架,利用VLM辅助机器人识别潜在危险并标注兴趣点,通过VR界面呈现给操作员,经实验验证该方法能有效支持态势感知,提升交互体验。

Comments 7 Pages, Accepted to RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15216 2026-07-17 cs.CV cs.AI 新提交 85%

Symbal: Detecting Systematic Misalignments in Model-Generated Captions

Symbal:检测模型生成字幕中的系统性对齐错误

Maya Varma, Jean-Benoit Delbrouck, Sophie Ostmeier, Akshay Chaudhari, Curtis Langlotz

专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 研究多模态大语言模型生成图像字幕时的系统性对齐错误检测问题,提出利用现成基础模型的结构化双阶段设置的Symbal方法,引入SymbalBench基准,Symbal在基准上表现出色,可辅助审核MLLM生成的字幕。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏