arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2605.08816 2026-05-12 cs.AI cs.CY 87%

Mirror, Mirror on the Wall: Can VLM Agents Tell Who They Are at All?

镜中镜:视觉语言模型代理是否真的能辨认自己?

Filippo Ziliotto, Ciro Beneduce, Bruno Lepri, Luciano Serafini, Massimiliano Luca, Tommaso Campari

机构 * University of Padova(帕多瓦大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) University of Trento(特伦托大学)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 研究探讨视觉语言模型是否能通过镜像识别自身,通过设计3D基准测试评估其自我识别能力,发现更强的模型能利用镜像信息进行行动,而较弱的模型则无法正确提取自身相关信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06673 2026-05-12 cs.CV 87%

Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding

基于检测器的视频大语言模型用于高效的时空定位

Shida Gao, Feng Xue, Xiangfeng Wang, Anlong Ming, Zhaowen Lin, Haiyang Zhang, Teng Long, Nicu Sebe, Yihua Shao, Haozhe Wang, Wei Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Trento(特伦特大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hong Kong University of Science and Technology(香港科技大学) ZTE Corporation(中兴通讯)

专题命中 视觉定位与Grounding :grounding(title,abstract);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出DEViL模型,通过将密集空间定位任务转移给训练良好的检测器,提升视频时空定位的效率与性能,实现43.1%的m_vIoU和14.33 FPS的高效表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01586 2026-05-11 cs.CV 87%

InterCoG: Towards Spatially Precise Image Editing with Interleaved Chain-of-Grounding Reasoning

InterCoG:迈向空间精确图像编辑的交错链式 grounding 推理

Yecong Wan, Fan Li, Chunwei Wang, Hao Wu, Mingwen Shao, Wangmeng Zuo

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Zhengzhou Advanced Research Institute of Harbin Institute of Technology(哈尔滨工业大学郑州先进研究院) Huawei Noah’s Ark Lab(华为诺亚实验室) Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV

AI总结 本文提出InterCoG框架,通过文本与视觉的交错链式推理实现复杂场景中精细图像编辑,结合文本空间关系和视觉定位提升编辑精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15178 2025-09-19 cs.CV 87%

Unleashing the Potential of Multimodal LLMs for Zero-Shot Spatio-Temporal Video Grounding

Zaiquan Yang, Yuhao Liu, Gerhard Hancke, Rynson W. H. Lau

专题命中 视觉定位与Grounding :grounding(title,abstract);LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract)

Journal ref NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18349 2025-04-28 cs.CV cs.CR 87%

Revisiting Data Auditing in Large Vision-Language Models

Hongyu Zhu, Sichu Liang, Wenwen Wang, Boheng Li, Tongxin Yuan, Fangqi Li, ShiLin Wang, Zhuosheng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Southeast University(东南大学) Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19166 2026-03-20 cs.RO cs.AI cs.CL cs.CV cs.LG 87%

Meanings and Measurements: Multi-Agent Probabilistic Grounding for Vision-Language Navigation

含义与测量:多智能体概率性视觉语言导航

Swagat Padhan, Lakshya Jain, Bhavya Minesh Shah, Omkar Patil, Thao Nguyen, Nakul Gopalan

机构 * Arizona State University(亚利桑那州立大学) Haverford College(哈弗福德学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出MAPG框架,通过分解语言查询并利用VLM进行语义 grounding,解决复杂度量-语义语言查询的难题,同时引入MAPG-Bench评估指标,展示在现实机器人中的应用效果。

Comments Equal contribution: Swagat Padhan and Lakshya Jain, 9 pages, 6 figures, paper website: https://lakshya-asu.github.io/Meanings-Measurements-Multi-Agent-Probabilistic-Grounding/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14741 2026-08-04 cs.CV cs.LG 版本更新 87%

HorusEye: Language as Dynamic Attention for Emergency Visual Analysis

HorusEye:语言作为动态注意力用于应急视觉分析

Armel Yara

机构 * Armel Yara

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract_cn);LLaVA(abstract,abstract_cn);grounding(abstract);分类 cs.CV、cs.LG

AI总结 提出HorusEye框架,通过语言反馈动态引导视觉分析,在应急场景下评估多种VLM,发现语言反馈效果依赖模型,并揭示热成像中的裁剪悖论。

Comments 18 pages, 10 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24730 2026-07-28 cs.CV cs.AI 新提交 87%

KANEx: Translating Kolmogorov-Arnold Networks' Interpretability to Medical Explainability

KANEx:将柯尔莫哥洛夫-阿诺德网络的可解释性转化为医学可解释性

Krithi Shailya, Ananya Lakshmi Ravi, Venkatanathan K. V., Sowmya S. Sundaram, Gokul S. Krishnan, Aditi Anand, Balaraman Ravindran

机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯分校) Vanderbilt University School of Medicine(范德堡大学医学院)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究针对医学应用中视觉模型黑箱问题,提出KANEx框架,利用柯尔莫哥洛夫-阿诺德网络的符号透明度为VLM推理奠基,设计KAN-Map热图生成方法,经实验验证该方法能提升语义相似度、视觉定位及推理质量,为可信医学人工智能发展助力。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21414 2026-07-10 cs.CV cs.LG 版本更新 87%

A Tool Bottleneck Framework for Clinically-Informed and Interpretable Medical Image Understanding

用于临床信息丰富且可解释的医学图像理解的工具瓶颈框架

Christina Liu, Alan Q. Wang, Joy Hsu, Jiajun Wu, Ehsan Adeli

机构 * California Institute of Technology(加州理工学院) Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 针对医学图像理解中工具组合难的问题,提出工具瓶颈框架(TBF),利用工具瓶颈模型(TBM)组合VLM选择的工具,通过神经网络计算融合工具输出,在组织病理学和皮肤病学任务中表现出色,提升医学图像理解且使预测更具可解释性。

Journal ref Proceedings of the 9th International Conference on Medical Imaging with Deep Learning, Proceedings of Machine Learning Research 315 (2026) 2958-2986

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21579 2026-06-23 cs.CV cs.AI 新提交 87%

The Unreasonable Effectiveness of VLMs for Zero-shot Procedural Mistake Detection

VLM在零样本程序性错误检测中的惊人有效性

Serdar Ozsoy, Lars Doorenbos, Federico Spurio, Gianpiero Francesca, Juergen Gall

机构 * University of Bonn(波恩大学) Toyota Motor Europe(丰田欧洲公司) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习和人工智能研究所)

专题命中 视觉定位与Grounding :VLM(title_cn,summary_cn);分类 cs.CV、cs.AI

AI总结 提出ZeProM框架,利用单个预训练VLM同时解决零样本程序性错误检测和时间动作分割,在EgoPER和CaptainCook4D基准上接近或超越全监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21457 2026-06-09 cs.CV cs.AI 版本更新 87%

ACTIVE-o3: Empowering MLLMs with Active Perception via Pure Reinforcement Learning

ACTIVE-o3:通过纯强化学习赋予多模态大语言模型主动感知能力

Muzhi Zhu, Hao Zhong, Canyu Zhao, Zongze Du, Mingyu Liu, Zheng Huang, Anzhou Li, Hao Chen, Cheng Zou, Jingdong Chen, Ming Yang, Chunhua Shen

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出ACTIVE-o3框架,基于GRPO强化学习,通过模块化感知-动作设计和双形式奖励,使MLLM自主学会高效准确的区域选择策略,在开放世界和领域特定任务中显著提升主动感知能力。

Comments Accepted to ICML 2026. Project page: https://aim-uofa.github.io/ACTIVE-o3

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06006 2026-06-04 cs.CV cs.AI cs.CL 87%

Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics

视觉语言模型能预测未来状态吗?从逆动力学引导世界模型

Yifu Qiu, Yftah Ziser, Anna Korhonen, Shay B. Cohen, Edoardo M. Ponti

机构 * Institute for Language, Cognition and Computation, University of Edinburgh(语言、认知与计算研究所,爱丁堡大学) Language Technology Lab, University of Cambridge(语言技术实验室,剑桥大学) NVIDIA(NVIDIA公司) University of Groningen(格罗宁根大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文发现视觉语言模型(VLM)难以直接进行前向动力学预测(FDP),但逆动力学预测(IDP)更容易学习,并利用IDP通过弱监督学习和推理时验证两种策略引导FDP,在Aurora-Bench上取得与最先进图像编辑模型竞争的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10611 2026-04-03 cs.CV cs.AI 87%

Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding

Molmo2:具有视频理解和 grounding 的开放权重和数据的视觉语言模型

Christopher Clark, Jieyu Zhang, Zixian Ma, Jae Sung Park, Mohammadreza Salehi, Rohun Tripathi, Sangho Lee, Zhongzheng Ren, Chris Dongjoo Kim, Yinuo Yang, Vincent Shao, Yue Yang, Weikai Huang, Ziqi Gao, Taira Anderson, Jianrui Zhang, Jitesh Jain, George Stoica, Winson Han, Ali Farhadi, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(title);分类 cs.CV、cs.AI

AI总结 Molmo2 是一种开放源代码的视频语言模型,通过7个新视频数据集和2个多图像数据集,实现了单图像、多图像和视频任务中的点驱动 grounding 能力,其8B模型在短视频计数和描述任务中表现优异,在视频 grounding 任务中超越了现有开源和专有模型。

Comments Updated first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05895 2025-08-06 cs.CV cs.AI 87%

Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI

Benjamin Raphael Ernhofer, Daniil Prokhorov, Jannica Langner, Dominik Bollmann

机构 * SPARKS Solutions GmbH(SPARKS解决方案有限公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19103 2024-12-02 cs.CV cs.CL 87%

VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models

Jeongho Ju, Daeyoung Kim, SunYoung Park, Youngjune Kim

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,comments);grounding(abstract,comments);分类 cs.CV

Comments 24 pages, 15 figures, 4 tables. Model weights at https://huggingface.co/NCSOFT/VARCO-VISION-14B. Benchmarks released at NCSOFT's HuggingFace repositories (K-MMBench, K-SEED, K-MMStar, K-DTCBench, K-LLaVA-W). VARCO-VISION is an open-source Korean-English VLM with OCR, grounding, and referring capabilities

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27365 2026-05-28 cs.CV cs.AI cs.LG cs.RO 87%

LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding

LocateAnything: 基于并行框解码的快速高质量视觉定位

Shihao Wang, Shilong Liu, Yuanguo Kuang, Xinyu Wei, Yangzhou Liu, Zhiqi Li, Yunze Man, Guo Chen, Andrew Tao, Guilin Liu, Jan Kautz, Lei Zhang, Zhiding Yu

机构 * The Hong Kong Polytechnic University(香港理工大学) Princeton University(普林斯顿大学) Nanjing University(南京大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 提出并行框解码(PBD)方法,将边界框和点作为原子单元单步解码,结合大规模数据集LocateAnything-Data,实现高效统一的目标定位与检测,在保持高精度同时显著提升解码吞吐量。

Comments fix github link

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04279 2026-05-26 cs.CL 87%

ECG-R1: Protocol-Guided and Modality-Agnostic MLLM for Reliable ECG Interpretation

ECG-R1: 协议引导且模态无关的可靠心电图解读多模态大语言模型

Jiarui Jin, Haoyu Wang, Xingliang Wu, Xiaocheng Fang, Xiang Lan, Zihan Wang, Deyun Zhang, Bo Liu, Yingying Zhang, Xian Wu, Hongyan Li, Shenda Hong

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) National Institute of Health Data Science, Peking University(北京大学健康数据科学国家研究院) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Tianjin Institute of Cardiology, the Second Hospital of Tianjin Medical University(天津医科大学第二医院心内科) National University of Singapore(新加坡国立大学) Jarvis Lab, Tencent(腾讯 Jarvis实验室) HeartVoice Medical Technology(HeartVoice医疗科技)

专题命中 视觉定位与Grounding :MLLM(title,abstract);grounding(abstract);multimodal large language model(abstract)

AI总结 提出ECG-R1,通过协议引导数据生成、模态解耦架构和强化学习,实现可靠的心电图解读。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02839 2026-05-26 cs.RO 87%

Language Movement Primitives: Grounding Language Models in Robot Motion

语言运动基元:将语言模型锚定在机器人运动中

Yinlong Dai, Benjamin A. Christie, Daniel J. Evans, Dylan P. Losey, Simon Stepputtis

机构 * Collab , Dept. of Mechanical Engineering, Virginia Tech, Blacksburg, VA 24061(合作组,机械工程系,弗吉尼亚理工学院,黑斯堡,VA 24061) TEA Lab , Dept. of Mechanical Engineering, Virginia Tech, Blacksburg, VA 24061(TEA实验室,机械工程系,弗吉尼亚理工学院,黑斯堡,VA 24061)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);grounding(title)

AI总结 提出语言运动基元(LMP)框架,通过将视觉语言模型(VLM)推理与动态运动基元(DMP)参数化结合,实现零样本机器人操作任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22519 2026-04-27 cs.RO 87%

Clutter-Robust Vision-Language-Action Models through Object-Centric and Geometry Grounding

通过对象中心和几何约束实现抗杂波的视觉-语言-动作模型

Khoa Vo, Taisei Hanyu, Yuki Ikebe, Trong Thang Pham, Nhat Chung, Minh Nhat Vu, Duy Nguyen Ho Minh, Anh Nguyen, Anthony Gunderman, Chase Rainwater, Ngan Le

机构 * University of Arkansas(阿拉巴马大学) National University of Singapore(新加坡国立大学) TU Wien(维也纳技术大学) Max Planck Research School for Intelligent Systems(智能系统马克斯·普朗克研究学校) University of Stuttgart(斯图加特大学) University of Liverpool(利物浦大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 本文提出OBEYED-VLA框架,通过分离感知接地与动作推理提升视觉-语言-动作模型在现实环境中的鲁棒性,特别是在存在干扰物、目标缺失和背景变化等挑战性场景中表现优异。

Comments Under review. Project website: https://uark-aicv.github.io/OBEYED_VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21546 2025-12-15 cs.CV cs.AI cs.CL cs.LG 87%

Counterfactual Segmentation Reasoning: Diagnosing and Mitigating Pixel-Grounding Hallucination

反事实分割推理:诊断和缓解像素接地幻觉

Xinzhuo Li, Adheesh Juvekar, Jiaxun Zhang, Xingyou Liu, Muntasir Wahed, Kiet A. Nguyen, Yifan Shen, Tianjiao Yu, Ismini Lourentzou

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出反事实分割推理任务,通过反事实微调训练模型减少分割幻觉,实验表明其在减少幻觉和提升分割性能方面效果显著。

Comments Project webpage: https://plan-lab.github.io/hallusegbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07171 2025-11-11 cs.CV cs.AI cs.LG 87%

Federated Learning for Video Violence Detection: Complementary Roles of Lightweight CNNs and Vision-Language Models for Energy-Efficient Use

Sébastien Thuau, Siba Haidar, Rachid Chelouah

机构 * esieaLab, ETIS Laboratory(esiea实验室,ETIS实验室) ESIEA, University of CY Cergy(ESIEA,CY塞克大学) ETIS Laboratory, CNR1S, UMR8051(ETIS实验室,CNR1S,UMR8051)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 5 pages, 3 figures, ICTAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04477 2025-10-07 cs.CV cs.AI cs.CL cs.LG 87%

MedCLM: Learning to Localize and Reason via a CoT-Curriculum in Medical Vision-Language Models

Soo Yong Kim, Suin Cho, Vincent-Daniel Yun, Gyeongyeon Hwang

机构 * A.I.MATICS Inc(A.I.MATICS公司) Boston University(波士顿大学) University of Southern California(南加州大学) Heuron(Heuron公司) MODULABS, Open Neural Networks Research Lab(MODULABS,开放神经网络研究实验室)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03987 2025-03-07 cs.CV cs.AI cs.CL cs.LG 87%

RetinalGPT: A Retinal Clinical Preference Conversational Assistant Powered by Large Vision-Language Models

Wenhui Zhu, Xin Li, Xiwen Chen, Peijie Qiu, Vamsi Krishna Vasa, Xuanzhao Dong, Yanxi Chen, Natasha Lepore, Oana Dumitrascu, Yi Su, Yalin Wang

专题命中 视觉定位与Grounding :vision-language model(title);LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04681 2024-07-08 cs.CV cs.AI cs.CL cs.LG 87%

Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge

Yuanze Lin, Yunsheng Li, Dongdong Chen, Weijian Xu, Ronald Clark, Philip Torr, Lu Yuan

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16035 2023-10-25 cs.CV cs.AI cs.CL cs.LG stat.ML 87%

What's Left? Concept Grounding with Logic-Enhanced Foundation Models

Joy Hsu, Jiayuan Mao, Joshua B. Tenenbaum, Jiajun Wu

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

Comments NeurIPS 2023. First two authors contributed equally. Project page: https://web.stanford.edu/~joycj/projects/left_neurips_2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16846 2024-04-17 cs.CV cs.AI cs.CL 87%

GROUNDHOG: Grounding Large Language Models to Holistic Segmentation

Yichi Zhang, Ziqiao Ma, Xiaofeng Gao, Suhaila Shakiah, Qiaozi Gao, Joyce Chai

专题命中 视觉定位与Grounding :grounding(title,abstract);MLLM(abstract,comments);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Accepted to CVPR 2024. Website: https://groundhog-mllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18573 2026-08-20 cs.CV 新提交 86%

PATE-Forensics: Perception-as-Tool for Explainable Deepfake Forensics with General-Purpose MLLMs

PATE-Forensics:以通用多模态大语言模型(MLLM)为工具的可解释深度伪造取证方法

Yaqi Li, Jielun Peng, Yabin Wang, Jincheng Liu, Xiaopeng Hong

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉定位与Grounding :MLLM(title_cn,summary_cn);分类 cs.CV

AI总结 本研究提出PATE-Forensics,采用“感知即工具”范式,基于DINOv3构建取证感知工具,结合通用MLLM实现可解释深度伪造取证,在DDL-X Track 3数据集上取得0.89的最佳官方分数,较次席高出0.19分。

Comments 9 pages, 3 figures, 2 tables; DDL-X Track 3, IJCAI 2026 AI Safety Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17926 2026-08-19 cs.CV 新提交 86%

PerFact: Perception-Derived Fact Prompting for 3D Brain MRI Report Generation

PerFact:用于3D脑部MRI报告生成的感知衍生事实提示方法

Jianyu Sun, Zhenxuan Zhang, Guang Yang, Peter J. Lally

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 该研究针对3D脑部MRI报告生成,提出PerFact方法,以上游3D分割分类输出的结构化事实提示LoRA适配的视觉语言模型,证实grounding信息是报告质量的主导因素而非模型选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07117 2026-08-10 cs.CV 新提交 86%

Beyond Fluency: A Clinical Benchmark and Anomaly-Enhanced Baseline for Spine MRI Report Generation

超越流畅性:脊柱MRI报告生成的临床基准与异常增强基线

Bruno Palau, Franziska Vogt, Daria Laslo, Haobo Li, Ender Konukoglu, Maria Monzon, Catherine R. Jutzeler

机构 * ETH Zurich(苏黎世联邦理工学院) Swiss Institute of Bioinformatics (SIB)(瑞士生物信息学研究所)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 该研究针对放射学报告的耗时与阅片差异问题,构建腰椎MRI的VLM临床基准,提出半监督U-Net++生成异常热图增强VLM的框架,提升诊断可靠性与可解释性。

Comments Maria Monzon and Catherine R. Jutzeler contributed equally as shared last authors. Accepted at the CV4Clinic Workshop, CVPR 2026

Journal ref Proc. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 6759-6770

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31533 2026-07-24 cs.CV 版本更新 86%

MV-GEL: Language-Driven Multi-View Geometric Entity Localization on Meshes

MV-GEL:语言驱动的多视图网格几何实体定位

Kartik Bali, Roland Aydin

机构 * Helmholtz Zentrum Hereon(亥姆霍兹赫里恩研究中心) Institute for Continuum and Material Mechanics, Hamburg University of Technology(汉堡工业大学连续介质与材料力学研究所) German Research Center for Artificial Intelligence(德国人工智能研究中心)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出MV-GEL框架,通过语言查询定位网格上的细粒度几何实体,利用视角选择模块GELviews优先选择可观察性高的视角,结合VLM分割和光线投射提升定位精度。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏