arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-20 至 2026-02-20 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 3 篇

2509.16072 2026-02-20 cs.RO 82%

I-FailSense: Towards General Robotic Failure Detection with Vision-Language Models

I-FailSense:面向通用机器人故障检测的视觉-语言模型

Clemence Grislain, Hamed Rahimi, Olivier Sigaud, Mohamed Chetouani

机构 * ISIR, Sorbonne Université, CNRS(ISIR,索邦大学,国家科学研究中心)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract)

AI总结 I-FailSense通过构建专门用于检测语义错位故障的数据集,提出了一种开源视觉-语言模型框架,有效提升机器人故障检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06530 2026-02-20 cs.CV cs.CR 70%

Universal Anti-forensics Attack against Image Forgery Detection via Multi-modal Guidance

面向图像伪造检测的通用反取证攻击框架 via 多模态指导

Haipeng Li, Rongxuan Peng, Anwei Luo, Shunquan Tan, Changsheng Chen, Anastasia Antsiferova

机构 * Shenzhen University, China(深圳大学) Nanyang Technological University, Singapore(南洋理工大学) Shenzhen MSU-BIT University, China(深圳MSU-BIT大学) Lomonosov Moscow State University's Institute for Artificial Intelligence, Russia(罗蒙诺索夫莫斯科国立大学人工智能研究所)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出ForgeryEraser框架,通过多模态指导损失实现对图像伪造检测器的通用反取证攻击,揭示了VLMs依赖性带来的对抗性漏洞,并展示了对先进AIGC检测器的性能影响。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17386 2026-02-20 cs.AI cs.IR 57%

Visual Model Checking: Graph-Based Inference of Visual Routines for Image Retrieval

视觉模型检查:基于图的图像检索中的视觉例行程序推断

Adrià Molina, Oriol Ramos Terrades, Josep Lladós

机构 * Centre de Visió per Computador(视觉计算中心) Universitat Autònoma de Barcelona(巴塞罗那自治大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种结合图基验证与神经代码生成的框架,用于提升图像检索中复杂查询的可信度和可验证性。

Comments Submitted for ICPR Review

详情

展开后加载摘要…

URL PDF HTML 收藏