arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-19 至 2026-02-19 共收录 7 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 7 篇

2511.13494 2026-02-19 cs.CV cs.AI 81%

Language-Guided Invariance Probing of Vision-Language Models

语言引导的视觉-语言模型不变性探测

Jae Joong Lee

机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出LGIP基准,用于评估视觉-语言模型对语言扰动的鲁棒性,发现EVA02-CLIP和OpenCLIP表现优异,而SigLIP存在显著缺陷。

Comments Pattern Recognition Letters 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07680 2026-02-19 cs.CV cs.AI cs.LG cs.RO 80%

Vision and Language: Novel Representations and Artificial intelligence for Driving Scene Safety Assessment and Autonomous Vehicle Planning

视觉与语言:新颖的表示方法和人工智能用于驾驶场景安全评估与自动驾驶规划

Ross Greer, Maitrayee Keskar, Angel Martinez-Sanchez, Parthib Roy, Shashank Shriram, Mohan Trivedi

专题命中 幻觉与鲁棒性 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文研究了视觉-语言表示在自动驾驶安全评估和规划中的应用,提出轻量级危险检测、轨迹规划框架整合及自然语言约束方法,强调表示-任务对齐的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15873 2026-02-19 cs.RO cs.AI 74%

Test-Time Adaptation for Tactile-Vision-Language Models

测试时适应用于触觉-视觉-语言模型

Chuyang Ye, Haoxian Jing, Qinting Jiang, Yixi Lin, Qiang Li, Xing Tang, Jingyan Jiang

机构 * Shenzhen Technology University(深圳技术大学) New York University(纽约大学) Shenzhen University(深圳大学) Tsinghua University(清华大学)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.AI

AI总结 本文提出了一种可靠性感知框架,用于提升触觉-视觉-语言模型在测试时的适应能力,通过估计各模态可靠性来过滤不可靠样本并优化融合过程,有效提升了在模态损坏情况下的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16019 2026-02-19 cs.CV cs.AI 62%

MedProbCLIP: Probabilistic Adaptation of Vision-Language Foundation Model for Reliable Radiograph-Report Retrieval

MedProbCLIP: 基于概率适应的视觉-语言基础模型用于可靠放射影像-报告检索

Ahmad Elallaf, Yu Zhang, Yuktha Priya Masupalli, Jeong Yang, Young Lee, Zechun Cao, Gongbo Liang

机构 * Texas A&M University-San Antonio(德克萨斯A&M大学-圣安东尼奥分校) Boise State University(博伊州立大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 MedProbCLIP 通过概率适应提升放射影像与报告检索的可靠性,优于现有基线方法。

Comments Accepted to the 2026 Winter Conference on Applications of Computer Vision (WACV) Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15927 2026-02-19 cs.CV cs.LG 62%

Visual Memory Injection Attacks for Multi-Turn Conversations

多轮对话中的视觉记忆注入攻击

Christian Schlarmann, Matthias Hein

机构 * Tübingen AI Center, University of Tübingen, Germany(图宾根人工智能中心,图宾根大学,德国)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出一种多轮对话中的视觉记忆注入攻击,通过操控用户输入实现隐蔽的信息操控,展示了对大视觉-语言模型的安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12907 2026-02-19 cs.LG cs.CL 57%

SNAP-UQ: Self-supervised Next-Activation Prediction for Single-Pass Uncertainty in TinyML

SNAP-UQ:单次传递的不确定性估计用于TinyML中的自监督下一次激活预测

Ismail Lamaakal, Chaymae Yahyati, Khalid El Makkaoui, Ibrahim Ouahbi, Yassine Maleh

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 SNAP-UQ通过单次传递的自监督下一次激活预测,为TinyML提供了一种高效且无需额外状态的不确定性估计方法。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15859 2026-02-19 cs.CL 50%

From Transcripts to AI Agents: Knowledge Extraction, RAG Integration, and Robust Evaluation of Conversational AI Assistants

从语音记录到AI代理:知识提取、RAG整合及对话式AI助手的鲁棒评估

Krittin Pachtrachai, Petmongkon Pornpichitsuwan, Wachiravit Modecrua, Touchapon Kraisingkorn

机构 * Amity Research and Application Center (ARAC)(阿米蒂研究与应用中心)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 本文提出了一种端到端框架,通过历史通话记录构建和评估对话式AI助手,利用知识提取和RAG整合提升事实准确性和鲁棒性。

Comments 9 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏