arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-27 至 2026-08-27 共收录 12 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 12 篇

2608.24934 2026-08-27 cs.CV cs.AI 新提交 89%

Fusing Perceptual Vision Experts with Multimodal Large Language Models for Explainable Plant Disease Diagnosis: From Benchmark Imagery to Real-World Robotic Field Validation

融合感知视觉专家与多模态大语言模型的可解释植物病害诊断:从基准图像到真实世界机器人现场验证

Ranjan Sapkota, Konstantinos I. Roumeliotis, Pengyao Xie, Nikolaos D. Tselikas, Lirong Xiang, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of the Peloponnese(伯罗奔尼撒大学) Agricultural University of Athens(雅典农业大学)

专题命中 幻觉与鲁棒性 :MLLM(summary_cn,abstract);multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究提出H²MAF框架,结合EfficientNet-B3、ConvNeXt-Tiny与Gemma、Qwen等MLLM,在PlantDoc及Cornell机器人田间数据集上实现高准确率可解释植物病害诊断,验证了MLLM仲裁的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16081 2026-08-27 cs.CV 版本更新 85%

SafeGesture: Evaluating Fine-Grained Hand Gesture Understanding in Vision-Language Models through Scenario-Conditioned Safety Interpretation

SafeGesture:通过场景条件安全解释评估视觉语言模型的细粒度手势理解能力

Taegang Kim, Saleh Afroogh, Junfeng Jiao

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Urban Information Lab, The University of Texas at Austin(德克萨斯大学奥斯汀分校城市信息实验室)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出SafeGesture基准,评估5款视觉语言模型的细粒度手势安全理解能力,发现模型存在感知与推理脱节,瓶颈为场景条件安全推理而非手势识别。

Comments 14 pages, 22 tables, 2 figures. Code and benchmark resources available at this https URL (https://github.com/The-Responsible-AI-Initiative/SafeGesture)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25653 2026-08-27 cs.CV 新提交 79%

Towards Purified Multi-Label Test-Time Adaptation of Vision-Language Models

面向视觉-语言模型的纯化多标签测试时自适应方法

Yiwen Liang, Hui Chen, Yizhe Xiong, Mengyao Lyu, Yuhan Cao, Zijia Lin, Shuaicheng Niu, Sicheng Zhao, Jungong Han, Guiguang Ding

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) University of Washington(华盛顿大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对视觉-语言模型多标签测试时自适应的缓存方法PuRF,通过区域与缓存纯化解决现有方法的偏差与校准问题,在五项数据集上使ViT-B/32的mAP提升4.05%,性能优于现有最优方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25375 2026-08-27 cs.CY cs.CL cs.CV 新提交 79%

GGSS: Geodesic-Gated Spherical Steering for Inference-Time Debiasing of Generative Vision-Language Models

GGSS:用于生成式视觉语言模型推理时去偏的测地线门控球面引导

Yiqun Sun, Junyu Chen, Pengfei Wei, Lawrence B. Hsieh

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本研究提出GGSS方法,针对生成式VLMs设计推理时去偏方案,经实验验证其在降低人口统计学偏见的同时,能较好保留模型通用视觉语言能力。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22829 2026-08-27 cs.CV 版本更新 79%

Lost in Motion: Vision Language Models Fail the Dynamic Gauges Test

迷失在振动中:视觉语言模型在动态刻度测试中失败

Tairan Fu, Francisco Javier Santos-Martín, Javier Conde, Elena Merino-Gómez, Pedro Reviriego

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本文评估了最新视觉语言模型在动态刻度测试中的表现,发现其在分析高频事件和指针振动方面存在不足,无法满足计量学和不确定性量化的要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26035 2026-08-27 cs.CL 新提交 67%

Beyond Local Surprise: Grounded Dialogue as Selective Belief Revision under Referential Uncertainty

超越局部意外:指称不确定性下的对话作为选择性信念修正

Ziming Liu, Bhanu Chaitanya Jasti, Ziyang Xu, Hongyu Wu, Yi Wu, Jiqun Liu

机构 * University of Oklahoma(俄克拉荷马大学) University of Wisconsin–Milwaukee(威斯康星大学密尔沃基分校)

专题命中 幻觉与鲁棒性 :grounding(abstract,abstract_cn)

AI总结 该研究针对听者在指称不确定性下的对话保留/修正决策,提出数据驱动框架,发现不确定性敏感策略可在保留连贯理解的同时维持良好检索性能,其模式符合概念契约理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25561 2026-08-27 cs.CL 新提交 67%

EgoArgus: Benchmarking VLMs as Situational Assistants for Modality-Grounded User Supports

EgoArgus:将视觉语言模型(VLM)作为模态接地用户支持情境助手的基准测试

Yu-Chien Tang, Yu-Hsiang Liu, An-Zi Yen

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 幻觉与鲁棒性 :VLM(title_cn)

AI总结 研究针对当前VLMs作为日常助手的模态仲裁难题,构建人工标注数据集EgoArgus,发现现有VLMs仍难胜任该任务,且现有偏差缓解方法效果有限,为部署提供了参考。

Comments Accepted by EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26095 2026-08-27 cs.CV cs.AI 新提交 62%

A Visual Dependence-Aware Framework for Multimodal Unsupervised Continual Post-Training

面向多模态无监督持续后训练的视觉依赖感知框架

Kaichen Li, Zhilin Zhu, Jianhao Huang, Zhengqin Lai, Baochen Xiong, Zibo Shao, Yaguang Song, Linhui Xiao, Xiaoshan Yang, Changsheng Xu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) Pengcheng Laboratory(鹏城实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract_cn);分类 cs.CV、cs.AI

AI总结 针对多模态无监督持续后训练中现有方法忽略视觉依赖的问题,提出含VC-OT和VMA组件的VDA框架,可同时维持旧任务稳定性与新任务可塑性,经实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22338 2026-08-27 cs.RO cs.AI cs.LG 版本更新 62%

RoboMME-Interference: Benchmarking Robot Memory Under Interference

干扰下的机器人记忆基准测试

Soumil Rathi

机构 * Independent Researcher(独立研究员)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 提出RoboMME-Interference基准,通过跨会话干扰评估机器人长期记忆能力,发现现有系统在干扰下性能显著下降。

Comments 9 pages, 5 figures. Updated results; added subgoal-memory systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25986 2026-08-27 cs.AI 新提交 57%

Multi-Granularity Context-Enhanced RAG over Multimodal Knowledge Graphs

面向多模态知识图谱的多粒度上下文增强检索增强生成

Zongyu Wu, Yilong Wang, Xiaochen Wang, Minhua Lin, Zhichao Xu, Fenglong Ma, Xiang Zhang, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Utah(犹他大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 针对现有多模态知识图谱RAG方法的语义鸿沟问题,本文提出CEMMKG框架,通过多粒度局部与全局上下文增强,有效提升了多模态GraphRAG的性能与适用性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25490 2026-08-27 cs.CR cs.AI cs.MM 新提交 57%

MMJailBench: A Factorized Benchmark for Disentangling Multimodal Jailbreak Vulnerabilities

MMJailBench:用于解耦多模态越狱漏洞的因子化基准

Tianshi Wang, Jingsong Wang, Yafei Huang, Fengling Li, Xin Li, Lei Zhu

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 研究人员推出MMJailBench因子化基准,对16个MLLMs评估后揭示其越狱漏洞特征异质且依赖模型,明确提示框架等关键影响因素,开发出模块化多模态越狱评估套件用于高效审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04235 2026-08-27 cs.ET 版本更新 50%

Scale-CDA: A Scalable Aftermarket Platform to Democratize Cooperative Driving Automation in Production Cars

Scale-CDA:一款用于量产车的、可扩展的原型,旨在普及AI辅助的协同驾驶自动化(CDA)

Hao Zhou, Shengming Yuan, Yuhang Wang, Alina Hagen, Haibin Wen

专题命中 幻觉与鲁棒性 :MLLM(abstract_cn)

AI总结 本研究提出Scale-CDA这一开源工具链,基于OpenDBC与Openpilot构建,成本低于1000美元,可实现AI辅助CDA的即插即用改装,通过多车辆测试验证了其低时延与数据隐私保护能力,为普及协同自动驾驶提供了实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏