arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2257 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2257 篇

2604.11589 2026-04-14 cs.CV 83%

MLLM-as-a-Judge Exhibits Model Preference Bias

基于大语言模型的自动评估存在模型偏好偏差

Shuitsu Koyama, Yuiga Wada, Daichi Yashima, Komei Sugiura

机构 * Keio University(庆应义塾大学)

专题命中 幻觉与鲁棒性 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文研究了基于多模态大语言模型(MLLM)的自动评估方法中存在模型特定偏好偏差的问题,提出Philautia-Eval工具量化这种偏差,并通过实验发现模型间存在相互偏好偏差,最后引入Pomms模型组合方法有效缓解了偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21472 2026-04-13 cs.CV cs.CL cs.MM 83%

Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration

通过自适应注意力校准缓解大视觉-语言模型中的幻觉

Mehrdad Fazli, Bowen Wei, Ahmet Sari, Ziwei Zhu

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出CAAC框架,通过解决空间感知偏差和模态偏差,提升大视觉-语言模型在长文本生成中的准确性和视觉对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04473 2026-04-07 cs.CV 83%

Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks

超越标准基准:对视觉-语言模型在不同任务中对自然语义变化鲁棒性的系统审计

Jia Chengyu, AprilPyone MaungMaung, Huy H. Nguyen, Jinyin Chen, Isao Echizen

机构 * Zhejiang University of Technology(浙江工业大学) National Institute of Informatics(国立信息学研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文系统评估了视觉-语言模型在自然对抗场景下的鲁棒性,分析了不同模型在零样本图像分类、语义分割和视觉问答中的表现,揭示了鲁棒CLIP模型放大对抗漏洞的问题。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03151 2026-04-07 cs.AI 83%

Enhancing Foundation VLM Robustness to Missing Modality: Scalable Diffusion for Bi-directional Feature Restoration

增强基础视觉语言模型对缺失模态的鲁棒性:可扩展的扩散用于双向特征恢复

Wei Dai, Haoyu Wang, Honghao Chang, Lijun He, Fan Li, Jian Sun, Haixia Bi

机构 * Department of Electronics Information \ 'an Jiaotong University Xi'an China School of Information Communications Engineering \ 'an Jiaotong University Xi'an China School of Mathematics Statistics \ 'an Jiaotong University Xi'an China Information \ 'an Jiaotong University Communications Engineering \ 'an Jiaotong University Statistics \ 'an Jiaotong University

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision language model(abstract);分类 cs.AI

AI总结 本文提出一种通用缺失模态恢复策略,通过增强扩散模型实现双向特征对齐,提升视觉语言模型在模态缺失情况下的鲁棒性和可扩展性。

Comments 10 pages, 8 figures, 6 tables. Experiments and some details have been updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17722 2026-04-06 cs.CV 83%

Can Vision-Language Models Count? A Synthetic Benchmark and Analysis of Attention-Based Interventions

视觉-语言模型能计数吗?一个合成基准和基于注意力的干预分析

Saurav Sengupta, Nazanin Moradinasab, Jiebei Liu, Donald E. Brown

机构 * School of Data Science, University of Virginia(弗吉尼亚大学数据科学学院)

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文通过合成基准和注意力干预分析,探讨了视觉-语言模型在计数任务中的表现,揭示了视觉和语言复杂性对计数准确率的影响,并展示了针对性的注意力重加权对计数行为的改进。

Comments Accepted at COGVL Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27918 2026-03-31 cs.CR cs.AI 83%

Adversarial Attacks on Multimodal Large Language Models: A Comprehensive Survey

对多模态大语言模型的对抗攻击:全面综述

Bhavuk Jain, Sercan Ö. Arık, Hardeo K. Thakur

机构 * Google(谷歌) Bennett University, India(印度贝内特大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.AI

AI总结 本文综述了多模态大语言模型面临的对抗威胁,分析了攻击类型及其根源,提出分类框架以提升模型安全性。

Comments Survey paper, 37 pages, 10 figures, accepted at TMLR

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17108 2026-03-25 cs.CV 83%

LLM-Powered Flood Depth Estimation from Social Media Imagery: A Vision-Language Model Framework with Mechanistic Interpretability for Transportation Resilience

基于大语言模型的社交媒体影像洪水深度估计:一种具有机制可解释性的视觉-语言模型框架用于交通韧性

Nafis Fuad, Xiaodong Qian

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出FloodLlama,一种基于视觉-语言模型的洪水深度估计框架,通过合成数据集和多模态传感管道实现厘米级实时洪水深度估计,提升交通网络韧性。

Comments There is a update in result, which is needed to be addressed

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21426 2026-03-24 cs.CV 83%

Uncertainty-Aware Knowledge Distillation for Multimodal Large Language Models

面向不确定性的多模态大语言模型知识蒸馏

Jingchen Sun, Shaobo Han, Deep Patel, Wataru Kohno, Can Jin, Changyou Chen

机构 * NEC Laboratories America, Inc.(NEC美洲实验室) University at Buffalo, SUNY(布法罗大学) Rutgers University(罗格斯大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出Beta-KD框架,通过统一贝叶斯视角平衡数据与教师指导,提升多模态VQA任务性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23495 2026-03-24 cs.CV 83%

Embedding Shift Dissection on CLIP: Effects of Augmentations on VLM's Representation Learning

在CLIP上嵌入位移分析:不同增强对VLM表示学习的影响

Ashim Dahal, Saydul Akbar Murad, Nick Rahimi

机构 * University of Southern Mississippi(密西西比大学)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision language model(abstract);分类 cs.CV

AI总结 研究分析不同增强技术对CLIP嵌入位移的影响,探讨增强对视觉语言模型表示学习的机械可解释性影响。

Comments accepted at MIV at CVPR 2025

Journal ref 2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13293 2026-03-19 cs.CV eess.IV 83%

NutVLM: A Self-Adaptive Defense Framework against Full-Dimension Attacks for Vision Language Models in Autonomous Driving

NutVLM: 一种针对自动驾驶中视觉语言模型全维度攻击的自适应防御框架

Xiaoxu Peng, Dong Zhou, Jianwen Zhang, Guanghui Sun, Anh Tu Ngo, Anupam Chattopadhyay

机构 * Department of Control Science and Engineering, Harbin Institute of Technology(控制科学与工程系,哈尔滨工业大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出NutVLM框架,通过NutNet++ sentinel检测并净化良性样本、局部修补和全局扰动,结合高效灰度遮蔽和专家引导的对抗提示调优,提升自动驾驶中视觉语言模型的鲁棒性与性能。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15557 2026-03-17 cs.CV 83%

Anatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language Models

Lie的解剖:一种多阶段诊断框架,用于追踪视觉-语言模型中的幻觉

Lexiang Xiong, Qi Li, Jingwen Ye, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Monash University(墨尔本大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出一种多阶段诊断框架,通过动态认知轨迹分析视觉-语言模型中的幻觉问题,结合几何信息双重视角,实现高效且鲁棒的幻觉检测,提升模型透明度和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14219 2026-03-17 cs.CV 83%

Safety-Potential Pruning for Enhancing Safety Prompts Against VLM Jailbreaking Without Retraining

安全潜力修剪:提升对抗VLM劫持的安全提示而无需重新训练

Chongxin Li, Hanzhang Wang, Lian Duan

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出安全潜力修剪方法,通过去除对安全提示不敏感的权重,增强安全路径,提升VLM对抗能力,减少攻击成功率22%。

Comments Accepted for publication in Transactions of the Association for Computational Linguistics (TACL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12799 2026-03-16 cs.CV 83%

What Makes VLMs Robust? Towards Reconciling Robustness and Accuracy in Vision-Language Models

什么使视觉语言模型具备鲁棒性?迈向视觉语言模型鲁棒性与准确性的协调

Sen Nie, Jie Zhang, Zhongqi Wang, Zhaoyang Wei, Shiguang Shan, Xilin Chen

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文研究了视觉语言模型鲁棒性与准确性的平衡问题,通过分析对抗性微调模型,发现鲁棒性主要集中在浅层网络,提出Adversarial Robustness Adaptation框架以提升鲁棒性与准确性。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08897 2026-03-11 cs.CV 83%

Comparative Analysis of Patch Attack on VLM-Based Autonomous Driving Architectures

基于VLM的自动驾驶架构中补丁攻击的比较分析

David Fernandez, Pedram MohajerAnsari, Amir Salarpour, Long Cheng, Abolfazl Razi, Mert D. Pesé

机构 * School of Computing, Clemson University(计算机学院,克莱姆森大学)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文比较了三种基于VLM的自动驾驶架构对物理对抗攻击的鲁棒性,发现所有架构均存在严重漏洞,揭示了不同架构在对抗威胁下的脆弱性。

Comments Accepted at the 2025 IEEE Intelligent Vehicles Symposium (IV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07572 2026-03-10 cs.LG 83%

TS-MLLM: A Multi-Modal Large Language Model-based Framework for Industrial Time-Series Big Data Analysis

TS-MLLM:一种基于多模态大语言模型的工业时间序列大数据分析框架

Haiteng Wang, Yikang Li, Yunfei Zhu, Jingheng Yan, Lei Ren, Laurence T. Yang

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) School of Software, Beihang University(北京航空航天大学软件学院) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) State Key Laboratory of Intelligent Manufacturing System Technology(智能制造系统技术国家重点实验室) School of Computer and Artificial Intelligence, Zhengzhou University(郑州大学计算机与人工智能学院) Department of Computer Science, St. Francis Xavier University(圣弗朗西斯科大学计算机科学系)

专题命中 幻觉与鲁棒性 :MLLM(title,abstract);vision-language model(abstract);分类 cs.LG

AI总结 TS-MLLM通过多模态大语言模型联合建模时序信号、频域图像和文本知识,提升工业时间序列预测的鲁棒性、效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07074 2026-03-10 cs.CV 83%

Physics-Guided VLM Priors for All-Cloud Removal

物理引导的VLM先验条件用于全云去除

Liying Xu, Huifang Li, Huanfeng Shen

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出PhyVLM-CR方法,结合VLM语义能力和物理模型,实现高保真全云去除,提升云去除与内容保留的平衡性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06141 2026-03-09 cs.CV 83%

Spatial Colour Mixing Illusions as a Perception Stress Test for Vision-Language Models

空间色彩混合错觉作为视觉-语言模型的感知压力测试

Nicoleta-Nina Basoc, Adrian Cosma, Emilian Radoi

机构 * National University of Science and Technology POLITEHNICA Bucharest(波兰布加勒斯特技术大学) IDSIA, The Dalle Molle Institute for Artificial Intelligence(达摩信息技术研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 研究通过空间色彩混合错觉测试视觉-语言模型的感知鲁棒性,发现模型在结构化色彩扭曲下表现下降,而人类表现更优,预处理步骤可提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11689 2026-03-09 cs.RO cs.AI 83%

Phys2Real: Fusing VLM Priors with Interactive Online Adaptation for Uncertainty-Aware Sim-to-Real Manipulation

Phys2Real: 融合视觉语言模型先验与交互在线适应以实现不确定性感知的仿真到现实操控

Maggie Wang, Stephen Tian, Aiden Swann, Ola Shorinwa, Jiajun Wu, Mac Schwager

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 Phys2Real通过融合视觉语言模型先验与交互适应,提升仿真到现实操控的不确定性感知与任务成功率。

Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03527 2026-03-05 cs.LG 83%

Logit-Level Uncertainty Quantification in Vision-Language Models for Histopathology Image Analysis

视觉-语言模型在病理图像分析中的logit级不确定性量化

Betul Yurdem, Ferhat Ozgur Catak, Murat Kuzlu, Mehmet Kemal Gullu

机构 * Department of Electrical and Electronics Engineering, Izmir Bakircay University(电气与电子工程系,伊兹密尔巴克伊大学) Department of Electrical Engineering and Computer Science, University of Stavanger(电气工程与计算机科学系,斯塔万格大学) Batten College of Engineering and Technology, Old Dominion University(工程与技术学院,老奥布良大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.LG

AI总结 本研究提出了一种基于VLMs的logit级不确定性量化框架,用于评估病理图像分析中模型的可靠性与安全性。

Comments 10 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20504 2026-02-05 cs.CV 83%

UniVRSE: Unified Vision-conditioned Response Semantic Entropy for Hallucination Detection in Medical Vision-Language Models

UniVRSE: 统一的视觉条件响应语义熵用于医学视觉语言模型中的幻觉检测

Zehui Liao, Shishuai Hu, Ke Zou, Mengyuan Jin, Yanning Zhang, Huazhu Fu, Liangli Zhen, Yong Xia

机构 * National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology, School of Computer Science and Engineering, Northwestern Polytechnical University(集成航空航天地面海洋大数据应用技术国家工程实验室,计算机科学与工程学院,西北工业大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

AI总结 UniVRSE通过统一的视觉条件响应语义熵框架,有效检测医学视觉语言模型中的幻觉,提升临床应用的可靠性。

Comments Under Review. 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18533 2026-02-04 cs.CV cs.CL cs.CR 83%

Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models

重新审视视觉语言模型安全微调中的瓶颈

Yi Ding, Lijun Li, Bing Cao, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Purdue University(普渡大学) Tianjin University(天津大学)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出多图像安全数据集,通过增强视觉推理能力,提升模型在安全关键任务中的性能与通用能力。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00523 2026-02-03 cs.CV 83%

SAGE: Accelerating Vision-Language Models via Entropy-Guided Adaptive Speculative Decoding

SAGE:通过熵引导的自适应推测解码加速视觉-语言模型

Yujia Tong, Tian Zhang, Yunyang Wan, Kaiwei Lin, Jingling Yuan, Chuang Hu

机构 * School of Computer Science(计算机科学学院) Artificial Intelligence, Wuhan University of Technology, Hubei 430070, China(人工智能,武汉科技大学,湖北430070,中国) School of Computer Science, Wuhan University, Hubei 430072, China(计算机科学学院,武汉大学,湖北430072,中国)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

AI总结 SAGE通过熵引导的自适应推测解码方法,动态调整树结构以提高视觉-语言模型的解码速度,实现高达3.36倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14224 2026-01-30 cs.CV 83%

Beyond Retraining: Training-Free Unknown Class Filtering for Source-Free Open Set Domain Adaptation of Vision-Language Models

超越再训练:用于无源开放集域适应的无训练未知类过滤

Yongguang Li, Jindong Li, Qi Wang, Qianli Xing, Runliang Niu, Shengsheng Wang, Menglin Yang

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 VLM-OpenXpert通过无训练模块SUFF和BGAT实现无源开放集域适应,有效抑制未知类干扰并提升模型性能。

Comments Core methods unchanged; title updated and full-text narrative refined for clarity and logical coherence. No changes to key findings and conclusions

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12865 2026-01-21 cs.CV 83%

Proxy Robustness in Vision Language Models is Effortlessly Transferable

视觉语言模型中的代理鲁棒性可以轻易转移

Xiaowei Fu, Fuxiang Huang, Lei Zhang

机构 * Chongqing Key Laboratory of Bio-perception(重庆生物感知实验室) Multimodal Intelligent Information Processing, Chongqing University, Chongqing 401331, China(多模态智能信息处理,重庆大学,重庆401331,中国) School of Microelectronics(微电子学院) Communication Engineering, Chongqing University, Chongqing 401331, China(通信工程,重庆大学,重庆401331,中国) School of Data Science, Lingnan University, Hong Kong(数据科学学院,岭南大学,香港)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出HPT-GPD框架,通过异构代理转移提升视觉语言模型的对抗鲁棒性,同时缓解过拟合问题,增强零样本自然泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12672 2026-01-21 cs.CV 83%

VILTA: A VLM-in-the-Loop Adversary for Enhancing Driving Policy Robustness

VILTA:一种用于增强驾驶策略鲁棒性的视觉语言模型闭环对抗者

Qimao Chen, Fang Li, Shaoqing Xu, Zhiyi Lai, Zixun Xie, Yuechen Luo, Shengyin Jiang, Hanbing Li, Long Chen, Bing Wang, Yi Zhang, Zhi-Xin Yang

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision language model(abstract);分类 cs.CV

AI总结 VILTA通过整合视觉语言模型到闭环训练中,提升自动驾驶策略在长尾事件中的安全性和鲁棒性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08355 2026-01-16 cs.CV 83%

Semantic Misalignment in Vision-Language Models under Perceptual Degradation

视觉-语言模型在感知退化下的语义错位

Guo Cheng

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本研究探讨了视觉-语言模型在感知退化下的语义错位问题,发现传统分割指标的下降并未影响下游行为,揭示了像素鲁棒性与多模态语义可靠性之间的脱节。

Comments 10 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06142 2026-01-06 cs.CV 83%

SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models

SDEval: 多模态大语言模型的安全动态评估

Hanqing Wang, Yuan Tian, Mingyu Liu, Zhenhao Zhang, Xiangyang Zhu

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 SDEval通过动态调整安全基准分布和复杂度,提升多模态大语言模型的安全评估效果,缓解数据污染并揭示模型安全局限。

Comments AAAI 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22019 2025-12-09 cs.CV 83%

Intra-Class Probabilistic Embeddings for Uncertainty Estimation in Vision-Language Models

类内概率嵌入用于视觉-语言模型中的不确定性估计

Zhenxiang Lin, Maryam Haghighat, Will Browne, Dimity Miller

机构 * Queensland University of Technology(昆士兰理工大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本研究提出一种无需训练的后处理方法,通过类内概率嵌入提升视觉-语言模型的不确定性估计,有效检测错误预测。

Comments Accepted at the IEEE/CVF Winter Conference on Applications of Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05145 2025-12-08 cs.CV 83%

Self-Improving VLM Judges Without Human Annotations

无需人工标注的自改进VLM评判模型

Inna Wanyin Lin, Yushi Hu, Shuyue Stella Li, Scott Geng, Pang Wei Koh, Luke Zettlemoyer, Tim Althoff, Marjan Ghazvininejad

机构 * FAIR at Meta(Meta 的 FAIR) University of Washington(华盛顿大学)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 无需人工标注,通过自训练提升VLM评判模型的准确性和多维度表现

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01922 2025-12-02 cs.CV 83%

Med-VCD: Mitigating Hallucination for Medical Large Vision Language Models through Visual Contrastive Decoding

Med-VCD: 通过视觉对比解码缓解医疗大视觉语言模型的幻觉问题

Zahra Mahdavi, Zahra Khodakaramimaghsoud, Hooman Khaloo, Sina Bakhshandeh Taleshani, Erfan Hashemi, Javad Mirzapour Kaleybar, Omid Nejati Manzari

机构 * Department of computer science, University of Central Florida, Orlando, USA(计算机科学系,中央佛罗里达大学) Department of Bioengineering, University of Pennsylvania, Philadelphia, PA, USA(生物工程系,宾夕法尼亚大学) Department of electrical engineering, Columbia university, New York, NY, USA(电气工程系,哥伦比亚大学) Technical University of Applied Sciences Regensburg, Regensburg, Germany(应用科学技术大学(雷根斯堡)) Department of Surgery, University of Calgary, Calgary, Alberta, Canada(外科系,卡尔加里大学) University College of Nabi Akram, Tabriz, Iran(纳比阿克兰大学) School of Electrical Engineering, Iran University of Science and Technology, Tehran, Iran(电气工程学院,伊朗科学技术大学)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 Med-VCD通过视觉对比解码方法提升医疗大视觉语言模型的事实准确性与幻觉准确性,减少幻觉输出并提高推理效率。

Journal ref Computers in Biology and Medicine (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏