arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2272 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2272 篇

2604.16541 2026-04-21 cs.CV 57%

BOOKAGENT: Orchestrating Safety-Aware Visual Narratives via Multi-Agent Cognitive Calibration

BOOKAGENT:通过多智能体认知校准 orchestrate 安全意识的视觉叙述

Bo Gao, Chang Liu, Yuyang Miao, Siyuan Ma, Ser-Nam Lim

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Science and Technology of China(中国科学技术大学) Imperial College London(伦敦帝国理工学院) Nanyang Technological University(南洋理工大学) University of Central Florida(佛罗里达中央大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV

AI总结 本文提出BOOKAGENT,一种安全意识的多智能体协作框架,用于高质量的视觉叙述生成,通过联合规划、脚本、插图和全局修复不一致,提升叙述连贯性和视觉一致性。

Comments 18 pages, Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15678 2026-04-20 cs.CV 57%

HyCal: A Training-Free Prototype Calibration Method for Cross-Discipline Few-Shot Class-Incremental Learning

HyCal:一种无需训练的跨学科少样本类增量学习原型校准方法

Eunju Lee, MiHyeon Kim, JuneHyoung Kwon, Yoonji Lee, JiHyun Kim, Soojin Jang, YoungBin Kim

机构 * Chung-Ang University(Chung-Ang 大学) KT Corporation(KT 公司) Dentium ETRI

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出HyCal方法,通过结合余弦相似度和马氏距离,解决跨学科少样本类增量学习中的领域引力问题,提升在不平衡数据下的性能。

Comments Accepted to CVPR 2026. Eunju Lee and MiHyeon Kim contributed equally as co-first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14920 2026-04-17 cs.AI 57%

Dual-Axis Generative Reward Model Toward Semantic and Turn-taking Robustness in Interactive Spoken Dialogue Models

双轴生成奖励模型:面向交互口语对话模型中语义和轮流鲁棒性的研究

Yifu Chen, Shengpeng Ji, Zhengqing Liu, Qian Chen, Wen Wang, Ziqing Wang, Yangzhuo Li, Tianle Liang, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tongyi Fun Team, Alibaba Group(通义Fun团队,阿里巴巴集团) Beijing University of Technology(北京理工大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出双轴生成奖励模型,通过详细分类和标注数据集理解复杂交互动态,提供语义质量和交互时间的独立评估,提升口语对话模型的鲁棒性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14227 2026-04-17 cs.IR cs.AI 57%

FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation

FRESCO:用于检索增强生成中动态语义冲突的重排序器基准测试与优化

Sohyun An, Hayeon Lee, Shuibenyang Yuan, Chun-cheng Jason Chen, Cho-Jui Hsieh, Vijai Mohan, Alexander Min

机构 * Meta Superintelligence Labs(Meta超智能实验室)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 FRESCO针对检索增强生成中动态语义冲突问题,评估重排序器在时间动态场景下的性能,发现现有重排序器对较旧文档存在偏见,通过指令优化框架改进了27%的动态知识任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13268 2026-04-16 cs.CV cs.CL cs.IR 57%

Indexing Multimodal Language Models for Large-scale Image Retrieval

多模态大语言模型的索引用于大规模图像检索

Bahey Tharwat, Giorgos Kordopatis-Zilos, Pavel Suma, Ian Reid, Giorgos Tolias

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) VRG, FEE, Czech Technical University in Prague(布拉格捷克技术大学VRG学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文探讨了多模态大语言模型作为无训练相似性估计器在实例级图像到图像检索中的应用,通过提示配对图像并转换下一个词的概率为相似性分数,实现了零样本重排序,展示了其在大规模检索中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12700 2026-04-15 cs.AI 57%

MISID: A Multimodal Multi-turn Dataset for Complex Intent Recognition in Strategic Deception Games

MISID:一种多模态多轮对话数据集,用于战略欺骗游戏中复杂意图识别

Shufang Lin, Muyang Chen, Xiabing Zhou, Rongrong Zhang, Dayou Zhang, Fangxin Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Capital Normal University(首都师范大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出MISID数据集,用于复杂战略欺骗游戏中多模态多轮对话的意图识别,通过系统评估发现现有多模态大语言模型在复杂场景中存在缺陷,并提出FRACTAM框架提升性能。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11144 2026-04-14 cs.CV cs.CL cs.MM 57%

Hierarchical Textual Knowledge for Enhanced Image Clustering

层次化文本知识用于增强图像聚类

Yijie Zhong, Yunfan Gao, Weipeng Jiang, Haofen Wang

机构 * Tongji University(同济大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出KEC方法,通过大语言模型构建层次化概念-属性知识,提升图像聚类的准确性与鲁棒性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03765 2026-04-14 cs.CV 57%

ITIScore: An Image-to-Text-to-Image Rating Framework for the Image Captioning Ability of MLLMs

ITIScore: 一种图像到文本到图像评分框架,用于评估多模态大语言模型的图像描述能力

Zitong Xu, Huiyu Duan, Shengyao Qin, Guangyu Yang, Guangji Ma, Xiongkuo Min, Ke Gu, Guangtao Zhai, Patrick Le Callet

机构 * Shanghai Jiao Tong University(上海交通大学) University of Electronic and Science Technology of China(电子科技大学) Beijing University of Technology(北京工业大学) Institut Universitaire de France (IUF), University of Nantes(法国大学研究院(IUF),南特大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出ICBenchmark图像描述基准,包含12类内容和2K图像生成的40K短长描述,提出ITIScore自动评估指标,通过图像到文本到图像框架衡量描述质量,实验显示其与人类判断一致且具有强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06846 2026-04-09 cs.CL cs.AI 57%

MedDialBench: Benchmarking LLM Diagnostic Robustness under Parametric Adversarial Patient Behaviors

MedDialBench:在参数对抗患者行为下评估LLM诊断鲁棒性的基准测试

Xiaotian Luo, Xun Jiang, Jiangcheng Wu

机构 * Shanda Group(盛大集团)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 MedDialBench通过控制患者行为维度,评估LLM在不同行为下的诊断鲁棒性,发现信息污染对准确率的影响大于信息缺失,且模型存在不同的脆弱性特征。

Comments 9 pages, 4 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06028 2026-04-08 cs.CL cs.AI cs.IR 57%

A Multi-Stage Validation Framework for Trustworthy Large-scale Clinical Information Extraction using Large Language Models

一种用于可信大规模临床信息提取的多阶段验证框架

Maria Mahbub, Gregory M. Dams, Josh Arnold, Caitlin Rizy, Sudarshan Srinivasan, Elliot M. Fielstein, Minu A. Aghevli, Kamonica L. Craig, Elizabeth M. Oliva, Joseph Erdos, Jodie Trafton, Ioana Danciu

机构 * Oak Ridge National Laboratory(橡树岭国家实验室) Program Evaluation and Resource Center, Office of Mental Health and Office of Suicide Prevention, Department of Veterans Affairs(退伍军人事务部心理健康办公室和自杀预防办公室项目评估与资源中心) Vanderbilt University Medical Center(范德比尔特大学医学中心) VA Maryland Health Care System(退伍军人事务部马里兰医疗保健系统) VA Desert Pacific Healthcare Network(退伍军人事务部沙漠太平洋医疗网络) VA Connecticut Health Care System(退伍军人事务部康涅狄格医疗保健系统) Yale School of Medicine(耶鲁医学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文提出多阶段验证框架,通过弱监督评估提升LLM在临床信息提取中的可信度与准确性,验证了在大规模数据中应用的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04869 2026-04-07 cs.LG 57%

Optimizing LLM Prompt Engineering with DSPy Based Declarative Learning

基于DSPy的声明式学习优化大语言模型提示工程

Shiek Ruksana, Sailesh Kiran Kurra, Thipparthi Sanjay Baradwaj

机构 * Vasavi College of Engineering(瓦萨维工程学院) Amazon(亚马逊) Texas(德克萨斯州)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 本文提出基于DSPy的声明式学习方法,通过符号规划、无梯度优化和自动模块重写提升提示优化的可靠性、效率和泛化能力,实验显示事实准确率提升30-45%,幻觉率降低25%。

Comments Best paper Award ,IEEE International Conference on Emerging Smart Computing and Informatics (ESCI) Pune, India. Mar 11-13, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12870 2026-04-07 cs.LG 57%

Physically Interpretable World Models via Weakly Supervised Representation Learning

通过弱监督表征学习实现物理可解释的世界模型

Zhenjiang Mao, Mrinall Eashaan Umasudhan, Ivan Ruchkin

机构 * University of Florida(佛罗里达大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 本文提出PIWM框架,通过弱监督学习实现物理可解释的世界模型,利用物理动态约束提升预测准确性与系统参数恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03045 2026-04-06 cs.CV cs.MM 57%

STEAR: Layer-Aware Spatiotemporal Evidence Intervention for Hallucination Mitigation in Video Large Language Models

STEAR:面向视频大语言模型的层感知时空证据干预以缓解幻觉

Linfeng Fan, Yuan Tian, Ziwei Li, Zhiwu Lu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV

AI总结 STEAR通过层感知的时空证据干预框架,缓解视频大语言模型中的空间和时间幻觉,提升解码的准确性与一致性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17714 2026-04-06 cs.AI 57%

From Virtual Environments to Real-World Trials: Emerging Trends in Autonomous Driving

从虚拟环境到现实世界试验:自动驾驶领域新兴趋势

A. Humnabadkar, A. Sikdar, B. Cave, H. Zhang, N. Bessis, A. Behera

机构 * Edge Hill University(埃奇希尔大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 本文综述了自动驾驶、模拟技术和合成数据集的最新发展,探讨了合成数据在感知与规划中的应用、数字孪生模拟系统验证以及领域适应策略,分析了基准设计趋势及关键挑战,旨在推动安全、可推广的自动驾驶系统发展。

Comments Accepted manuscript - Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21584 2026-04-06 cs.CV 57%

TARS: MinMax Token-Adaptive Preference Strategy for Hallucination Reduction in MLLMs

TARS:最小最大令牌自适应偏好策略用于减少多模态大语言模型中的幻觉

Kejia Zhang, Keda Tao, Zhiming Luo, Chang Liu, Jiasheng Tang, Huan Wang

机构 * Xiamen University(厦门大学) Westlake University(西湖大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) AWS AI Lab, Amazon(亚马逊AWS AI实验室) Hupan Laboratory(湖畔实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 TARS通过最小最大优化问题重构直接偏好优化,通过对抗性令牌扰动减少多模态大语言模型中的幻觉,通过频域对齐损失提升隐藏表征,优于标准DPO并超越数据增强方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21482 2026-04-01 cs.CV 57%

ALADIN:Attribute-Language Distillation Network for Person Re-Identification

ALADIN:基于属性-语言的知识蒸馏网络用于人重识别

Wang Zhou, Boran Duan, Haojun Ai, Ruiqi Lan, Ziyue Zhou

机构 * Wuhan University(武汉大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 ALADIN通过属性-语言知识蒸馏网络,提升人重识别中细粒度属性特征的捕捉能力,增强鲁棒性与泛化性。

Comments 14pages, 3figures, 7charts

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28597 2026-03-31 cs.LG 57%

Position: Explainable AI is Causality in Disguise

位置:可解释AI是伪装的因果性

Amir-Hossein Karimi

机构 * Department of Electrical \& Computer Engineering, University of Waterloo \& Vector Institute, Canada

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 本文指出可解释AI的核心问题在于缺乏因果模型的指导,通过将XAI问题转化为因果问题,强调因果模型对XAI的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28301 2026-03-31 cs.LG 57%

LIBERO-Para: A Diagnostic Benchmark and Metrics for Paraphrase Robustness in VLA Models

LIBERO-Para:一种用于视觉语言动作模型中同义词鲁棒性诊断的基准和指标

Chanyoung Kim, Minwoo Kim, Minseok Kang, Hyunwoo Kim, Dahuin Jung

机构 * Soongsil University(崇实大学) Chung-Ang University(中央大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 本文提出LIBERO-Para基准,通过独立变化动作表达和物体参考,分析语言泛化能力。研究发现,不同规模的VLA模型在同义词替换下性能下降22-52个百分点,主要由物体层面的词汇变化导致。提出PRIDE指标量化同义词难度,揭示模型对任务识别的依赖。

Comments 32 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26486 2026-03-30 cs.CV 57%

ClipTTT: CLIP-Guided Test-Time Training Helps LVLMs See Better

ClipTTT: CLIP引导的测试时间训练帮助LVLMs看得更清楚

Mriganka Nath, Anurag Das, Jiahao Xie, Bernt Schiele

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学研究所,萨尔兰信息学园区)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出ClipTTT方法,通过CLIP模型的图像-文本对齐能力,在测试时引导LVLMs适应退化条件,减少幻觉并提升描述准确性。

Comments 30 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25747 2026-03-30 cs.AI 57%

BeSafe-Bench: Unveiling Behavioral Safety Risks of Situated Agents in Functional Environments

BeSafe-Bench:揭示功能环境中情境代理的行为安全风险

Yuxuan Li, Yi Lin, Peng Wang, Shiming Liu, Xuetao Wei

机构 * Southern University of Science and Technology(南方科技大学) Huawei RAMS Lab(华为RAMS实验室)

专题命中 幻觉与鲁棒性 :VLM(abstract);分类 cs.AI

AI总结 本文提出BeSafe-Bench,通过构建功能环境和引入九类安全关键风险,评估代理在Web、Mobile、Embodied VLM和Embodied VLA等领域的行为安全风险,发现最佳性能代理在安全约束下完成任务的比例不足40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25039 2026-03-30 quant-ph cs.LG 57%

Uncertainty Quantification for Quantum Computing

量子计算中的不确定性量化

Ryan Bennink, Olena Burkovska, Konstantin Pieper, Jorge Ramirez, Elaine Wong

机构 * Oak Ridge National Laboratory(橡树岭国家实验室) Universidad Nacional de Colombia, Sede Medellin(哥伦比亚国立大学麦德林校区)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 本文通过不确定性量化方法,介绍量子计算中的噪声和随机性对计算结果的影响,探讨数学工具在误差传播和可靠性中的应用,以及其在可扩展算法和相关误差表征中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25711 2026-03-27 cs.CV 57%

Seeing to Ground: Visual Attention for Hallucination-Resilient MDLLMs

视觉注意:用于抗幻觉的MDLLMs

Vishal Narnaware, Animesh Gupta, Kevin Zhai, Zhenyi Wang, Mubarak Shah

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV

AI总结 本文提出VISAGE框架,通过校准解码器目标来减少多模态幻觉,通过空间熵分析提升视觉基础性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22013 2026-03-27 cs.CV 57%

RobustVisRAG: Causality-Aware Vision-Based Retrieval-Augmented Generation under Visual Degradations

RobustVisRAG: 基于因果性的视觉增强检索增强生成方法在视觉退化下的鲁棒性

I-Hsiang Chen, Yu-Wei Liu, Tse-Yu Wu, Yu-Chien Chiang, Jen-Chien Yang, Wei-Ting Chen

机构 * National Taiwan University(国立台湾大学) Microsoft(微软)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出RobustVisRAG,通过双路径框架分离语义与退化因素,提升在视觉退化下的检索生成性能,实验显示在真实退化条件下性能提升显著。

Comments Accepted by CVPR2026; Project Page: https://robustvisrag.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24653 2026-03-27 cs.CV 57%

From Weights to Concepts: Data-Free Interpretability of CLIP via Singular Vector Decomposition

从权重到概念:通过奇异向量分解实现CLIP的数据无关可解释性

Francesco Gentile, Nicola Dall'Asen, Francesco Tonini, Massimiliano Mancini, Lorenzo Vaquero, Elisa Ricci

机构 * University of Trento(特伦托大学) University of Pisa(比萨大学) Fondazione Bruno Kessler(布鲁诺·凯撒基金会)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SITH框架,通过奇异向量分解分析CLIP视觉Transformer的权重空间,利用COMP算法实现细粒度概念解释,提升模型可解释性和下游性能。

Comments Accepted @ CVPR 2026. Project page: https://frangente.github.io/SITH/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24218 2026-03-26 cs.IR cs.AI 57%

Who Benefits from RAG? The Role of Exposure, Utility and Attribution Bias

谁从RAG中受益?曝光、效用和归因偏差的作用

Mahdi Dehghan, Graham McDonald

机构 * University of Glasgow, Glasgow, UK(格拉斯哥大学,格拉斯哥,英国)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文研究RAG中查询组公平性的影响因素,发现RAG系统在不同组查询的平均准确率和改进上存在偏差,揭示了曝光、效用和归因对公平性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22070 2026-03-26 cs.CV 57%

Adapting Point Cloud Analysis via Multimodal Bayesian Distribution Learning

通过多模态贝叶斯分布学习适应点云分析

Xingyu Zhu, Liang Yi, Shuo Wang, Wenbo Zhu, Yonglinag Wu, Beier Zhu, Hanwang Zhang

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(脑信息处理实验室,中国科学技术大学) Opus AI Research(Opus AI研究院) Southeast University(东南大学) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出BayesMM框架,通过多模态贝叶斯分布学习实现测试时点云分析的持续适应,利用文本先验和流式视觉特征的高斯分布融合,提升在分布偏移下的鲁棒性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23909 2026-03-26 cs.AI 57%

DUPLEX: Agentic Dual-System Planning via LLM-Driven Information Extraction

DUPLEX:基于LLM驱动信息提取的代理双系统规划

Keru Hua, Ding Wang, Yaoying Gu, Xiaoguang Ma

机构 * Midea Corporate Research Center(美的集团研发中心) Midea Group(美的集团) Northeastern University(东北大学) Engineering Department(工程部)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 DUPLEX通过限制LLM进行结构化语义 grounding,结合符号规划器实现可靠规划,优于现有端到端和混合LLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13528 2026-03-26 cs.RO cs.CV 57%

Learning Actionable Manipulation Recovery via Counterfactual Failure Synthesis

通过反事实失败合成学习可操作的操纵恢复

Dayou Li, Jiuzhou Lei, Hao Wang, Lulin Liu, Yunhao Yang, Zihan Wang, Bangya Liu, Minghui Zheng, Zhiwen Fan

机构 * Texas A&M University(德克萨斯A&M大学) University of Minnesota(明尼苏达大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Abaka AI(Abaka人工智能) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出Dream2Fix框架,通过生成反事实失败场景数据提升机器人故障恢复能力,实现高精度的故障诊断与轨迹修正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15253 2026-03-25 cs.CV 57%

HalDec-Bench: Benchmarking Hallucination Detector in Image Captioning

HalDec-Bench:图像描述中幻觉检测的基准测试

Kuniaki Saito, Risa Shinoda, Shohei Tanaka, Tosho Hirasawa, Fumio Okura, Yoshitaka Ushiku

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出HalDec-Bench,用于评估图像描述中幻觉检测的性能,通过多样化模型生成的描述和人工标注揭示了模型在不同难度任务中的表现差异,并发现检测器倾向于认为响应开头的句子正确。

Comments This work was intended as a replacement of arXiv:2511.20515 and any subsequent updates will appear there

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20515 2026-03-25 cs.CV 57%

HalDec-Bench: Benchmarking Hallucination Detector in Image Captioning

HalDec-Bench:图像描述中幻觉检测的基准测试

Kuniaki Saito, Risa Shinoda, Shohei Tanaka, Tosho Hirasawa, Fumio Okura, Yoshitaka Ushiku

机构 * OMRON SINICX The University of Tokyo(东京大学) The University of Osaka(大阪大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出HalDec-Bench,用于评估图像描述中幻觉检测的性能,通过多样化VLM生成的描述和人类标注揭示模型差异,发现检测器倾向于认可响应开头的句子,并通过强VLM过滤减少数据噪声。

Comments Previously this version appeared as arXiv:2603.15253 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏