NoiseBoost: Alleviating Hallucination with Noise Perturbation for Multimodal Large Language Models
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI
Comments 14 pages, 5 figures with supplementary material
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI
Comments 14 pages, 5 figures with supplementary material
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG
Comments Accepted to CVPR2024
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI
Comments Accepted to CVPR 2024. arXiv admin note: text overlap with arXiv:2310.02988
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG
Comments Accepted by ICLR 2024
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI
Comments 7 pages, 7 figures
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG
Comments Accepted at NeurIPS 2023 Datasets and Benchmarks Track; 9 pages, 5 figures
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG
专题命中 幻觉与鲁棒性 :vision language model(title,abstract);分类 cs.CV、cs.LG
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG
Comments 17 pages, 4 figures, 7 tables. For code and trained token embeddings, see https://github.com/oxai/debias-vision-lang; Changed to use ACL layout, added joint training with comparison figure, corrected spelling and formatting errors; This paper is accepted for publication at AACL 2022, the official version of record is in the ACL Anthology
专题命中 幻觉与鲁棒性 :grounding(title,abstract);分类 cs.CV、cs.AI
Comments Accepted by CVPR 2021
视觉语言模型(VLMs)在失明或被误导时的表现如何?针对科学图表的VLMs行为评估
机构 * University of Aberdeen(阿伯丁大学) ; International Institute of Information Technology Hyderabad(海德拉巴国际信息技术学院) ; University of Technology Nuremberg(纽伦堡工业大学) ; University of Southern California(南加利福尼亚大学)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本研究构建科学图表理解基准SciFigBench,提出A-R-I框架评估VLMs在视觉证据缺失或误导时的行为可靠性,发现高感知与推理准确性不代表行为可靠,不同模型表现存在显著差异。
Comments 25 pages including appendix. Project website: https://scifigbench.nlp4sci.com
FabriVLA:用于精确多任务操作的轻量级视觉-语言-动作模型
专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract)
AI总结 研究提出FabriVLA模型,结合视觉-语言主干与流匹配动作头,经单阶段联合优化训练。在Meta-World MT50基准测试中,该模型基于1B规模VLM,不依赖数十亿参数主干,实现90.0%平均成功率,展现强大性能。
利用文本拒绝方向实现多模态安全
机构 * University of Trento(特伦托大学)
专题命中 幻觉与鲁棒性 :MLLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 提出MARS方法,通过从LLM骨干提取的文本拒绝方向泛化到多模态,无需多模态安全数据即可提升安全性,在五个先进MLLM上验证了有效性。
Comments Preprint
超越模板:通过元提示重新审视零样本遥感
机构 * Remote Sensing Lab, National Technical University of Athens(遥感实验室,国家技术大学雅典分校) ; Remote Sensing Lab, Department of Engineering and Sciences, National Technical University of Athens(遥感实验室,工程与科学系,国家技术大学雅典分校) ; Universitas Mercatorum(默卡托大学)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 研究通过元提示框架(MPVR)在17种视觉语言模型和12个遥感数据集上探索零样本性能,发现语义丰富的LLM生成描述可能引入噪声,而轻量级查询嵌入校准能稳定提升分类和检索性能。
当提示误导:多模态大语言模型中的文本主导与诊断偏差
专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract)
AI总结 研究揭示在医学多模态大语言模型中,文本提示会主导视觉线索,导致诊断偏差,即使模型具备空间定位能力,提示策略仍可能不安全。
Comments Accepted to the CVPR 2026 MMFM-BIOMED Workshop
面向人机装配遥操作的不确定性感知意图预测
机构 * University of California, Riverside(加州大学河滨分校) ; University of Miami(迈阿密大学)
专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract)
AI总结 提出结合层次迁移学习、共形预测和VLM引导校正的不确定性感知意图预测框架,利用人类演示数据预训练,仅用少量机器人数据即提升动作分割性能。
Comments 7 pages, 6 figures. Preprint version
视觉与语言:新颖的表示方法和人工智能用于驾驶场景安全评估与自动驾驶规划
专题命中 幻觉与鲁棒性 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文研究了视觉-语言表示在自动驾驶安全评估和规划中的应用,提出轻量级危险检测、轨迹规划框架整合及自然语言约束方法,强调表示-任务对齐的重要性。
CADRE:具有有界遗忘和先验漂移的稳定、参数高效的医学视觉语言模型适应
机构 * Mindriser's Consortium, Kathmandu, Nepal(Mindriser's 联盟,加德满都,尼泊尔) ; University of Victoria, BC, Canada(维多利亚大学,不列颠哥伦比亚省,加拿大)
专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);分类 cs.AI
AI总结 提出CADRE框架,通过结合低秩适应与弹性权重巩固及先验锚定惩罚,在仅训练0.23%参数下实现医学视觉语言模型的高精度、低遗忘和正向反向迁移,遗忘率降低约七倍。
基于视觉语言模型的不确定性感知艺术史年代测定
机构 * Marburg University(马尔堡大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
AI总结 该研究针对艺术品年代测定中的时间纠缠问题,将其转化为不确定性感知回归任务,通过在Wikidata艺术品语料库上实验发现视觉语言模型(VLMs)在该任务上优于纯视觉自监督基线,但存在偏差。
你即你所提示的:农业食品视觉语言模型中的提示质量、领域偏移与不确定性
机构 * University of Granada(格拉纳达大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.LG
AI总结 该研究针对农业食品领域,评估了零样本提示集成(ZPE)在分布内与分布外场景的表现,提出PID方法提升严重领域偏移下的故障检测能力,验证了领域特定提示池的优势。
Comments Accepted in the journal Procesamiento del Lenguaje Natural (SEPLN2026)
手术内窥镜视频的时间视觉语言模型的鲁棒性研究
机构 * Indian Institute of Technology Delhi(印度理工学院德里分校) ; Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) ; Birmingham City University(伯明翰城市大学) ; University Hospitals Birmingham(伯明翰大学医院) ; Khalifa University(哈利法大学) ; German Cancer Research Center (DKFZ)(德国癌症研究中心)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
AI总结 该研究针对手术内窥镜视频的时间视觉语言模型,构建Endo-C6基准测试其鲁棒性,提出RobustEndoCLIP,可提升模型在内窥镜损坏下的性能与鲁棒性。
Comments Accepted to MICCAI 2026
大型视觉语言模型的测试时幻觉控制
机构 * Australian National University(澳大利亚国立大学) ; The University of New South Wales(新南威尔士大学) ; University of Technology Sydney(悉尼科技大学) ; York University(约克大学) ; Lancaster University(兰卡斯特大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
AI总结 针对大型视觉语言模型的物体幻觉问题,提出无训练的测试时幻觉缓解(TTH)方法,通过令牌验证器模块等技术提升模型准确性与稳健性,通用性和实用性良好。
Comments Accepted at ECCV 2026 MUCG
PRMU:面向多模态大语言模型中以人为中心的知识遗忘的无语料基准
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV
AI总结 针对现有多模态大语言模型(MLLMs)遗忘方法依赖语料的局限,提出无语料基准PRMU及基线SGPE,实验显示SGPE在目标遗忘、局部性保留等方面权衡更优。
超越虚假稳定性:面向视觉语言模型测试时对抗防御的高噪声漂移门控
机构 * Mohamed Bin Zayed University of AI, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋) ; Khalifa University, UAE(卡布斯大学,阿联酋) ; Australian National University, Australia(澳大利亚国立大学,澳大利亚)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
AI总结 针对视觉语言模型在测试时易受对抗攻击的问题,提出一种无训练、即插即用的高噪声漂移门控机制,通过检测高噪声下的特征不稳定性触发防御,改善了干净-鲁棒性权衡。
Journal ref The 37th British Machine Vision Conference (BMVC) 2026
重视零样本不确定性:面向测试时自适应视觉-语言模型的保守校准
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
AI总结 针对测试时自适应(TTA)视觉-语言模型校准度下降的问题,提出零样本锚定熵校准(ZAEC)方法,通过最小温度缩放恢复锐化预测的零样本熵,在多模型多数据集上实现了更低的期望校准误差(ECE)。