GPT4Video: A Unified Multimodal Large Language Model for lnstruction-Followed Understanding and Safety-Aware Generation
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
Comments ACM MM 2024, Oral
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
Comments ACM MM 2024, Oral
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments Accepted to MICCAI 2024
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI
Comments 14 pages, 5 figures
专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV
Comments Accepted at ECCV 2024. [Project Pages] https://beafbench.github.io/
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV
Comments Supervised by Professor Ben Glocker
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
Comments Accepted at IJCAI2024
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
专题命中 幻觉与鲁棒性 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI
专题命中 幻觉与鲁棒性 :vision language model(title,abstract);VLM(abstract);分类 cs.CV
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
专题命中 幻觉与鲁棒性 :multimodal large language model(title);LLaVA(abstract);MLLM(abstract);分类 cs.CV
专题命中 幻觉与鲁棒性 :visual language model(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
Comments 39 pages, 26 figures
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments Accepted at ACM Multimedia (ACMMM) 2023
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI
Comments Published at BioNLP workshop @ ACL 2023
HoloCount:用于多模态大语言模型的整体视觉计数基准
机构 * Meituan(美团)
专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 研究针对多模态大语言模型定量精度瓶颈及现有计数基准局限,引入HoloCount基准,从语义、分析计数和鲁棒性测试三方面评估模型,经对20多个模型详尽评估,揭示其性能差距,为多模态系统发展提供路线图。
Comments Technical report
EgoSafetyBench:用于评估具身VLM作为运行时安全卫士的诊断性自我中心视频基准
机构 * AIM Intelligence(AIM智能研究所) ; Seoul National University(首尔国立大学)
专题命中 幻觉与鲁棒性 :VLM(title_cn,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出EgoSafetyBench,一个包含1200个机器人视角场景的自我中心视频基准,用于评估视觉语言模型在流式安全监控中的能力,通过情景和视觉通道两个轨道测试模型识别危险和应对误导性文本的鲁棒性。
CoMet:多模态不确定性估计的上下文与多样性分解
机构 * Princeton University(普林斯顿大学)
专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
AI总结 提出CoMet方法,将多模态大模型的不确定性分解为上下文项和多样性项,通过轻量级后验模块高效估计,无需自回归生成或重复采样,在多个基准上优于现有方法。
Comments 33 pages, 13.3MB
揭示视觉语言模型的可解释性故障模式
机构 * UIUC(伊利诺伊大学香槟分校) ; Kumo AI ; IIT Delhi(德里印度理工学院)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文提出REVELIO框架,通过系统性探索揭示VLMs在自动驾驶和室内机器人领域中的可解释性故障模式,发现模型在空间定位和安全威胁识别上的缺陷。
过度自信与校准在医学视觉问答中的研究:实证发现与幻觉意识缓解
机构 * Johns Hopkins University, School of Medicine(约翰霍普金斯大学医学院) ; Massachusetts Institute of Technology(麻省理工学院) ; Microsoft Healthcare & Life Sciences(微软医疗健康与生命科学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);LLaVA(abstract);visual question answering(abstract)
AI总结 本文研究了医学VQA中VLMs的过度自信问题,发现校准方法如Platt缩放能有效提升校准精度,但无法提升预测区分度,提出幻觉意识校准方法以提高可靠性。
通过层间一致性聚合缓解大型视觉-语言模型中的幻觉
机构 * Peking University(北京大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学) ; Virginia Tech(弗吉尼亚理工大学) ; University of Electronic Science and Technology of China(电子科技大学) ; De Artificial Intelligence Lab(人工智能实验室)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出训练无关的解码方法DCLA,通过聚合前层表示构建动态语义参考并纠正语义偏差层,增强层间一致性,在多个LVLM和基准上显著降低幻觉。
密度脊选择性预测:校准标签稀缺下的大语言模型与视觉语言模型幻觉检测
机构 * Northeastern University Boston, United States(东北大学波士顿分校)
专题命中 幻觉与鲁棒性 :VLM(title);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 针对校准标签稀缺时大语言模型和视觉语言模型的幻觉检测问题,提出基于核密度估计的密度脊方法,利用隐藏状态生成轨迹的六维运动特征图构建响应流形,通过到最近脊顶点的欧氏距离评分,在标签稀缺协议下AUROC提升5-20点。
视觉语言模型是否像我们一样看待矮星系?
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract_cn)
AI总结 评估视觉语言模型在识别超暗矮星系候选体任务中的表现,发现零样本模型能复现人类整体校准,但在个体层面存在显著差异,且不确定性估计不可靠。
Comments 8 pages, 4 figures; Accepted at the Conference on Physics and AI at Stanford University (PAI 2026)
P²-DPO:通过校准直接偏好优化在感知处理中锚定幻觉
机构 * Guangdong Provincial Key Laboratory of Computational AI Models and Cognitive Intelligence, School of Computer Science & Engineering, South China University of Technology(广东省计算人工智能模型与认知智能重点实验室,计算机科学与工程学院,华南理工大学) ; Pazhou Lab, Guangzhou, China(琶洲实验室,广州,中国) ; Engineering Research Center of the Ministry of Education on Health Intelligent Perception and Paralleled Digital-Human, Guangzhou, China(教育部健康智能感知与并行数字人工程研究中心,广州,中国)
专题命中 幻觉与鲁棒性 :grounding(title);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 针对大型视觉语言模型中的幻觉问题,提出P²-DPO训练范式,通过模型自生成偏好对和校准损失,直接优化感知瓶颈和视觉鲁棒性,无需昂贵人工反馈。
风险感知的选择性提示用于大型视觉-语言模型中的幻觉缓解
机构 * Shanghai Jiao Tong University(上海交通大学) ; iFLYTEK ; Tsinghua University(清华大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);grounding(abstract)
AI总结 本文系统研究提示验证在大型视觉-语言模型中的风险,发现其效果依赖输入难度,并提出基于预生成不确定性信号的选择性提示方法RSP以平衡性能。
Comments 7 pages, 1 figures, submitted to ACL ARR 2026 May (EMNLP)
通过区域感知注意力重校准减轻视觉语言模型中的对象幻觉
机构 * Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院)) ; China Telecom Digital Intelligence Technology Co, Ltd(中国电信数字智能技术有限公司) ; Shenyang Aerospace University(沈阳航空航天大学) ; Qilu Institute of Technology(齐鲁理工学院)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出一种无需训练的区域感知自适应加权机制,通过计算注意力头的稳健统计中点并利用跨头分歧动态调整干预预算,以连续惩罚调制抑制幻觉路径,有效纠正视觉语义错位,同时保持生成流畅性。
VIGNETTE:面向视觉语言模型的社会性偏见评估
机构 * George Mason University(乔治·马歇尔大学) ; University of Washington(华盛顿大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract)
AI总结 本文提出VIGNETTE基准,通过多方向问题回答框架评估视觉语言模型的偏见,揭示模型在身份识别中的刻板印象和歧视性模式。
Comments Accepted to ACL 2026