Training-Free VLM Personalization via Calibrated Residual Decoding
基于校准残差解码的无训练VLM个性化方法
专题命中 幻觉与鲁棒性 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出无训练校准残差解码框架,通过构建三类证据条件估计个性化边际贡献,经实验在多数据集上提升了VLM的个性化多模态理解性能。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
基于校准残差解码的无训练VLM个性化方法
专题命中 幻觉与鲁棒性 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出无训练校准残差解码框架,通过构建三类证据条件估计个性化边际贡献,经实验在多数据集上提升了VLM的个性化多模态理解性能。
EviSafe:基于证据的视觉语言模型安全性评估
机构 * Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系)
专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(abstract);分类 cs.AI
AI总结 本研究提出基于证据的VLM安全性评估框架EviSafe及对应基准EviSafeBench,通过三探针协议评估11个VLMs,发现其未因正确多模态原因可靠安全,需开展超越拒绝次数的评估。
扰动思路而非像素:用于视觉语言模型强化学习的潜在空间展开多样化
机构 * Amazon Web Services(亚马逊网络服务)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.CV
AI总结 该研究提出 NC-GRPO 方法,通过在 VLM 潜在空间注入噪声实现展开多样化,提升了其数学推理与幻觉鲁棒性,且仅需少量代码修改即可整合进 RLVR 流程。
HiViS: 为视觉语言模型中的推测解码隐藏视觉标记
机构 * C 2 DL, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; AIRIA ; City University of Hong Kong(香港城市大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 HiViS通过隐藏视觉标记,提升视觉语言模型在推测解码中的生成效率和速度。
Comments CVPR 2026 Findings
用于轮式人形机器人运动操作的多阶段物体参数估计的全身双边遥操作
专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(abstract)
AI总结 该研究提出结合多阶段物体惯性参数估计的轮式人形机器人全身双边遥操作框架,通过视觉、VLM与分层采样实现参数估计,提升遥操作的动态性与操作跟踪精度,可实时完成约1/3体重载荷的相关任务。
面向多模态大语言模型的可迁移越狱攻击的文本锚定语义扰动
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Pengcheng Laboratory(鹏城实验室) ; Pazhou Laboratory (Huangpu)(琶洲实验室(黄埔))
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract)
AI总结 本研究针对多模态大语言模型易受越狱攻击的问题,提出TA-SPA黑盒越狱框架,通过文本锚定语义分解与语义保留增强实现可迁移攻击,在商业模型及防御下表现出竞争力,推动表征级安全对齐研究。
Comments Accept by EMNLP 2026 Findings
基于反事实集成解码缓解大视觉语言模型中的偏差
机构 * State Key Lab of Software Development Environment, Beihang University(北京航空航天大学软件开发环境国家重点实验室)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.AI
AI总结 该研究针对大视觉语言模型的社会偏差问题,提出反事实集成解码框架,通过构建多群体反事实视角并集成解码,在三类基准上实现最高47.97%的偏差降低,同时保留模型核心能力。
锚定偏差:一种针对持续学习下多模态大语言模型(MLLMs)的持久公平性后门攻击
机构 * Emory University(埃默里大学)
专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI、cs.LG
AI总结 针对持续学习下的多模态大语言模型,研究人员提出持久公平性后门攻击,通过两种机制注入持久群体歧视,该攻击能规避标准防御且在多轮持续学习中留存。
Comments CIKM 2026
EG-ARSA:适用于低资源场景的基于专家知识的开放视觉道路安全审计模型
机构 * Bangladesh University of Engineering and Technology (BUET)(孟加拉工程技术大学(BUET))
专题命中 幻觉与鲁棒性 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 针对中低收入国家道路安全审计的资源限制,提出EGD框架,构建BD-ARSA数据集和EG-ARSA模型,实验显示其性能优于310亿参数教师模型及Gemini-2.5-Flash,为低资源场景道路安全审计提供有效方案。
在域转移下对用于乳腺钼靶成像的基础模型的稳健性进行基准测试
机构 * College of Engineering and Computer Science, VinUniversity(工程与计算机科学学院,文大大学) ; Imperial College London(伦敦帝国理工学院) ; Radiology Department, Vietnam National Cancer Hospital(越南国家癌症医院放射科) ; VinUni-Illinois Smart Health Center, VinUniversity(文大大学 - 伊利诺伊智能健康中心,文大大学) ; The Computer Vision and Medical AI Lab, VinUniversity(计算机视觉与医学人工智能实验室,文大大学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究在域转移下乳腺钼靶成像基础模型的稳健性,用统一协议在多数据集上训练评估15种模型主干,发现特定视觉语言模型性能强,DINOv3是有竞争力基线,适应预训练未持续提升泛化,强调数据集级OOD评估是核心标准。
Comments Accepted at Deep-Brea3th 2026 workshop in conjunction with MICCAI 2026
评估针对大语言模型生成代码中包幻觉的推理时防御措施
专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI
AI总结 本文针对LLM生成代码的包幻觉问题,修正了评估方法,评估了七种推理时防御措施,提出包效用指标,发现对抗提示下RAG与Self-Refine表现更优,明确防御需匹配威胁模型与效用。
Comments Accepted ASE 2026
LiST:局部单纯形测试时LoRA融合
机构 * SUSTech(南方科技大学) ; PolyU(香港理工大学) ; CASIA(中国科学院自动化研究所) ; GDUT(广东工业大学) ; CityU(香港城市大学) ; BigAI(北京智源人工智能研究院) ; THU(清华大学) ; TAU(特拉维夫大学) ; PKU(北京大学) ; UniTrento(特伦托大学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV
AI总结 LiST是一种无标签测试时LoRA融合框架,通过构建局部单纯形搜索样本特定融合权重,在多模态与语言基准上优于静态LoRA合并及传统测试时自适应方法,提升了未见过任务的鲁棒性。
Comments Accepted by EMNLP 2026 Finding
GuardianBench:面向具身智能中潜在上下文风险的同场景指令对比基准
机构 * Shandong University(山东大学) ; National University of Singapore(新加坡国立大学) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Xiaomi Corporation(小米公司)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI
AI总结 该研究提出基于国际安全标准的同场景指令对比基准GuardianBench,发现VLMs对指令不敏感,用轻量级目标VLOS可提升其安全推理性能。
Comments 21 pages, 4 figures
DamageScope:面向卫星图像灾害损失评估的大规模视觉-语言检索方法
机构 * NEC Laboratories America(美国 NEC 实验室)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV
AI总结 DamageScope是一种结合VLMs与LLMs的检索增强框架,通过多向量嵌入聚类和双存储架构,实现了卫星图像灾害损失评估的高效自动化,可扩展性与运营效率优异。
最后但同样重要:用于多模态KV缓存压缩的边界注意力校准
机构 * KAIST(韩国科学技术院) ; Zhejiang Laboratory(之江实验室) ; The Chinese University of Hong Kong(香港中文大学) ; National University of Singapore(新加坡国立大学)
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV
AI总结 针对多模态大语言模型长视觉上下文中KV缓存压缩导致关键证据丢失的问题,提出BACON方法,通过校准观察窗口注意力与最后查询注意力,并利用层内一致性和层间持久性抑制噪声,在激进压缩下平均提升7.5%性能。
Comments EMNLP 2026 Main Conference
上下文感知集群解码:dMLLMs中的语义锚驱动连贯性
机构 * Sun Yat-sen University(中山大学) ; Shanghai Jiao Tong University(上海交通大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Alibaba Group(阿里巴巴集团) ; Shanghai University(上海大学)
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract)
AI总结 针对 dMLLMs 生成长文本时的语义漂移与重复问题,提出上下文感知集群解码方法,结合置信度与邻域邻近度评分,在多模型多基准上实现质量提升并减少幻觉。
Comments This paper is accepted by EMNLP 2026. 19 pages, 12 figures, 13 tables