arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-25 至 2026-08-25 共收录 16 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 16 篇

2608.22263 2026-08-25 cs.CV cs.AI 新提交 90%

Training-Free VLM Personalization via Calibrated Residual Decoding

基于校准残差解码的无训练VLM个性化方法

Jiaao Yu, Yujian Ma, Xianming Hu, Pengran Wang, Ang Li

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出无训练校准残差解码框架,通过构建三类证据条件估计个性化边际贡献,经实验在多数据集上提升了VLM的个性化多模态理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23313 2026-08-25 cs.AI 新提交 90%

EviSafe: Evidence-Grounded Safety Evaluation for Vision-Language Models

EviSafe:基于证据的视觉语言模型安全性评估

Xuetong Li, Gaofeng Liu

机构 * Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(abstract);分类 cs.AI

AI总结 本研究提出基于证据的VLM安全性评估框架EviSafe及对应基准EviSafeBench,通过三探针协议评估11个VLMs,发现其未因正确多模态原因可靠安全,需开展超越拒绝次数的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21595 2026-08-25 cs.CV 新提交 87%

Perturb the Thought, Not the Pixels: Latent-Space Rollout Diversification for Reinforcement Learning of Vision-Language Models

扰动思路而非像素:用于视觉语言模型强化学习的潜在空间展开多样化

Michael Jerge, Joseph Pelczar, Justin Downes

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 该研究提出 NC-GRPO 方法,通过在 VLM 潜在空间注入噪声实现展开多样化,提升了其数学推理与幻觉鲁棒性,且仅需少量代码修改即可整合进 RLVR 流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23928 2026-08-25 cs.LG cs.AI 版本更新 86%

HiViS: Hiding Visual Tokens from the Drafter for Speculative Decoding in Vision-Language Models

HiViS: 为视觉语言模型中的推测解码隐藏视觉标记

Zhinan Xie, Peisong Wang, Shuang Qiu, Jian Cheng

机构 * C 2 DL, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) AIRIA City University of Hong Kong(香港城市大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 HiViS通过隐藏视觉标记,提升视觉语言模型在推测解码中的生成效率和速度。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09846 2026-08-25 cs.RO 版本更新 83%

Whole-Body Bilateral Teleoperation with Multi-Stage Object Parameter Estimation for Wheeled Humanoid Locomanipulation

用于轮式人形机器人运动操作的多阶段物体参数估计的全身双边遥操作

Donghoon Baek, Amartya Purushottam, Jason J. Choi, Joao Ramos

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 该研究提出结合多阶段物体惯性参数估计的轮式人形机器人全身双边遥操作框架,通过视觉、VLM与分层采样实现参数估计,提升遥操作的动态性与操作跟踪精度,可实时完成约1/3体重载荷的相关任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22312 2026-08-25 cs.CL 新提交 82%

Text-Anchored Semantic Perturbations for Transferable Jailbreak Attacks on Multimodal Large Language Models

面向多模态大语言模型的可迁移越狱攻击的文本锚定语义扰动

Wenyun Li, Guiping Cao, Xiangyuan Lan, Zheng Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) Pazhou Laboratory (Huangpu)(琶洲实验室(黄埔))

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract)

AI总结 本研究针对多模态大语言模型易受越狱攻击的问题,提出TA-SPA黑盒越狱框架,通过文本锚定语义分解与语义保留增强实现可迁移攻击,在商业模型及防御下表现出竞争力,推动表征级安全对齐研究。

Comments Accept by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21415 2026-08-25 cs.CL cs.AI 新提交 79%

Mitigating Bias in Large Vision-Language Models via Counterfactual Ensemble Decoding

基于反事实集成解码缓解大视觉语言模型中的偏差

Yisong Xiao, Aishan Liu, Yongxin Huang, Zonghao Ying, Shiji Zhao, Tianlin Li, Yong Han, Jian Yang, Xianglong Liu

机构 * State Key Lab of Software Development Environment, Beihang University(北京航空航天大学软件开发环境国家重点实验室)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.AI

AI总结 该研究针对大视觉语言模型的社会偏差问题,提出反事实集成解码框架,通过构建多群体反事实视角并集成解码,在三类基准上实现最高47.97%的偏差降低,同时保留模型核心能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21577 2026-08-25 cs.LG cs.AI 新提交 79%

Anchoring Bias: A Persistent Fairness Backdoor Attack against MLLMs under Continual Learning

锚定偏差:一种针对持续学习下多模态大语言模型(MLLMs)的持久公平性后门攻击

Yuyang Luo, Kai Shu

机构 * Emory University(埃默里大学)

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 针对持续学习下的多模态大语言模型,研究人员提出持久公平性后门攻击,通过两种机制注入持久群体歧视,该攻击能规避标准防御且在多轮持续学习中留存。

Comments CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23563 2026-08-25 cs.CV cs.AI 新提交 73%

EG-ARSA: An Expert-Grounded Open Model for Visual Road Safety Auditing in Low-Resource Settings

EG-ARSA:适用于低资源场景的基于专家知识的开放视觉道路安全审计模型

Md Thamed Bin Zaman Chowdhury, Moazzem Hossain

机构 * Bangladesh University of Engineering and Technology (BUET)(孟加拉工程技术大学(BUET))

专题命中 幻觉与鲁棒性 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 针对中低收入国家道路安全审计的资源限制,提出EGD框架,构建BD-ARSA数据集和EG-ARSA模型,实验显示其性能优于310亿参数教师模型及Gemini-2.5-Flash,为低资源场景道路安全审计提供有效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10358 2026-08-25 cs.CV cs.AI 版本更新 62%

Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift

在域转移下对用于乳腺钼靶成像的基础模型的稳健性进行基准测试

Giang Nguyen, Raghav Mehta, Emma A.M. Stanley, Tian Xia, Thi Hao Nguyen, Hieu Pham, Ben Glocker

机构 * College of Engineering and Computer Science, VinUniversity(工程与计算机科学学院,文大大学) Imperial College London(伦敦帝国理工学院) Radiology Department, Vietnam National Cancer Hospital(越南国家癌症医院放射科) VinUni-Illinois Smart Health Center, VinUniversity(文大大学 - 伊利诺伊智能健康中心,文大大学) The Computer Vision and Medical AI Lab, VinUniversity(计算机视觉与医学人工智能实验室,文大大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究在域转移下乳腺钼靶成像基础模型的稳健性,用统一协议在多数据集上训练评估15种模型主干,发现特定视觉语言模型性能强,DINOv3是有竞争力基线,适应预训练未持续提升泛化,强调数据集级OOD评估是核心标准。

Comments Accepted at Deep-Brea3th 2026 workshop in conjunction with MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22652 2026-08-25 cs.SE cs.AI 新提交 57%

Evaluating Inference-Time Defenses Against Package Hallucination in LLM-Generated Code

评估针对大语言模型生成代码中包幻觉的推理时防御措施

Alberick Euraste Djire, Iyiola E. Olatunji, Melissa Tessa, Earl T. Barr, Jacques Klein, Tegawendé F. Bissyandé

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文针对LLM生成代码的包幻觉问题,修正了评估方法,评估了七种推理时防御措施,提出包效用指标,发现对抗提示下RAG与Self-Refine表现更优,明确防御需匹配威胁模型与效用。

Comments Accepted ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22370 2026-08-25 cs.CV 新提交 57%

LiST: Local-Simplex Test-Time LoRA Fusion

LiST:局部单纯形测试时LoRA融合

Yihua Shao, Jia Li, Siyu Chen, Xinyu Luo, Yang Liu, Kecheng Chen, Xinwei Long, Lingyu Zhu, Fanhu Zeng, Maolin Wang, Ziyang Yan, Jingcai Guo, Hao Tang, Nicu Sebe, Zhenyi Wang

机构 * SUSTech(南方科技大学) PolyU(香港理工大学) CASIA(中国科学院自动化研究所) GDUT(广东工业大学) CityU(香港城市大学) BigAI(北京智源人工智能研究院) THU(清华大学) TAU(特拉维夫大学) PKU(北京大学) UniTrento(特伦托大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 LiST是一种无标签测试时LoRA融合框架,通过构建局部单纯形搜索样本特定融合权重,在多模态与语言基准上优于静态LoRA合并及传统测试时自适应方法,提升了未见过任务的鲁棒性。

Comments Accepted by EMNLP 2026 Finding

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21928 2026-08-25 cs.AI cs.CL cs.RO 新提交 57%

GuardianBench: A Same-Scene Instruction-Contrastive Benchmark for Latent Contextual Risk in Embodied AI

GuardianBench:面向具身智能中潜在上下文风险的同场景指令对比基准

Zhesheng Zhang, Jiahao Lu, Wei Liu, Cong Pan, Jianhua Yang, Yixiang Chen, Hongyuan Yu, Mengqi Zhang, Kailin Lyu, Zhumin Chen, Keji He

机构 * Shandong University(山东大学) National University of Singapore(新加坡国立大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Xiaomi Corporation(小米公司)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 该研究提出基于国际安全标准的同场景指令对比基准GuardianBench,发现VLMs对指令不敏感,用轻量级目标VLOS可提升其安全推理性能。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21529 2026-08-25 cs.CV cs.CL cs.IR 新提交 57%

DamageScope: Vision-Language Retrieval at Scale for Disaster Damage Assessment from Satellite Imagery

DamageScope:面向卫星图像灾害损失评估的大规模视觉-语言检索方法

Ravi K. Rajendran, Biplob Debnath, Murugan Sankaradas, Srimat T. Chakradhar

机构 * NEC Laboratories America(美国 NEC 实验室)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 DamageScope是一种结合VLMs与LLMs的检索增强框架,通过多向量嵌入聚类和双存储架构,实现了卫星图像灾害损失评估的高效自动化,可扩展性与运营效率优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14782 2026-08-25 cs.CV cs.CL 版本更新 57%

Last But Not Least: Boundary Attention CalibratiON for Multimodal KV Cache Compression

最后但同样重要:用于多模态KV缓存压缩的边界注意力校准

Tianhao Chen, Yuheng Wu, Kelu Yao, Xiaogang Xu, Xiaobin Hu, Dongman Lee

机构 * KAIST(韩国科学技术院) Zhejiang Laboratory(之江实验室) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 针对多模态大语言模型长视觉上下文中KV缓存压缩导致关键证据丢失的问题,提出BACON方法,通过校准观察窗口注意力与最后查询注意力,并利用层内一致性和层间持久性抑制噪声,在激进压缩下平均提升7.5%性能。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22367 2026-08-25 cs.CL 新提交 50%

Context-Aware Cluster Decoding: Semantic Anchor-Driven Coherence in dMLLMs

上下文感知集群解码:dMLLMs中的语义锚驱动连贯性

Yikai Zhao, Qiyan Zhao, Jiaquan Zhang, Xiaofeng Zhang, Xiaosong Yuan, Pengzhou Cheng

机构 * Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) University of Electronic Science and Technology of China(电子科技大学) Alibaba Group(阿里巴巴集团) Shanghai University(上海大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract)

AI总结 针对 dMLLMs 生成长文本时的语义漂移与重复问题,提出上下文感知集群解码方法,结合置信度与邻域邻近度评分,在多模型多基准上实现质量提升并减少幻觉。

Comments This paper is accepted by EMNLP 2026. 19 pages, 12 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏