arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2272 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2272 篇

2605.08896 2026-05-12 cs.CL cs.AI cs.LG 62%

FragileFlow: Spectral Control of Correct-but-Fragile Predictions for Foundation Model Robustness

FragileFlow: 对基础模型鲁棒性进行谱控制的正确但易碎预测的谱控制

Zhuoyun Li, Boxuan Wang, Jinwei Hu, Xiaowei Huang, Yi Dong

机构 * School of Computer Science and Informatics, University of Liverpool, UK(利兹大学计算机科学与信息学学院)

专题命中 幻觉与鲁棒性 :VLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出FragileFlow,通过谱控制识别正确但易碎的预测,提升基础模型鲁棒性,实验显示其在多个选择LLM基准和少量样本CLIP适应中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08764 2026-05-12 cs.LG cs.CV eess.IV 62%

Anchoring the Eigengap: Cross-Modal Spectral Stabilization for Sample-Efficient Representation Learning

锚定特征间隙:跨模态谱稳定化以实现样本高效表征学习

Nikhil J. Dhinagar, Vidhi Chhatbar, Chirag Jagad, Pavithra Senthilkumar, Sophia I. Thomopoulos, Mahir H. Khan, Sook-Lei Liew, the ENIGMA-Stroke Recovery Working Group, Paul M. Thompson

机构 * Imaging Genetics Center, Mark & Mary Stevens Neuroimaging & Informatics Institute, Keck School of Medicine, University of Southern California(影像基因中心,马克与玛丽史蒂文斯神经影像与信息学研究所,凯克医学院,南加州大学) Neuroscience Graduate Program, Mark & Mary Stevens Neuroimaging & Informatics Institute, Chan Division of Occupational Science & Occupational Therapy, Biomedical Engineering, University of Southern California(神经科学研究生项目,马克与玛丽史蒂文斯神经影像与信息学研究所,查恩职业科学与职业治疗 division,生物医学工程,南加州大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出跨模态谱稳定化方法,通过抑制噪声主导方向并保持特征间隙,提升样本效率下的表征学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00893 2026-05-05 cs.CV cs.AI cs.IR 62%

Retrieval-Guided Generation for Safer Histopathology Image Captioning

基于检索的生成用于更安全的病理科图像描述生成

Md. Enamul Hoq, Wataru Uegami, Saghir Alfasly, Ghazal Alabtah, Sahar Rahimi Malakshan, Armita Kazemi, Alex T. Schmitgen, Fred Prior, H. R. Tizhoosh

机构 * Kimia Lab, Department of Artificial Intelligence \& Informatics, Mayo Clinic, Rochester, MN, USA Department of Biomedical Informatics, University of Arkansas for Medical Sciences, Little Rock, AR, USA Lane Department of Computer Science Electrical Engineering, West Virginia University, Morgantown, WV, USA Department of Computer Science Engineering, Princeton University, Princeton, NJ, USA Department of Computer Sciences, University of Wisconsin--Madison, Madison, WI, USA

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出检索引导生成方法,通过总结相似病例的专家文本生成描述,提升病理图像描述的准确性与可靠性,实验表明其在语义对齐和诊断一致性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25591 2026-04-29 eess.AS cs.AI cs.CL cs.LG cs.SD 62%

Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models

穿越不确定性:音频感知大语言模型不确定性估计的实证研究

Chun-Yi Kuan, Wei-Ping Huang, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(台湾大学通讯工程研究所) Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(台湾大学人工智能卓越研究中心)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了音频感知大语言模型的不确定性估计,通过多种方法对比发现语义层面方法在通用音频推理中表现更优,且在可靠性导向任务中效果依赖模型和基准。

Comments Manuscript in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25110 2026-04-29 cs.LG cs.AI 62%

Knowledge Distillation Must Account for What It Loses

知识蒸馏必须考虑其失去的内容

Wenshuo Wang

机构 * School of Future Technology, South China University of Technology, China(未来技术学院,华南理工大学,中国)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文指出知识蒸馏需考虑其失去的内容,学生模型应不仅通过保留任务得分判断,还应保留教师能力以确保得分可靠性。提出蒸馏是教师行为的损失性投影,而非忠实复制,并提出场景特定的保留目标和蒸馏损失声明。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23860 2026-04-28 cs.CV cs.AI 62%

Exploring Audio Hallucination in Egocentric Video Understanding

探索第一人称视频理解中的音频幻觉

Ashish Seth, Xinhao Mei, Changsheng Zhao, Varun Nagaraja, Ernie Chang, Gregory P. Meyer, Gael Le Lan, Yunyang Xiong, Vikas Chandra, Yangyang Shi, Dinesh Manocha, Zhipeng Cai

机构 * Meta University Of Maryland, College Park(马里兰大学学院公园分校)

专题命中 幻觉与鲁棒性 :visual language model(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了第一人称视频中音频幻觉问题,提出自动评估框架和分类体系,发现先进AV-LLMs在回答声音相关问题时存在较高幻觉率。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23445 2026-04-28 cs.CL cs.AI cs.CY cs.LG 62%

AI Safety Training Can be Clinically Harmful

AI安全训练可能造成临床伤害

Suhas BN, Andrew M. Sherrill, Rosa I. Arriaga, Chris W. Wiese, Saeed Abdullah

机构 * College of Information Sciences and Technology, Penn State University(宾夕法尼亚州立大学信息科学与技术学院) Department of Psychiatry and Behavioral Sciences, Emory University(埃默里大学精神病学与行为科学系) School of Interactive Computing, Georgia Tech(佐治亚理工学院交互计算学院) School of Psychology, Georgia Tech(佐治亚理工学院心理学学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究评估了四种生成模型在认知行为疗法场景中的表现,发现其在高严重性情况下治疗适当性显著下降,提出需通过多轴评估框架确保AI心理健康系统的安全性。

Comments 26 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19844 2026-04-23 cs.CV cs.AI 62%

If you're waiting for a sign... that might not be it! Mitigating Trust Boundary Confusion from Visual Injections on Vision-Language Agentic Systems

如果你在等待一个信号……那可能不是它!减轻视觉注入对视觉语言代理系统信任边界混淆的影响

Jiamin Chang, Minhui Xue, Ruoxi Sun, Shuchao Pang, Salil S. Kanhere, Hammond Pearce

机构 * University of New South Wales(新南威尔士大学) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织数据61部门) Macquarie University(麦考瑞大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究探讨了视觉注入对视觉语言代理系统信任边界的影响,通过双意图数据集和评估框架发现现有模型在平衡合法信号与误导信号方面存在不足,提出多代理防御框架以提升系统鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16504 2026-04-21 cs.CV cs.LG 62%

From Handwriting to Structured Data: Benchmarking AI Digitisation of Handwritten Forms

从手写到结构化数据:基准测试AI手写文档数字化

Nicholas Pather, Joshua Fouché, Sitwala Mundia, Karl-Günter Technau, Thokozile Malaba, Alex Welte, Ushma Mehta, Bruce A. Bassett

机构 * CSAM, University of the Witwatersrand(沃特沙尔德大学计算机科学与数学系) Grai Labs(Grai实验室) Faculty of Health Sciences, University of the Witwatersrand(沃特沙尔德大学健康科学学院) Empilweni Services and Research Unit, Department of Paediatrics and Child Health, University of the Witwatersrand(沃特沙尔德大学儿科与儿童健康部门Empilweni服务与研究单位) Division of Epidemiology and Biostatistics, School of Public Health, Faculty of Health Sciences, University of Cape Town(开普敦大学公共卫生学院流行病学与生物统计学系) Discipline of Public Health, School of Medicine, University of KwaZulu-Natal(夸祖鲁-纳塔尔大学医学院公共卫生系) WITS MIND Institute and CSAM, University of the Witwatersrand, University of Cape Town & Grai Labs(沃特沙尔德大学WITS MIND研究所和CSAM、开普敦大学及Grai实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 本文评估了17种前沿多模态大语言模型在处理复杂手写表格任务中的表现,发现最新版Google和OpenAI模型在准确率和F1分数上达到85%和90%,并展示了提示优化对性能的显著提升。

Comments 19 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12944 2026-04-15 cs.CV cs.AI 62%

Distorted or Fabricated? A Survey on Hallucination in Video LLMs

扭曲或伪造?视频大语言模型中幻觉的调查

Yiyang Huang, Yitian Zhang, Yizhou Wang, Mingyuan Zhang, Liang Shi, Huimin Zeng, Yun Fu

机构 * Department of Electrical and Computer Engineering, Northeastern University(东北大学电气与计算机工程系) Khoury College of Computer Science, Northeastern University(东北大学科赫里计算机科学学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文调查视频大语言模型中的幻觉问题,提出动态扭曲和内容伪造两大类,分析其成因并提出改进方向,如开发运动感知视觉编码器和整合反事实学习技术。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05206 2026-04-15 cs.CR cs.AI cs.CL cs.CV 62%

Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety

大规模安全:大型模型和智能体安全的全面综述

Xingjun Ma, Yifeng Gao, Yixu Wang, Ruofan Wang, Xin Wang, Ye Sun, Yifan Ding, Hengyuan Xu, Yunhao Chen, Yunhan Zhao, Hanxun Huang, Yige Li, Yutao Wu, Jiaming Zhang, Xiang Zheng, Yang Bai, Zuxuan Wu, Xipeng Qiu, Jingfeng Zhang, Yiming Li, Xudong Han, Haonan Li, Jun Sun, Cong Wang, Jindong Gu, Baoyuan Wu, Siheng Chen, Tianwei Zhang, Yang Liu, Mingming Gong, Tongliang Liu, Shirui Pan, Cihang Xie, Tianyu Pang, Yinpeng Dong, Ruoxi Jia, Yang Zhang, Shiqing Ma, Xiangyu Zhang, Neil Gong, Chaowei Xiao, Sarah Erfani, Tim Baldwin, Bo Li, Masashi Sugiyama, Dacheng Tao, James Bailey, Yu-Gang Jiang

机构 * Fudan University(复旦大学) The University of Melbourne(墨尔本大学) Singapore Management University(新加坡国立大学) Deakin University(德肯大学) Hong Kong University of Science and Technology(香港科学与技术大学) City University of Hong Kong(香港城市大学) University of Oxford(牛津大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) The University of Sydney(悉尼大学) Griffith University(格里菲斯大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Sea AI Lab(Sea AI实验室) Tsinghua University(清华大学) Virginia Tech(弗吉尼亚理工大学) CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全部) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Purdue University(普渡大学) Duke University(杜克大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) RIKEN(理化学研究所) The University of Tokyo(东京大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了大型模型和智能体的安全性,分析了各类攻击威胁及防御策略,指出安全评估、防御机制和数据实践的重要性,强调研究社区和国际合作的必要性。

Comments 706 papers, 60 pages, 3 figures, 14 tables; GitHub: https://github.com/xingjunm/Awesome-Large-Model-Safety

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09253 2026-04-13 cs.CV cs.AI 62%

Mosaic: Multimodal Jailbreak against Closed-Source VLMs via Multi-View Ensemble Optimization

Mosaic: 通过多视图集成优化实现对闭源视觉语言模型的多模态劫持

Yuqin Lan, Gen Li, Yuanze Hu, Weihao Shen, Zhaoxin Fan, Faguo Wu, Xiao Zhang, Laurence T. Yang, Zhiming Zheng

机构 * Beihang University(北京航空航天大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Mosaic框架,通过多视图集成优化减少对单一代理模型的依赖,提升对闭源VLMs的多模态劫持效果,实验显示其在安全基准上的攻击成功率和毒性均达到最优。

Comments 14pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07426 2026-04-10 cs.LG cs.AI 62%

GIRL: Generative Imagination Reinforcement Learning via Information-Theoretic Hallucination Control

GIRL:通过信息论幻觉控制实现生成性想象强化学习

Prakul Sunil Hiremath

机构 * Department of Computer Science and Engineering, Visvesvaraya Technological University (VTU), Belagavi, India(维斯瓦拉亚科技大学计算机科学与工程系,贝拉加维,印度) Aliens on Earth (AoE) Autonomous Research Group, Belagavi, India(地球外星人自主研究组,贝拉加维,印度)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 GIRL通过引入跨模态锚定信号和不确定性适应信任区域瓶颈,解决模型误差累积导致的轨迹漂移问题,提升长周期任务的样本效率和回报性能。

Comments 20 pages, 2 figures, 7 tables; reinforcement learning, world models

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06728 2026-04-09 cs.CV cs.AI cs.MM 62%

URMF: Uncertainty-aware Robust Multimodal Fusion for Multimodal Sarcasm Detection

URMF:面向多模态讽刺检测的不确定性感知鲁棒多模态融合

Zhenyu Wang, Weichen Cheng, Weijia Li, Junjie Mou, Zongyou Zhao, Guoying Zhang

机构 * School of Artificial Intelligence, China University of Mining and Technology-Beijing(中国矿业大学(北京)人工智能学院)

专题命中 幻觉与鲁棒性 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出URMF框架,通过建模模态可靠性提升多模态讽刺检测的准确性和鲁棒性,采用多头交叉注意力和自注意力机制,并结合不确定性建模和联合训练目标,在公开基准上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06277 2026-04-09 cs.AI cs.CL cs.LG 62%

Weakly Supervised Distillation of Hallucination Signals into Transformer Representations

弱监督蒸馏 hallucination 信号到 Transformer 表示

Shoaib Sadiq Salehmohamed, Jinal Prashant Thakkar, Hansika Aredla, Shaik Mohammed Omar, Shalmali Ayachit

机构 * LLM Lens

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出弱监督框架,通过子串匹配、句子嵌入相似性和LLM判官信号,无需人工标注即可标注生成响应是否 grounded 或 hallucinated,并通过五种探针分类器验证 hallucination 信号可被蒸馏到 Transformer 表示中。

Comments 20 pages, 6 figures, 6 tables. Introduces a 15k-sample representation-level hallucination dataset with full transformer hidden states and multi-signal weak supervision. Evaluates 5 probing architectures and demonstrates internal hallucination detection without external inference-time signals. Includes held-out test evaluation and deployment benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15411 2026-04-02 cs.CV cs.LG 62%

D4C: Data-Free Quantization for Contrastive Language-Image Pre-training Models

D4C: 无数据量化用于对比语言-图像预训练模型

Wenlun Zhang, Yunshan Zhong, Zihao Ding, Xinyu Li, Kentaro Yoshioka

机构 * Keio University(庆应义塾大学) Hainan University(海南大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出D4C框架,解决无数据量化在CLIP模型中的性能问题,通过生成语义丰富且结构多样的伪图像提升模型压缩效果。

Comments Accepted to CVPRF 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03721 2026-03-31 cs.CV cs.CL cs.CY cs.LG 62%

Person-Centric Annotations of LAION-400M: Auditing Bias and Its Transfer to Models

针对LAION-400M的人为中心标注:审查偏见及其在模型中的转移

Leander Girrbach, Stephan Alaniz, Genevieve Smith, Trevor Darrell, Zeynep Akata

机构 * Technical University of Munich, Munich Center for Machine Learning (MCML), MDSI(慕尼黑工业大学,慕尼黑机器学习中心(MCML),MDSI) LTCI, Télécom Paris, Institut Polytechnique de Paris, France(法国巴黎理工学院,巴黎电信学院,LTCI) Helmholtz Munich(亥姆霍兹慕尼黑中心) University of California, Berkeley(加州大学伯克利分校)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文通过创建LAION-400M的人为中心标注,揭示了训练数据中存在的人口统计学偏见,并展示了这些偏见如何转移到视觉-语言模型中。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25613 2026-03-27 cs.CV cs.AI 62%

Demographic Fairness in Multimodal LLMs: A Benchmark of Gender and Ethnicity Bias in Face Verification

多模态大语言模型中的人口公平性:面部验证中性别和种族偏见的基准测试

Ünsal Öztürk, Hatef Otroshi Shahreza, Sébastien Marcel

机构 * Idiap Research Institute(Idiap 研究所)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文评估了九种开源多模态大语言模型在面部验证协议中的表现,揭示了不同种族和性别群体间的偏见差异,发现专用面部模型在性能和公平性上均优于通用模型。

Comments Accepted in CVPR 2026 workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17683 2026-03-19 cs.AI cs.LG 62%

Sensi: Learn One Thing at a Time -- Curriculum-Based Test-Time Learning for LLM Game Agents

Sensi:一次学一项——基于课程的学习式测试时间学习用于LLM游戏代理

Mohsen Arjmandi

机构 * Independent Researcher (CTO, evolutionID)(独立研究者(CTO, evolutionID))

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 Sensi通过结构化测试时间学习机制,提升LLM游戏代理在未知环境中的学习效率,其核心方法包括双玩家架构、课程学习系统和数据库作为控制平面,显著提高了样本效率。

Comments Preprint. 18 pages, 5 figures, 2 tables. Independent research. Code and Colab demo coming soon on GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17662 2026-03-19 cs.CV cs.AI 62%

FINER: MLLMs Hallucinate under Fine-grained Negative Queries

FINER:MLLMs在细粒度负查询下产生幻觉

Rui Xiao, Sanghwan Kim, Yongqin Xian, Zeynep Akata, Stephan Alaniz

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Helmholtz Munich(海德堡-慕尼黑亥姆霍尔茨中心) Google(谷歌) LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎理工学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FINER基准测试,分析MLLMs在细粒度不匹配与真实元素共存时的幻觉问题,并通过FINER-Tuning提升模型性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04893 2026-03-19 cs.CV cs.AI 62%

SCAM: A Real-World Typographic Robustness Evaluation for Multimodal Foundation Models

SCAM:多模态基础模型的现实世界字形鲁棒性评估

Justus Westerhoff, Erblina Purelku, Jakob Hackstein, Jonas Loos, Leo Pinetzki, Erik Rodner, Lorenz Hufe

机构 * BLISS e.V.(BLISS协会) Berliner Hochschule für Technik (BHT)(柏林技术大学) Technische Universität Berlin(柏林技术大学) KI Werkstatt, Hochschule für Technik und Wirtschaft Berlin (HTW)(柏林技术经济学院) Merantix Momentum(Merantix Momentum公司) Fraunhofer Heinrich-Hertz-Institut, Berlin, Germany(柏林弗劳恩霍夫 Heinrich-Hertz 研究所)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SCAM数据集,用于评估多模态基础模型对字形攻击的鲁棒性,发现训练数据和模型架构影响攻击敏感性,且大语言模型基座可降低攻击影响。

Comments Accepted at CVPR 2025 Workshop EVAL-FoMo-2

Journal ref Journal of Data-centric Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14825 2026-03-17 cs.CV cs.AI 62%

Two Birds, One Projection: Harmonizing Safety and Utility in LVLMs via Inference-time Feature Projection

双鸟归一投影:通过推理时特征投影在LVLMs中调和安全与效用

Yewon Han, Yumin Seol, EunGyung Kong, Minsoo Jo, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Mobilint

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了安全与效用在LVLMs中的对抗性,提出通过推理时投影消除模态偏差方向以提升安全性和效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14819 2026-03-17 cs.CV cs.AI 62%

RAZOR: Ratio-Aware Layer Editing for Targeted Unlearning in Vision Transformers and Diffusion Models

RAZOR:面向视觉变换器和扩散模型的比率感知层编辑以实现针对性遗忘

Ravi Ranjan, Utkarsh Grover, Xiaomin Lin, Agoritsa Polyzou

机构 * Florida International University(佛罗里达国际大学) University of South Florida(佛罗里达州立大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 RAZOR通过比率感知机制实现视觉变换器和扩散模型的针对性遗忘,通过多层和多头编辑提升模型安全性与合规性,实现高效且稳定的遗忘更新。

Comments 18 pages, 6 figures, 8 tables, accepted to the CVPR 2026 and to appear in the Findings Track Proceedings of IEEE/CVF Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13292 2026-03-17 cs.LG cs.AI 62%

Pragma-VL: Towards a Pragmatic Arbitration of Safety and Helpfulness in MLLMs

Pragma-VL:迈向多模态大语言模型中安全与助人的务实仲裁

Ming Wen, Kun Yang, Xin Chen, Jingyu Zhang, Dingding Han, Shiwen Cui, Yuedong Xu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团) Zhejiang University(浙江大学) UCLA(加州大学洛杉矶分校) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 Pragma-VL通过引入一种端到端的对齐算法,解决了多模态大语言模型在安全与助人之间的平衡问题,通过增强视觉风险感知和理论保证的奖励模型,在多数多模态安全基准上提升了性能。

Comments 31 pages, ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11542 2026-03-13 cs.CV cs.AI 62%

ReHARK: Refined Hybrid Adaptive RBF Kernels for Robust One-Shot Vision-Language Adaptation

ReHARK:基于重构混合自适应RBF核的鲁棒单样本视觉-语言适应

Md Jahidul Islam

机构 * Buet.ac.bd(巴特西大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 ReHARK通过重构混合自适应RBF核框架,利用全局近端正则化提升单样本视觉-语言适应的稳定性与准确性,实现65.83%的平均准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18811 2026-03-11 cs.CV cs.AI 62%

Mitigating Long-Tail Bias in HOI Detection via Adaptive Diversity Cache

通过自适应多样性缓存缓解HOI检测中的长尾偏差

Yuqiu Jiang, Xiaozhen Qiao, Yifan Chen, Ye Zheng, Zhe Sun, Xuelong Li

机构 * College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

专题命中 幻觉与鲁棒性 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出自适应多样性缓存模块,通过无训练机制缓解HOI检测中的长尾偏差,提升稀有类别检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04663 2026-03-10 cs.LG cs.AI cs.CE 62%

Neuro-Symbolic Financial Reasoning via Deterministic Fact Ledgers and Adversarial Low-Latency Hallucination Detector

通过确定性事实账本和对抗性低延迟幻觉检测器实现神经符号金融推理

Pedram Agand

机构 * FactAI Lab(FactAI实验室)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VeNRA,通过确定性事实账本和对抗性检测器实现零幻觉金融推理,结合确定性执行和高效检测机制,显著降低幻觉率并提升推理可靠性。

Comments 21 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07048 2026-03-10 cs.CV cs.AI 62%

Looking Back and Forth: Cross-Image Attention Calibration and Attentive Preference Learning for Multi-Image Hallucination Mitigation

回望与前行:用于多图像幻觉缓解的跨图像注意力校准与关注偏好学习

Xiaochen Yang, Hao Fang, Jiawei Kong, Yaoxin Mao, Bin Chen, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology(哈尔滨工业大学) Beijing Institute of Technology(北京理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CAPL框架,通过跨图像注意力校准和偏好学习缓解多图像幻觉问题,提升模型对跨图像关联的建模能力,并在多个任务中取得稳定性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06256 2026-03-09 cs.CV cs.AI 62%

GazeMoE: Perception of Gaze Target with Mixture-of-Experts

GazeMoE:基于专家混合的注视目标感知

Zhuangzhuang Dai, Zhongxi Lu, Vincent G. Zakka, Luis J. Manso, Jose M Alcaraz Calero, Chen Li

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 GazeMoE通过MoE模块结合多模态线索,实现对注视目标的高精度识别,优于现有方法。

Comments 8 pages, 3 figures, ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05184 2026-03-06 cs.CV cs.AI 62%

Logi-PAR: Logic-Infused Patient Activity Recognition via Differentiable Rule

Logi-PAR: 通过可微规则融合的逻辑患者活动识别

Muhammad Zarar, MingZheng Zhang, Xiaowang Zhang, Zhiyong Feng, Sofonias Yitagesu, Kawsar Farooq

机构 * School of Computer Software, Tianjin University, China(天津大学软件学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Logi-PAR通过可微规则融合实现患者活动识别,首次将逻辑推理融入模型以生成可解释的活动分析和反事实干预。

详情

展开后加载摘要…

URL PDF HTML 收藏