arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2272 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2272 篇

2606.12258 2026-06-11 cs.CV 新提交 57%

Bridging Day and Night: Unsupervised Cross-Domain Re-Identification with Synergistic Prompt and Prototype Learning

连接昼夜:基于协同提示与原型学习的无监督跨域重识别

Jiyang Xu, Rui Liu, Hang Dai

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 提出无监督昼夜重识别框架,结合提示学习和原型表示学习,通过两阶段训练实现无标注跨域身份关联,性能媲美全监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19210 2026-06-10 cs.CV 版本更新 57%

Contrastive Spectral Rectification: Test-Time Defense towards Zero-shot Adversarial Robustness of CLIP

对比谱校正:面向CLIP零样本对抗鲁棒性的测试时防御

Sen Nie, Jie Zhang, Zhuo Wang, Shiguang Shan, Xilin Chen

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 提出对比谱校正(CSR)方法,利用对抗样本在频率衰减下的特征不一致性,通过谱引导对比目标优化校正扰动,在16个分类基准上平均提升18.1%的强攻击鲁棒性,且推理开销低。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08860 2026-06-09 cs.CV 新提交 57%

Vision-Language Work Zone Intelligence for Safety-Critical Speed Regulation of Mixed-Autonomy Vehicles in Dynamic Environments

面向动态环境中混合自主车辆安全关键速度调节的视觉语言工作区智能

Angel Martinez-Sanchez, Kianna Ng, Wesley Maia, Laura Fleig, Maitrayee Keskar, Erika Maquiling, Yash Tandon, Parthib Roy, Mohan Trivedi, Ross Greer

机构 * UC Merced(加州大学默塞德分校) Johns Hopkins(约翰霍普金斯大学) UC San Diego(加州大学圣地亚哥分校)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV

AI总结 提出一种实时车载感知管线,通过目标检测与语义验证融合及滞后状态转换,从视觉标志中识别临时工作区限速,在低成本硬件上实现96.5%召回率和68.7%精确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29823 2026-06-09 cs.AI 版本更新 57%

Quantifying and Optimizing Simplicity via Polynomial Representations

通过多项式表示量化和优化简单性

Tianren Zhang, Xiangxin Li, Minghao Xiao, Guanyu Chen, Feng Chen

机构 * [cs.AI](计算机科学与人工智能)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 提出多项式表示作为分布感知的低维神经函数代理,通过正交多项式基近似网络预测行为,以有效度作为简单性度量,并导出可微正则化器以提升泛化。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06938 2026-06-08 cs.CV 新提交 57%

When CLIP Sees More, It Fights Back Harder: Multi-View Guided Adaptive Counterattacks for Test-Time Adversarial Robustness

当CLIP看得更多,它反击得更猛烈:多视图引导的自适应对抗攻击用于测试时对抗鲁棒性

Sunoh Kim, Daeho Um

机构 * Dankook University(Dankook 大学) University of Seoul(首尔大学) Yongin, South Korea(韩国 Yongin) Seoul, South Korea(首尔, 韩国)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 提出多视图引导的自适应对抗攻击(MAC),通过构建输入图像的增强视图、执行对抗攻击精炼嵌入、自适应调整攻击强度并聚合视图,显著提升CLIP在测试时的对抗鲁棒性。

Comments Accepted in CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06743 2026-06-08 cs.SD cs.AI cs.CL 新提交 57%

HybridCodec: Fast Dual-Stream, Semantically Enhanced Neural Audio Codec

HybridCodec: 快速双流、语义增强的神经音频编解码器

Arjun Gangwar, S Umesh

机构 * Indian Institute of Technology, Madras(印度理工学院马德拉斯分校)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 提出HybridCodec,一种结合语义蒸馏与双流架构的统一神经音频编解码器,实现强解耦、跨语言鲁棒性及3倍速度提升。

Comments 5 pages, 5 tables, 1 figure, Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05256 2026-06-05 cs.AI 57%

How Far Did They Go? The Persuasive Tactics of Covert LLM Agents in a Discontinued Field Experiment

他们走了多远?已终止现场实验中隐蔽LLM代理的说服策略

Kokil Jaidka, Saifuddin Ahmed

机构 * Wee Kim Wee school of Communication and Information, Nanyang Technological University(魏家伟通信与信息学院,南洋理工大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 通过分析Reddit r/ChangeMyView已终止现场实验的公开数据集,研究隐蔽LLM代理在身份丰富的讨论论坛中使用的说服策略,发现其系统性采用身份定位、权威信号、对齐策略和认知偏差触发,构成以说服效率为导向的修辞架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16149 2026-06-05 cs.CV 57%

Toward Trustworthy Portrait Editing: Evaluation of Demographic Misrepresentation in I2I Models

迈向可信的人像编辑:评估 I2I 模型中的人口统计误表示

Huichan Seo, Minki Hong, Sieun Choi, Jihie Kim, Jean Oh

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文通过控制基准测试,评估了指令引导的图像到图像编辑器中身份保留失败的两个模式(软擦除和刻板印象替换),发现肤色变浅等偏差普遍存在且人口统计不均,并提出提示级约束作为缓解措施。

Comments 22 pages, 10 figures. Huichan Seo, Minki Hong and Sieun Choi contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14177 2026-06-04 cs.CV 57%

Improving Semantic Uncertainty Quantification in LVLMs with Semantic Gaussian Processes

利用语义高斯过程改进LVLM中的语义不确定性量化

Joseph Hoche, Andrei Bursuc, David Brellmann, Gilles Louppe, Pavel Izmailov, Angela Yao, Gianni Franchi

机构 * AMIAD, Pôle Recherche, Palaiseau(AMIAD研究部,Palaiseau) valeo.ai Safran Tech University of Liège(利耶大学) New York University(纽约大学) National University of Singapore(新加坡国立大学) ENSTA Paris(巴黎ENSTA)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 提出语义高斯过程不确定性(SGPU)框架,通过分析答案嵌入的几何结构来量化语义不确定性,避免脆弱的聚类方法,在多个模型和数据集上实现了最先进的校准和判别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10912 2026-06-04 cs.AI cs.CL 57%

Breaking Bad Molecules: Are MLLMs Ready for Structure-Level Molecular Detoxification?

Breaking Bad Molecules: MLLMs 是否准备好进行结构级分子解毒?

Fei Lin, Ziyang Gong, Cong Wang, Tengchao Zhang, Yonglin Tian, Yining Jiang, Ji Dai, Chao Guo, Xiaotong Yu, Xue Yang, Gen Luo, Fei-Yue Wang

机构 * Department of Engineering Science, Macau University of Science and Technology, Macau, China(澳门科学技术大学工程科学系) School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) School of Pharmacy, Macau University of Science and Technology, Macau, China(澳门科学技术大学药学院) Faculty of Electrical Engineering and Computer Science, Ningbo University, Ningbo, China(宁波大学电气与计算机科学学院) State Key Laboratory of Biopharmaceutical Preparation and Delivery, Institute of Process Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院生物制药制备与递送国家重点实验室) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, Shanghai, China(上海交通大学自动化与智能感知学院) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出 ToxiMol 基准任务,利用多模态大语言模型进行分子毒性修复,并构建数据集、提示流程和自动评估框架 ToxiEval,实验表明当前模型虽面临挑战但展现出毒性理解与结构编辑的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03678 2026-06-03 cs.AI 57%

EvoDrive: Pareto Evolution for Safety-Critical Autonomous Driving via Self-Improving LLM Agents

EvoDrive: 通过自我改进的LLM智能体实现安全关键自动驾驶的帕累托进化

Tong Nie, Yuewen Mei, Yihong Tang, Junlin He, Jie Deng, Jian Sun, Wei Ma

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 提出EvoDrive,首个基于LLM的自动化智能体进化框架,通过模拟器接地演员-评论家架构和帕累托存档,在安全关键场景生成中实现对抗性与真实性的多目标优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29670 2026-05-29 cs.CL cs.AI 57%

EviLink: Multi-Path Schema Linking with Uncertainty-Guided Evidence Acquisition for Large-Scale Text-to-SQL

EviLink: 面向大规模Text-to-SQL的基于不确定性引导证据获取的多路径模式链接

Huawei Zheng, Sen Yang, Zhaorui Yang, Yuhui Zhang, Haozhe Feng, Haoxuan Li, Xuan Yi, Chao Hu, Defeng Xie, Chen Hou, Danqing Huang, Wei Chen, Yingcai Wu, Peng Chen, Dazhen Deng

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Tencent TEG(腾讯TEG) School of Mathematical Sciences, Peking University(北京大学数学科学学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 提出EviLink方法,通过多假设模式基础与不确定性引导的证据获取,重新定义模式链接为不确定性感知的模式需求推理,以平衡模式完整性、相关性和令牌成本,提升大规模Text-to-SQL性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29579 2026-05-29 cs.CV 57%

ReactBench: A Cause-Driven Benchmark for Multimodal Hallucination via Systematic Evaluation

ReactBench:通过系统评估的多模态幻觉因果驱动基准

Shizhe Zhou, Bohan Jia, Kai Wu, Yan Shen, Tongyun Li, Yuyang Wu, Shaohui Lin

机构 * East China Normal University(华东师范大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 提出ReactBench基准,通过对抗性图像和诱导幻觉的查询,系统评估多模态大模型在关系擦除、反事实属性、变化追踪和密集计数等任务中的因果幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28828 2026-05-29 cs.CL cs.AI 57%

Micro-Macro Retrieval: Reducing Long-Form Hallucination in Large Language Models

微宏检索:减少大语言模型中的长文本幻觉

Yujie Feng, Jian Li, Zhihan Zhou, Pengfei Xu, Yujia Zhang, Xiaoyu Li, Xiaohui Zhou, Alan Zhao, Xi Chen, Xiao-Ming Wu

机构 * Solar System of OVB, Tencent, China(OVB太阳系,腾讯,中国) The Hong Kong Polytechnic University, Hong Kong S.A.R.(香港理工大学,香港特别行政区) Jilin University, China(吉林大学,中国)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 提出微宏检索(M2R)框架,通过宏观检索外部粗粒度证据和微观检索推理中关键信息库,解决长文本生成中关键信息与输出距离过远导致的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28338 2026-05-28 cs.AI 57%

SafeMed-R1: Clinician-Audited Safety and Ethics Alignment for Medical Large Language Models

SafeMed-R1: 临床医生审计的安全与伦理对齐用于医疗大语言模型

Chao Ding, Mouxiao Bian, Tianbin Li, Minjia Yuan, Yidong Jiang, Yankai Jiang, Jinru Ding, Jiayuan Chen, Zhuangzhi Gao, Pengcheng Chen, Zhao He, Rongzhao Zhang, Meiling Liu, Luyi Jiang, Jie Xu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Joint Laboratory of Biomedical Artificial Intelligence(生物医学人工智能联合实验室) Shanghai Institute of Infectious Disease and Biosecurity(上海传染病与生物安全研究院) Shanghai Health Development Research Center (Shanghai Medical Information Center)(上海健康发展战略研究中心(上海医疗信息中心)) University of Washington(华盛顿大学) Department of Eye and Vision Sciences, University of Liverpool(利物浦大学眼科与视觉科学系) Liverpool Centre for Cardiovascular Science, University of Liverpool(利物浦大学心血管科学中心) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 提出SafeMed-R1模型,通过可追溯的临床信任信号管道和红队压力测试实现安全与伦理对齐,在临床基准上达到79.6%的宏平均准确率,并将不安全输出减少约3-5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28044 2026-05-28 cs.AI 57%

Relevant Is Not Warranted: Evidence-Force Calibration for Cited RAG

相关并不保证:引用RAG的证据力度校准

Pin Qian, Su Wang, Xiaoyuan Wang, Yihang Chen, Wenxuan Xu, Qiaolin Yu, Shuhuai Lin, Sipeng Zhang, Junxian You, Xinpeng Wei

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院) Dartmouth College(达特茅斯学院) Cornell University(康奈尔大学) University of California San Diego(加州大学圣地亚哥分校) University of Glasgow(格拉斯哥大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 针对引用RAG中证据力度不足的问题,提出FORCEBENCH基准测试,通过对比证据校准声明与力度增强变体,评估模型在五个操作轴上的单调性,发现标准支持提示不足以校准证据力度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27068 2026-05-27 cs.CL cs.AI cs.MA 57%

QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents

QUACK: 多模态社交推理智能体中的沟通知识质疑、理解与审计

Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang Han, Yonghan Yang, Zichen Zhao, Zixuan Dong, Fuyuan Lyu, Bowei He, Haolun Wu, Jikun Kang, Xue Liu

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) University of Cambridge(剑桥大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(MBZUAI - 摩苏尔·本·扎耶德人工智能大学) University of Toronto(多伦多大学) Salesforce

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 提出QUACK框架,通过游戏结果、行为轨迹和话语一致性三级评估,自动审计多模态社交推理智能体语言与感知行为的一致性,发现最强智能体仍有15.1%的空间幻觉和过半无据指控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26944 2026-05-27 cs.RO cs.CV 57%

Object Pose and Shape Estimation for Grasping: Does it Work?

用于抓取的目标姿态与形状估计:有效吗?

Pavan Karke, Kushal Shah, Gaurav Singh, Md Faizal Karim, K Madhava Krishna, Rajat Talak

机构 * Robotics Research Center, IIIT Hyderabad(IIIT海得拉巴机器人研究中心) National University of Singapore(新加坡国立大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文通过对比端到端抓取合成方法与模块化方法(先估计目标姿态和形状再采样抓取),评估现有姿态和形状估计方法在抓取任务中的有效性。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12564 2026-05-27 cs.CL cs.AI 57%

Sell Me This Stock: Unsafe Recommendation Drift in LLM Agents

卖给我这支股票:LLM智能体中的不安全推荐漂移

Zekun Wu, Adriano Koshiyama, Sahan Bulathwela, Maria Perez-Ortiz

机构 * Centre for Artificial Intelligence, University College London(人工智能研究中心,伦敦大学学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 研究LLM智能体在多轮金融推荐中因工具输出被操纵而产生风险不匹配推荐的问题,通过实验揭示评估盲区并分析机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19450 2026-05-27 cs.CR cs.AI 57%

Red-Teaming Claude Opus and ChatGPT-based Security Advisors for Trusted Execution Environments

对基于Claude Opus和ChatGPT的TEE安全顾问进行红队测试

Kunal Mukherjee, Spandan Mukherjee

机构 * Virginia Tech(弗吉尼亚理工大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 针对TEE安全顾问角色下的LLM助手(ChatGPT-5.2和Claude Opus-4.6),提出TEE-RedBench评估方法,发现提示诱导的失败可跨模型迁移(最高12.02%),并通过LLM-in-the-loop流水线减少80.62%的失败。

Comments Accepted for publication in ACM CAIS '26 Workshop on AI Discovery in the Wild (AID-Wild)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25141 2026-05-26 cs.CL cs.AI 57%

LLM Agent Based Renewable Energy Forecasting Using Edge and IoT Data A Review of Solar Wind Weather and Grid Aware Decision Support

基于LLM Agent的利用边缘和物联网数据的可再生能源预测:太阳能、风能、天气和电网感知决策支持综述

Pavan Manjunath, Thomas Pruefer

机构 * Independent Researcher(独立研究员)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文综述了如何利用大语言模型代理整合异构传感器流、天气API数据、历史发电记录和电网约束,形成统一的决策支持工作流,以增强可再生能源预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25036 2026-05-26 cs.CL cs.AI 57%

Language Bias in LVLMs: From In-Depth Analysis to Simple and Effective Mitigation

LVLMs中的语言偏差:从深入分析到简单有效的缓解方法

Yangneng Chen, Jing Li

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳))

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 本文系统研究了大视觉语言模型中的语言偏差问题,发现其根源在于训练中的模态未对齐,并提出了两种简单有效的缓解方法:语言偏差正则化(LBR)和语言偏差惩罚(LBP)。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24076 2026-05-26 stat.ML cs.LG 57%

Causality as the Statistical Conscience of Artificial Intelligence: From Pearl's Ladder to Trustworthy Machines

因果关系作为人工智能的统计良知:从珀尔的阶梯到可信机器

Ernest Fokoué

机构 * School of Mathematics and Statistics, College of Science(数学与统计学学院,科学学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 本文论证因果推断是AI不可或缺的统计良知,通过统计必要性定理、统一因果统计估计框架以及三种AI失败模式的因果盲区分析,提出可信AI本质上是因果统计问题。

Comments 18 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22984 2026-05-26 cs.AI 57%

Why Your Deep Research Agent Fails? On Hallucination Evaluation in Full Research Trajectory

为什么你的深度研究智能体会失败?关于完整研究轨迹中的幻觉评估

Yuhao Zhan, Tianyu Fan, Linxuan Huang, Zirui Guo, Chao Huang

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 针对深度研究智能体(DRA)在完整研究轨迹中累积的幻觉问题,提出从结果评估转向过程感知评估的PING分类法和细粒度评估框架,并构建DeepHalluBench基准,实验揭示系统性的可靠性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23780 2026-05-25 cs.AI 57%

Beyond Binary Edits Robust Multimodal Knowledge Editing with Adversarial Subspace Alignment

超越二元编辑:基于对抗子空间对齐的鲁棒多模态知识编辑

Haoyuan Wang, Xiaohao Liu, Jiajie Su, Jianmao Xiao, Chaochao Chen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Jiangxi Normal University(江西师范大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 针对多模态大语言模型知识编辑泛化性不足的问题,提出对抗子空间对齐方法(ASAM),通过潜在对抗鲁棒化(LAR)和秩约束子空间学习(RCSL)实现鲁棒的多模态知识编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19722 2026-05-20 cs.CR cs.AI 57%

Measuring Safety Alignment Effects in Autonomous Security Agents

在自主安全代理中测量安全对齐效应

Isaac David, Arthur Gervais

机构 * University College London(伦敦大学学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种基于轨迹的基准测试,用于评估安全代理在执行漏洞分析任务时的安全对齐效果,发现安全代理的性能差异主要体现在拒绝、不安全行为和工具可靠性等方面,而非单纯的拒绝率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19527 2026-05-20 cs.CV 57%

Dual-Prompt CLIP with Hybrid Visual Encoders for Occluded Person Re-Identification

双提示CLIP与混合视觉编码器用于遮挡行人重识别

Zhangjian Ji, Shaotong Qiao, Kai Feng, Wei Wei

机构 * organization= School of Computer \& Information Technology, Shanxi University , addressline= Wucheng Rd.92 , city= Taiyuan , postcode= 030006 , state= Shanxi , country= China organization= Key Laboratory of Computational Intelligence

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出了一种双提示学习重识别模型DPL-ReID,通过双提示学习策略和现实遮挡增强方法,提升遮挡行人重识别的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19250 2026-05-20 cs.AI 57%

Causal Evidence for Attention Head Imbalance in Modality Conflict Hallucination

因果证据:模态冲突幻觉中的注意力头不平衡

Jinrui Jiang, Zhangtai Wu, Zhen Wu, Xinyu Dai

机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) School of Artificial Intelligence(人工智能学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文研究了多模态大语言模型在模态冲突中产生幻觉的原因,通过分析注意力头的因果作用,发现驱动幻觉的头部分布更广且权重更大,而抑制幻觉的头部集中在少量重要头部,提出MACI方法在减少幻觉的同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18988 2026-05-20 cs.CR cs.AI 57%

Surviving the Unseen: Predictive Defense for Novel Multi-Turn Multimodal Attacks

在不可见中存活:面向新颖多轮多模态攻击的预测防御

Doohee You

机构 * Trust and Safety, Google(谷歌信任与安全部)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出了一种预测性防御方法,用于应对新颖多轮多模态攻击,通过动态生存预测和轨迹动态问题来解决静态防御机制的不足,建立了一个计算高效且可解释的安全保障框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18104 2026-05-19 cs.AI cs.CR 57%

Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction

多模态大语言模型中的安全几何坍缩与自适应漂移修正

Jiahe Guo, Xiangran Guo, Jiaxuan Chen, Weixiang Zhao, Yanyan Zhao, Yutai Hou, Qianchao Wang, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文研究了多模态大语言模型在跨模态安全转移中的不足,提出安全几何坍缩现象,并通过自适应漂移修正方法提升模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏