arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-27 至 2026-08-27 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 4 篇

2608.25251 2026-08-27 cs.CV cs.AI 新提交 79%

What Do Medical Vision-Language Models Learn in Radiology? Transfer, Alignment, and Source-Proxy Leakage Under Distribution Shift

医学视觉-语言模型在放射学中学到了什么?分布偏移下的迁移、对齐与源代理泄露

Ayoub Louaye Bouaziz, Lokmane Chebouba, Yassine Himeur

机构 * University of Constantine(康斯坦丁大学) University of Dubai(迪拜大学) University of Western Brittany(西布列塔尼大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI

AI总结 本研究针对医学视觉-语言模型在分布偏移下的失效问题,探究其跨数据集迁移、多模态对齐及源代理泄露特性,发现表观能力掩盖相关失效模式,推动对该类模型的压力测试评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25487 2026-08-27 cs.CL cs.IR 新提交 70%

ReliableRAG: Combating Misinformation in Retrieval-Augmented Generation via Reliability-Guided Reasoning Chains

ReliableRAG:通过可靠性引导推理链对抗检索增强生成中的错误信息

Jinpu Jiang, Xuan Wu, Wenhao Song, Bo Yang, You Zhou, Hongwei Ge, Heow Pueh Lee, Yanchun Liang, Chunguo Wu

机构 * College of Software, Jilin University(吉林大学软件学院) College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院 教育部符号计算与知识工程重点实验室) College of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) National University of Singapore(新加坡国立大学) School of Computer Science, Zhuhai College of Science and Technology(珠海科技学院计算机学院)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 ReliableRAG是首个通过细粒度评估三元组缓解多跳问答中欺骗性错误信息的可靠性驱动框架,可提升RAG系统的事实可靠性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25653 2026-08-27 cs.CV 新提交 50%

Towards Purified Multi-Label Test-Time Adaptation of Vision-Language Models

面向视觉-语言模型的纯化多标签测试时自适应方法

Yiwen Liang, Hui Chen, Yizhe Xiong, Mengyao Lyu, Yuhan Cao, Zijia Lin, Shuaicheng Niu, Sicheng Zhao, Jungong Han, Guiguang Ding

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) University of Washington(华盛顿大学)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 针对视觉-语言模型多标签测试时自适应的缓存方法PuRF,通过区域与缓存纯化解决现有方法的偏差与校准问题,在五项数据集上使ViT-B/32的mAP提升4.05%,性能优于现有最优方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16558 2026-08-27 cs.CV cs.MM 版本更新 50%

Segmentation-Based Attention Entropy: Detecting and Mitigating Object Hallucinations in Large Vision-Language Models

基于分割的注意力熵:在大视觉-语言模型中检测和缓解对象幻觉

Jiale Song, Jiaxin Luo, Xue-song Tang, Kuangrong Hao, Mingbo Zhao

机构 * School of Information and Intelligent Science, Donghua University, Shanghai, 201620, China(信息与智能科学学院,东华大学,上海,201620,中国)

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 本文提出基于分割的注意力熵(SAE),通过语义分割量化视觉注意力不确定性,设计可靠性评分和注意力调整方法,有效缓解大视觉-语言模型中的对象幻觉问题。

Comments Accepted to ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏