arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-31 至 2026-08-31 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 5 篇

2608.28058 2026-08-31 cs.CV cs.AI 新提交 79%

Dynamic Alignment Compensation for Hallucination Mitigation in Large Vision-Language Models

用于减轻大型视觉语言模型幻觉的动态对齐补偿

Kairong Yu, Zixin Zhu, Le Yu, Hongwei Wang

机构 * Zhejiang University(浙江大学) Southeast University(东南大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI

AI总结 针对大型视觉语言模型的幻觉问题,提出无需训练的推理时方法动态对齐补偿,结合分层语义补偿与序列语义校正,在9个多模态基准上可减少幻觉并保持整体性能。

Comments Accepted by EMNLP2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28382 2026-08-31 cs.CL cs.AI 新提交 62%

When Linguistic and Internal Confidence Diverge in Large Language Models

当大型语言模型的语言置信度与内部置信度出现偏差时

Hefan Zhang, Bingquan Zhang, Ming Cheng, Saeed Hassanpour, Weicheng Ma, Soroush Vosoughi

机构 * Dartmouth College(达特茅斯学院) Oakland University(奥克兰大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究对比大型语言模型的语言置信度与内部置信度,发现二者常出现偏差,提出需用多维度诊断评估语言置信度后再用于下游可靠性流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28052 2026-08-31 cs.LG cs.AI 新提交 62%

Explainable Uncertainty Estimation for Reliable Medical AI

面向可靠医疗AI的可解释不确定性估计

Li Rong Wang, Jamie Duell, Xinran Xu, Thomas C. Henderson, Yu Yue Hew, Pik Wan Erica Chiang, Xiao Wei Alstar Ang, Bingwen Eugene Fan, Xiuyi Fan

机构 * College of Computing and Data Science (CCDS)(计算与数据科学学院) Nanyang Technological University (NTU)(南洋理工大学) A*STAR Centre for Frontier AI Research(新加坡科技研究局前沿人工智能研究中心) School Of Computing and Digital Technologies(计算与数字技术学院) Sheffield Hallam University(谢菲尔德哈勒姆大学) School of Computing(计算机学院) University of Utah(犹他大学) Tan Tock Seng Hospital (TTSH)(陈笃生医院) Lee Kong Chian School of Medicine(李光前医学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出将不确定性估计与XAI统一的egRUE方法,可量化并分解不确定性为特征贡献,经实验和专家研究验证,能提升医疗AI的可靠性与可解释性,优化临床决策支持。

Comments Accepted at the 26th IEEE International Conference on Data Mining (ICDM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27860 2026-08-31 cs.CV cs.AI 新提交 57%

From Perspective to Fisheye Depth Estimation and Open-Vocabulary Segmentation

从透视图像到鱼眼图像的深度估计与开放词汇分割

Rit Gangopadhyay, Alex Wong

机构 * Yale University(耶鲁大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 该研究提出了与架构、任务无关的Distortion Extenders(DEX),通过自监督对齐损失将视觉基础模型泛化到鱼眼相机,在深度估计和开放词汇分割任务中优于基线,还可用于相机校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27847 2026-08-31 cs.AI 新提交 57%

From Uncertainty to Clinical Risk: Severity-Aware Conformal Planning for Interactive Medical Diagnosis

从不确定性到临床风险:面向交互式医疗诊断的严重程度感知共形规划

Yue Zhou, Haiyang Zhou, Jin Zhang, Kong Wang, Yongxin Ni, Youhua Li, Hanwen Du

机构 * Lanzhou University(兰州大学) Hunan University(湖南大学) National University of Singapore(新加坡国立大学) City University of Hong Kong(香港城市大学) The Ohio State University(俄亥俄州立大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 该研究针对交互式医疗诊断漏诊重症的风险与长程规划缺失问题,提出严重程度感知共形临床规划框架,在DDXPlus和MediQ上提升了诊断准确性、鉴别质量并降低了高风险错误。

详情

展开后加载摘要…

URL PDF HTML 收藏