arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-29 至 2025-10-29 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 2 篇

2510.24368 2025-10-29 cs.LG 57%

Filtering instances and rejecting predictions to obtain reliable models in healthcare

Maria Gabriela Valeriano, David Kohan Marzagão, Alfredo Montelongo, Carlos Roberto Veiga Kiffer, Natan Katz, Ana Carolina Lorena

机构 * Instituto de Computação(计算研究所) Universidade Estadual de Campinas(Campinas州立大学) Department of Informatics(信息学院) King’s College London(伦敦国王学院) Núcleo de Telessaúde(远程医疗中心) Universidade Federal do Rio Grande do Sul(鲁汶联邦大学) Escola Paulista de Medicina(巴西圣保罗医学学院) Universidade Federal de São Paulo(圣保罗联邦大学) Divisão de Ciência da Computação(计算机科学部) Instituto Tecnológico de Aeronáutica(航空技术研究所)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments This paper is under review at Machine Learning (Springer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23464 2025-10-29 cs.AI 57%

The Confidence Paradox: Can LLM Know When It's Wrong

Sahil Tripathi, Md Tabrez Nafis, Imran Hussain, Jiechao Gao

机构 * Jamia Hamdard(贾迈亚哈姆达德大学) Center for SDGC, Stanford University(SDGC中心,斯坦福大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

Comments Accepted at the 14th IJCNLP & 4th AACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏