arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-18 至 2025-12-18 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 2 篇

2512.15663 2025-12-18 cs.AI cs.CL 62%

Explaining the Reasoning of Large Language Models Using Attribution Graphs

通过归因图解释大语言模型的推理过程

Chase Walker, Rickard Ewetz

机构 * University of Florida(佛罗里达大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 CAGE框架通过归因图解释大语言模型的推理过程,提升上下文归因的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14851 2025-12-18 cs.LG 57%

Unreliable Uncertainty Estimates with Monte Carlo Dropout

基于蒙特卡洛滴落的不可靠不确定性估计

Aslak Djupskås, Alexander Johannes Stasik, Signe Riemer-Sørensen

机构 * Department of Data Science, Norwegian University of Life Sciences(数据科学系,挪威生命科学大学) SINTEF AS, Department of Mathematics and Cybernetics(SINTEF公司,数学与自动化系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文指出蒙特卡洛滴落在估计不确定性时不可靠,尤其在插值和外推区域表现不佳,不如传统贝叶斯方法可靠。

Comments Accepted for the Northern Lights Deep Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏