Explaining the Reasoning of Large Language Models Using Attribution Graphs
通过归因图解释大语言模型的推理过程
机构 * University of Florida(佛罗里达大学)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI
AI总结 CAGE框架通过归因图解释大语言模型的推理过程,提升上下文归因的准确性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
通过归因图解释大语言模型的推理过程
机构 * University of Florida(佛罗里达大学)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI
AI总结 CAGE框架通过归因图解释大语言模型的推理过程,提升上下文归因的准确性。
基于蒙特卡洛滴落的不可靠不确定性估计
机构 * Department of Data Science, Norwegian University of Life Sciences(数据科学系,挪威生命科学大学) ; SINTEF AS, Department of Mathematics and Cybernetics(SINTEF公司,数学与自动化系)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
AI总结 本文指出蒙特卡洛滴落在估计不确定性时不可靠,尤其在插值和外推区域表现不佳,不如传统贝叶斯方法可靠。
Comments Accepted for the Northern Lights Deep Learning 2026