arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-30 至 2025-12-30 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 4 篇

2512.23508 2025-12-30 cs.AI cs.GT 84%

Why AI Safety Requires Uncertainty, Incomplete Preferences, and Non-Archimedean Utilities

为何人工智能安全需要不确定性、不完全偏好和非阿基米德效用

Alessio Benavoli, Alessandro Facchini, Marco Zaffalon

机构 * School of Computer Science and Statistics, Trinity College Dublin(特里尼蒂大学计算机科学与统计学学院) Trinity Quantum Alliance, Trinity College Dublin(特里尼蒂量子联盟) Management in Networked and Digital Societies (MINDS) Department, Kozminski University(科津斯基大学网络化与数字化社会管理系)

专题命中 幻觉与事实性 :safety(title);AI safety(title);分类 cs.AI

AI总结 本文探讨了人工智能安全需通过不确定性推理、不完全偏好处理和非阿基米德效用机制来实现

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23547 2025-12-30 cs.CL cs.AI 62%

Lie to Me: Knowledge Graphs for Robust Hallucination Self-Detection in LLMs

对谎言说谎:知识图谱在大语言模型鲁棒性幻觉自检测中的应用

Sahil Kale, Antonio Luca Alfeo

机构 * eCampus University(eCampus大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出利用知识图谱提升大语言模型幻觉自检的鲁棒性,通过转换响应为图谱并估算幻觉可能性,实现准确率和F1分数的显著提升。

Comments Accepted to ICPRAM 2026 in Marbella, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22245 2025-12-30 cs.LG cs.AI 62%

Calibrating LLM Judges: Linear Probes for Fast and Reliable Uncertainty Estimation

校准大语言模型法官:用于快速可靠不确定性估计的线性探针

Bhaktipriya Radharapu, Eshika Saxena, Kenneth Li, Chenxi Whitehouse, Adina Williams, Nicola Cancedda

机构 * FAIR at Meta(Meta 的 FAIR 研究所) Meta Superintelligence Labs(Meta 超智能实验室)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于线性探针的校准方法,通过Brier分数损失训练,实现快速可靠的LLM法官不确定性估计,相比现有方法在计算效率和泛化能力上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22189 2025-12-30 cs.LG 57%

Physics-Informed Machine Learning for Transformer Condition Monitoring -- Part II: Physics-Informed Neural Networks and Uncertainty Quantification

基于物理的机器学习用于变压器状态监测 -- 第二部分:基于物理的神经网络和不确定性量化

Jose I. Aizpurua

机构 * University of the Basque Country (UPV/EHU)(巴斯克大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出基于物理的神经网络和贝叶斯框架,用于变压器状态监测中的不确定性量化与预测。

Comments 7 pages, 8 figures, published as conference paper in IEEE Advanced Research Workshop on Transformers 2025 as part of the Tutorial delivered with the title "Physics-informed Machine Learning for Transformer Condition Monitoring"

Journal ref 8th International Advanced Research Workshop on Transformers (ARWtr), Baiona, Spain, 2025, pp. 95-101

详情

展开后加载摘要…

URL PDF HTML 收藏