arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-15 至 2025-12-15 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 3 篇

2502.11028 2025-12-15 cs.CL cs.AI 73%

Mind the Confidence Gap: Overconfidence, Calibration, and Distractor Effects in Large Language Models

注意置信差距:大型语言模型中的过度自信、校准与干扰效应

Prateek Chhikara

机构 * University of Southern California(美国南加州大学)

专题命中 幻觉与事实性 :RLHF(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了大型语言模型中的过度自信问题,通过引入干扰项显著改善校准,提出针对性的改进策略以提升模型可靠性。

Comments Published in Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11750 2025-12-15 eess.SY cs.LG cs.SY 57%

LUCID: Learning-Enabled Uncertainty-Aware Certification of Stochastic Dynamical Systems

LUCID:基于学习的不确定性感知随机动力系统认证

Ernesto Casablanca, Oliver Schön, Paolo Zuliani, Sadegh Soudjani

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 LUCID通过学习控制障碍证书和傅里叶核展开,为随机动态系统提供鲁棒且高效的认证框架,实现形式安全保证。

Comments The manuscript has been accepted for publication in the main track of AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11096 2025-12-15 cs.HC 50%

Your plan may succeed, but what about failure? Investigating how people use ChatGPT for long-term life task planning

你的计划可能成功,但失败呢?探究人们如何利用ChatGPT进行长期生活任务规划

Ben Wang, Jiqun Liu

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 研究探讨人们如何利用ChatGPT进行长期生活任务规划,发现AI在结构化目标和生成想法方面有帮助,但输出缺乏个性化和适应性,需用户主动调整。

详情

展开后加载摘要…

URL PDF HTML 收藏