arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-10 至 2025-10-10 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 3 篇

2503.00269 2025-10-10 cs.LG cs.AI cs.CL cs.CY 85%

Reducing Large Language Model Safety Risks in Women's Health using Semantic Entropy

Jahan C. Penny-Dimri, Magdalena Bachmann, William R. Cooke, Sam Mathewlynn, Samuel Dockree, John Tolladay, Jannik Kossen, Lin Li, Yarin Gal, Gabriel Davis Jones

机构 * Oxford Digital Health Labs, Nuffield Department of Women’s and Reproductive Health(牛津数字健康实验室,女性与生殖健康系) University of Oxford(牛津大学) Oxford University Hospitals NHS Foundation Trust(牛津大学医院 NHS 基础信托) OATML, Department of Computer Science(OATML,计算机科学系)

专题命中 幻觉与事实性 :safety(title,abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 15 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08389 2025-10-10 cs.AI 57%

Revisiting Hallucination Detection with Effective Rank-based Uncertainty

Rui Wang, Zeming Wei, Guanzhang Yue, Meng Sun

机构 * Peking University(北京大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16922 2025-10-10 cs.CL 57%

UNCLE: Benchmarking Uncertainty Expressions in Long-Form Generation

Ruihan Yang, Caiqi Zhang, Zhisong Zhang, Xinting Huang, Dong Yu, Nigel Collier, Deqing Yang

机构 * Fudan University(复旦大学) University of Cambridge(剑桥大学) Tencent AI Lab(腾讯AI实验室) City University of Hong Kong(香港城市大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏