arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-21 至 2025-11-21 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 5 篇

2511.00588 2025-11-21 cs.LG cs.AI cs.CY 75%

Diagnosing Hallucination Risk in AI Surgical Decision-Support: A Sequential Framework for Sequential Validation

诊断人工智能手术决策支持中的幻觉风险:一种用于序列验证的连续框架

Dong Chen, Yanzhe Wei, Zonglin He, Guan-Ming Kuang, Canhua Ye, Meiru An, Huili Peng, Yong Hu, Huiren Tao, Kenneth MC Cheung

机构 * Orthopaedic Centre, The University of Hong Kong - Shenzhen Hospital(香港大学深圳医院骨科中心) Translational Medicine Centre, The University of Hong Kong - Shenzhen Hospital(香港大学深圳医院转化医学中心) Department of Orthopaedics & Traumatology, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院骨科与创伤外科部)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出了一种用于评估人工智能手术决策支持系统幻觉风险的连续框架,通过多维度测试揭示模型在复杂性下的脆弱性,并强调了增强推理能力的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01533 2025-11-21 cs.CR cs.CY 70%

LightDefense: A Lightweight Uncertainty-Driven Defense against Jailbreaks via Shifted Token Distribution

LightDefense: 一种基于不确定性驱动的轻量级对抗劫持防御方法通过移位词分布

Zhuoran Yang, Yanyong Zhang

专题命中 幻觉与事实性 :safety(abstract);jailbreak(abstract);分类 cs.CY

AI总结 LightDefense通过调整词元分布和利用模型不确定性,提供了一种轻量级的对抗劫持防御方法,有效提升LLM的安全性同时保持对正常查询的有用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13246 2025-11-21 cs.CL cs.AI 62%

Atomic Calibration of LLMs in Long-Form Generations

大语言模型在长文本生成中的原子校准

Caiqi Zhang, Ruihan Yang, Zhisong Zhang, Xinting Huang, Sen Yang, Dong Yu, Nigel Collier

机构 * University of Cambridge(剑桥大学) Fudan University(复旦大学) Tencent AI Lab(腾讯AI实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出原子校准方法,用于改进大语言模型在长文本生成中的校准能力,揭示置信度方法与生成过程中置信度变化的关联。

Comments ACL 2025 KnowFM Oral / AACL-IJCNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16333 2025-11-21 cs.LG 57%

Beyond Generative AI: World Models for Clinical Prediction, Counterfactuals, and Planning

超越生成式AI:用于临床预测、反事实和规划的世界模型

Mohammad Areeb Qazi, Maryam Nadeem, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫莫德·本·扎伊德人工智能大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文探讨了世界模型在医疗领域中的应用,旨在通过预测动态、反事实评估和规划提升临床决策的可靠性。

Comments 2 Figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15921 2025-11-21 cs.AI 57%

Thinking, Faithful and Stable: Mitigating Hallucinations in LLMs

思考、忠实与稳定:减轻大语言模型幻觉的方法

Chelsea Zou, Yiheng Yao, Basant Khalil

机构 * Stanford University(斯坦福大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本研究提出一种通过强化学习策略减少大语言模型幻觉的方法,通过置信度对齐和熵激增信号提升推理的连贯性和准确性。

Comments Originally released June 5, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏