arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-24 至 2026-08-24 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 5 篇

2608.19816 2026-08-24 cs.CY 版本更新 86%

Understanding as an Explicit and Assessable Component of Frontier AI Safety Decisions

将理解作为前沿AI安全决策的明确且可评估的组成部分

Stephen Barrett, Robin Bloomfield, Alexandra Chirilă, Mamoon Masud, David Meredith Hardy, Phillip Mulvana

专题命中 幻觉与事实性 :safety(title,abstract);AI safety(title);分类 cs.CY

AI总结 该研究提出一种基于Assurance 2.0框架的临时方法,用于明确且可评估前沿AI安全决策中的理解,经两种场景测试,该方法可应用且能驱动工程工作。

Comments Changed first line of abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20166 2026-08-24 cs.CL cs.HC 版本更新 70%

Trust Stack for Mental Health AI: A Survey of Calibration across Human, Interaction, and AI Layers

对心理健康支持中的人机交互信任进行对齐:多利益相关者的调查与立场

Xin Sun, Yue Su, Yifan Mo, Qingyu Meng, Yuxuan Li, Min Chen, Mengyuan Zhang, Saku Sugawara, Charlotte Gerritsen, Sander L. Koole, Koen Hindriks, Jiahuan Pei

机构 * National Institute of Informatics (NII)(日本国立信息学研究所) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文提出三层信任框架,整合关键利益相关者观点,系统回顾心理健康领域AI研究,指出NLP与实际需求间的差距,提出构建社会技术一致且真实可信的AI研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10573 2026-08-24 cs.CL cs.LG 版本更新 62%

The Intrinsic Dimension of Prompts in Internal Representations of Large Language Models

大语言模型内部表示中提示的固有维度

Karthik Viswanathan, Yuri Gardinazzi, Giada Panerai, Alberto Cazzaniga, Matteo Biagetti

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过固有维度视角分析大语言模型提示的内部表示几何,发现其与下一个 token 不确定性等相关,训练的线性探测模型可在生成前区分恶意与良性提示,准确率优于现有安全工具,为 LLM 安全提供了新信号。

Comments 12+14 pages, 18 figures, matches published version on Transactions of Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21142 2026-08-24 cs.LG 新提交 57%

COEC: Calibrated Orthogonal-Equivalence Compensation for Structured Pruning of Large Language Models

COEC:面向大语言模型结构化剪枝的校准正交等价补偿

Peiqi Yu, Nam Ling, Wei Wang, Wei Jiang

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本研究提出无训练补偿框架COEC,将其应用于Llama-3等模型的结构化剪枝,可提升剪枝后模型的困惑度与零样本准确率,在高稀疏度下增益更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10725 2026-08-24 cs.CV cs.SC 版本更新 50%

Rethinking LLM Verification: Evidence Structure, Uncertainty, and Selective Refinement

重新思考大语言模型验证:证据结构、不确定性与选择性优化

Uma Ranjan, Kunal Tilaganji, Aditya Koul, Anurag Mahipal, Dashpreet Singh, Hriday Rana, Manan Jain, Sidharth Gupta, Ajo Babu George, Vineeth Balasubramanian, Nagarajan Natarajan, Amit Sharma

机构 * Indian Institute of Technology Jammu(贾姆穆印度理工学院) Microsoft Research(微软研究院) SCB Dental College and Hospital(SCB牙科学院与医院)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 该研究针对LLMs医疗应用的安全问题,提出两阶段框架,利用模型弃权信号优化推理,在GPT-5.5、DeepSeek-R1模型及MedReason、MedQA数据集上显著提升了医疗假设验证的准确率。

Comments Withdrawn by the authors due to premature submission before final review

详情

展开后加载摘要…

URL PDF HTML 收藏