arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-24 至 2026-08-24 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 3 篇

2505.11924 2026-08-24 cs.CL cs.AI cs.LG 版本更新 67%

Explaining Intrinsic Moral Self-Correction with Mechanistic Interpretability

大语言模型中的内在自我修正:通过机制可解释性实现可解释的提示

Yu-Ting Lee, Fu-Chieh Chang, Yu-En Shu, Hui-Ying Shih, Pei-Yuan Wu

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taipei, Taiwan(通讯工程研究院,国立台湾大学) MediaTek Research, Taipei, Taiwan(联发科研究,台北,台湾) Department of Electrical Engineering, National Taiwan University, Taipei, Taiwan(电气工程系,国立台湾大学) Department of Electrical Engineering, National Tsing Hua University, Hsinchu, Taiwan(电气工程系,国立清华大学) AI Research Center (AINTU), National Taiwan University, Taipei, Taiwan(人工智能研究中心(AINTU),国立台湾大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过机制可解释性揭示大语言模型中内在自我修正的机制,证明提示引导隐藏表示偏移是其核心驱动因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20421 2026-08-24 cs.CY cs.AI 新提交 62%

Six misconceptions about large language models: A minimal model and diagnostic taxonomy

大型语言模型的六大误解:一个极简模型与诊断分类法

Zhicheng Lin

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 该研究提出以四组区分为核心的LLM极简模型,诊断六大误解,应用于出版商AI政策案例,为纠正民间理论错误提供诊断工具。

Comments 20 pages, 1 figure, 2 tables, and 2 boxes. Published in PNAS Nexus

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20413 2026-08-24 q-bio.GN 新提交 50%

BioFirewall: A genome-writing-native governance layer for design-stage biosecurity screening of agentic AI

BioFirewall:面向智能体AI设计阶段生物安全筛查的基因组写入原生治理层

Anees Ahmed Mahaboob Ali, Radhakrishnan Delhibabu, Everette Jacob Remington Nelson

专题命中 AI治理与伦理 :prompt injection(abstract)

AI总结 针对智能体AI基因组编辑设计阶段的生物安全管控缺口,提出BioFirewall中间件,其在多维度筛查中表现优于大模型,能有效抵御攻击且假拒绝率低,已开源并附带可复现基准。

详情

展开后加载摘要…

URL PDF HTML 收藏