arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Anthropic

2026-05-26 至 2026-05-26 共收录 4
2605.25459 2026-05-26 cs.LG cs.AI

From Simulation to Enaction: Post-trained language models recognize and react to their own generations

从模拟到行动:后训练语言模型识别并回应自身生成

Asvin G., Jack Lindsey

机构 * Institute for Advanced Study, Princeton(普林斯顿高级研究院) Anthropic

AI总结 本文发现后训练语言模型能够识别自身生成(on-policy)并降低输出熵,通过内部表示输入意外性来调节,且显式识别与隐式识别机制不同。

Comments Anthropic fellows project mentored by Jack Lindsey

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26418 2026-05-26 cs.AI

Chain-of-Thought Hijacking

思维链劫持

Jianli Zhao, Tingchen Fu, Rylan Schaeffer, Mrinank Sharma, Fazl Barez

机构 * Independent(独立) University of Oxford(牛津大学) Stanford University(斯坦福大学) Anthropic Martian Core

AI总结 提出思维链劫持攻击,通过诱导大型推理模型进行长时间良性推理来削弱其拒绝有害请求的能力,实现高成功率越狱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24286 2026-05-26 cs.LG cs.CL

Faithfulness as Information Flow: Evaluating and Training Faithful Chain-of-Thought Reasoning

忠实性作为信息流:评估与训练忠实的链式思维推理

Jinghan Jia, Joe Benton, Eric Easley

机构 * Dept. CSE, Michigan State University(密歇根州立大学计算机科学系) Anthropic

AI总结 通过信息流视角提出基于充分性、完整性和必要性的框架,结合熵、掩码KL和梯度诊断评估链式思维忠实性,并引入更新时干预(如注意力掩码、反向梯度掩码等)训练更忠实的推理模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24229 2026-05-26 cs.AI

How Well Do Models Follow Their Constitutions?

模型遵循其宪法的程度如何?

Arya Jakkli, Senthooran Rajamanoharan, Neel Nanda

机构 * Anthropic

AI总结 提出多方法审计流程,评估前沿AI模型在对抗性多轮交互中遵循其书面行为规范(如Anthropic宪法和OpenAI模型规范)的程度,发现新一代模型违规率显著下降。

Comments 37 pages including appendix. Code, tenet lists, and full transcripts: https://github.com/ajobi-uhc/constitution-audits. Companion blog post on LessWrong/AI Alignment Forum: https://www.lesswrong.com/posts/Tk4SF8qFdMrzGJGGw/how-well-do-models-follow-their-constitutions

详情

展开后加载摘要…

URL PDF HTML 收藏