arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Anthropic

2026-09-01 至 2026-09-01 共收录 2
2608.30980 2026-09-01 cs.CL cs.AI 新提交

Evaluating and Improving LLM Self-Modeling

评估与改进大语言模型(LLM)的自我建模能力

Siqi Zeng, Andre N. Assis, Rowan Wang

机构 * Constellation(星群公司) Anthropic(Anthropic公司)

AI总结 本研究针对LLM的自我建模能力,构建基准测试评估其水平,开发合成数据管道结合强化学习提升该能力,发现提升未体现一致内省。

Comments 89 pages, 25 figures. Published as a conference paper at EMNLP '26 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28945 2026-09-01 cs.AI cs.CL 新提交

Automated Researchers Can Reliably Mitigate Alignment Failures

自动研究人员可可靠缓解对齐失败问题

Chen Yueh-Han, Jiaxin Wen, Jan Hendrik Kirchner

机构 * Anthropic UC Berkeley(加州大学伯克利分校)

AI总结 该研究提出自动对齐研究人员(AARs)的训练方法,可在保留通用能力的同时缓解10种对齐失败,其效果优于人类研究人员,且无需人类指导,近期具备可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏