arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Oxford(牛津大学)

2026-01-16 至 2026-01-16 共收录 3
2601.10651 2026-01-16 cs.AI cs.LO

Multi-Property Synthesis

多属性综合

Christoph Weinhuber, Yannik Schnitzer, Alessandro Abate, David Parker, Giuseppe De Giacomo, Moshe Y. Vardi

机构 * University of Oxford(牛津大学) Rice University(里士满大学)

AI总结 该研究提出了一种多属性综合方法,通过固定点计算和符号算法高效实现最大可实现目标集,显著优于传统枚举方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10387 2026-01-16 cs.CL

The Assistant Axis: Situating and Stabilizing the Default Persona of Language Models

助手轴:定位和稳定语言模型的默认人格

Christina Lu, Jack Gallagher, Jonathan Michala, Kyle Fish, Jack Lindsey

机构 * MATS Anthropic Fellows Program University of Oxford(牛津大学) Anthropic

AI总结 研究发现语言模型的默认人格轴影响行为稳定性,通过限制激活区域可防止人格漂移及对抗性突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05465 2026-01-16 cs.AI cs.CL

VAL-Bench: Belief Consistency as a measure for Value Alignment in Language Models

VAL-Bench:信念一致性作为语言模型价值观对齐的度量标准

Aman Gupta, Denny O'Shea, Fazl Barez

机构 * MasterClass University of Oxford(牛津大学) WhiteBox Martian

AI总结 VAL-Bench通过评估语言模型在现实价值相关提示中的信念一致性,提出了一种衡量价值观对齐的新基准,揭示了不同模型在一致性上的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏