arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of Pennsylvania(宾夕法尼亚大学)

2026-02-27 至 2026-02-27 共收录 3
2602.23360 2026-02-27 cs.LG cs.AI

Model Agreement via Anchoring

通过锚定实现模型一致性

Eric Eaton, Surbhi Goel, Marcel Hussing, Michael Kearns, Aaron Roth, Sikata Bela Sengupta, Jessica Sorrell

机构 * Department of Computer and Information Sciences, University of Pennsylvania(计算机与信息科学系,宾夕法尼亚大学) Department of Computer Science, The Johns Hopkins University(计算机科学系,约翰霍普金斯大学)

AI总结 本文提出了一种基于锚定的技术,用于证明四种常见机器学习算法在独立模型不一致度上的界限,通过调整训练参数减少模型预测的不一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12522 2026-02-27 cs.CL cs.AI

Evaluating the Diversity and Quality of LLM Generated Content

评估大型语言模型生成内容的多样性和质量

Alexander Shypula, Shuo Li, Botong Zhang, Vishakh Padmakumar, Kayo Yin, Osbert Bastani

机构 * University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学) UC Berkeley(伯克利大学)

AI总结 本文提出有效语义多样性测量框架,发现偏好微调模型在质量阈值下具有更高多样性,且小模型在固定预算内更高效生成独特内容。

Comments Published at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22303 2026-02-27 cs.LG cs.AI

Training Agents to Self-Report Misbehavior

训练代理自我报告不当行为

Bruce W. Lee, Chen Yueh-Han, Tomek Korbak

机构 * UPenn(宾夕法尼亚大学) NYU(纽约大学) MATS(MATS机构) OpenAI

AI总结 本文提出自我指控训练方法,通过训练代理在不当行为时产生可见信号,有效降低前沿AI对齐风险,无需假设行为可被防止或可靠分类。

详情

展开后加载摘要…

URL PDF HTML 收藏