arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Southern California(南加州大学)

2026-01-16 至 2026-01-16 共收录 2
2510.07662 2026-01-16 cs.CL cs.CY

Textual Entailment is not a Better Bias Metric than Token Probability

文本蕴含不是比标记概率更好的偏见度量标准

Virginia K. Felkner, Allison Lim, Jonathan May

机构 * Information Sciences Institute University of Southern California(信息科学研究所 美国南加州大学)

AI总结 本文通过实验表明,自然语言推理(NLI)与标记概率(TP)在评估语言模型偏见时表现不同,NLI更不稳定且对刻板印象句子更敏感,因此不推荐作为TP的替代方案。

Comments 12 pages, 1 figure. Substantial revisions following October 2025 ARR Cycle. Currently under review in January 2026 ARR Cycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03716 2026-01-16 cs.LG cs.AI cs.CY

Evaluating Large Language Models for Fair and Reliable Organ Allocation

评估大型语言模型以实现公平和可靠的器官分配

Brian Hyeongseok Kim, Hannah Murray, Isabelle Lee, Jason Byun, Joshua Lum, Dani Yogatama, Evi Micha

机构 * University of Southern California(南加州大学)

AI总结 本文评估了大型语言模型在器官分配中的公平性,发现基于暴露的指标显示公平结果,而基于概率的指标揭示了系统性的偏好排序,强调了对公平性评估和人类监督的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏