arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Cambridge(剑桥大学)

2026-08-31 至 2026-08-31 共收录 3
2608.26159 2026-08-31 cs.CL cs.AI 版本更新

Self-Generated Text Recognition: Quality Heuristics, Cross-Task Transfer, and Downstream Bias in LLM Evaluation

自生成文本识别:LLM评估中的质量启发式、跨任务迁移与下游偏差

Jesse St. Amand, Callum Canavan, Sohaib Imran, Joseph Hewson, Aaron Lutz, Shi Feng, Puria Radmard, Lennie Wells

机构 * George Washington University(乔治·华盛顿大学) Geodesic Research(吉奥戴斯克研究机构) University of Cambridge(剑桥大学)

AI总结 该研究聚焦LLM的自生成文本识别(SGTR)能力,明确了导致过往研究结论分歧的实验设计因素,发现SGTR性能可跨任务迁移,且训练SGTR会引发下游偏差,强调需监控SGTR以保障AI安全。

Comments 31 pages, 9 figures (3 main body, 6 appendix), 18 tables (1 main body, 17 appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26118 2026-08-31 cs.CL 版本更新

ElementCheck: Complexity-Aware Long-Form Text Factuality Evaluation via Sentence Elements

ElementCheck:基于句子元素的复杂度感知长文本事实性评估

Xinming Wang, Haoran Du, Yi Chen, Jian Xu, Hongming Yang, Han Hu, Yulong Chen, Cheng-Lin Liu, Xu-Yao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院) Fudan University(复旦大学) Tencent(腾讯) University of Cambridge(剑桥大学) University of Aberdeen(阿伯丁大学)

AI总结 ElementCheck是一种基于句子元素的复杂度感知框架,通过提取实体对构建元素图,在FastFact-Sent等基准上提升了五个主干模型的长文本事实性验证性能,且优化了准确率与成本的权衡。

Comments EMNLP2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28802 2026-08-31 cs.CL 版本更新

Human Label Variation as Stable Signal: Learning Annotator-Specific Explanation Behavior via Cross-Annotator Preference Optimization

人类标注变异作为稳定信号:通过跨标注者偏好优化学习标注者特定的解释行为

Beiduo Chen, Pingjun Hong, Ziyun Zhang, Benjamin Roth, Anna Korhonen, Barbara Plank

机构 * MaiNLP Center for Information and Language Processing(信息与语言处理中心) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) University of Vienna(维也纳大学) LTL University of Cambridge(剑桥大学)

AI总结 研究大语言模型能否学习并复现标注者特定的标签-解释行为,提出跨标注者偏好优化(CAPO)方法,通过对比目标标注者与其他有效但非目标标注者的响应来提升模仿和归因能力。

Comments Accepted by EMNLP 2026 Main, 46 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏