RADIUS: Ranking, Distribution, and Significance - A Comprehensive Alignment Suite for Survey Simulation
RADIUS:排名、分布与显著性——面向调查模拟的全面对齐套件
机构 * Amazon(亚马逊)
AI总结 本文提出RADIUS,一种用于调查模拟的二维对齐套件,通过排名对齐和分布对齐及显著性测试,改进了现有评估指标的不足,提供可重复的开源实现。
大厂专区
RADIUS:排名、分布与显著性——面向调查模拟的全面对齐套件
机构 * Amazon(亚马逊)
AI总结 本文提出RADIUS,一种用于调查模拟的二维对齐套件,通过排名对齐和分布对齐及显著性测试,改进了现有评估指标的不足,提供可重复的开源实现。
Perceptio:通过空间标记生成增强视觉语言模型
机构 * Amazon(亚马逊)
AI总结 Perceptio通过生成2D和3D空间标记提升视觉语言模型的空间推理能力,结合语义分割和深度标记实现更精确的空间理解,提升多个基准测试性能。
MemMA:通过多智能体推理和现场自进化协调内存循环
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; Amazon(亚马逊) ; Microsoft(微软)
AI总结 MemMA通过多智能体推理和现场自进化协调内存循环,解决内存循环正向路径的战略盲区和反向路径的稀疏延迟监督问题,提升长周期交互性能。
Comments 23 pages, 5 figures
Calibeating:在自身游戏中击败预测者
机构 * Hebrew University of Jerusalem, Center for Rationality DP-743(特拉维夫大学, 理性中心 DP-743) ; University of Pennsylvania(宾夕法尼亚大学) ; Amazon(亚马逊)
AI总结 本文提出通过改进校准而不损失专业性的方法,实现预测者之间的竞争,探讨校准与专业性的平衡问题。
Comments Corrected Appendix A.7 + new Appendix A.10. Included: Addendum and Errata to the published journal version (Theoretical Economics, 2023) and to arXiv previous version v2 (2022). Web page: http://www.ma.huji.ac.il/hart/publ.html#calib-beat
Journal ref Theoretical Economics 18 (2023), 4, 1441-1474
跨语言LLM判断转移 via 评估分解
机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) ; Amazon(亚马逊)
AI总结 本文提出基于通用标准集的评估框架,通过分解方法实现跨语言LLM判断转移,无需目标语言标注即可在多种语言和模型上提升评估性能。
Comments 19 pages