arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Amazon(亚马逊)

2026-03-20 至 2026-03-20 共收录 5
2603.19002 2026-03-20 cs.CL

RADIUS: Ranking, Distribution, and Significance - A Comprehensive Alignment Suite for Survey Simulation

RADIUS:排名、分布与显著性——面向调查模拟的全面对齐套件

Weronika Łajewska, Paul Missault, George Davidson, Saab Mansour

机构 * Amazon(亚马逊)

AI总结 本文提出RADIUS,一种用于调查模拟的二维对齐套件,通过排名对齐和分布对齐及显著性测试,改进了现有评估指标的不足,提供可重复的开源实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18795 2026-03-20 cs.CV cs.AI

Perceptio: Perception Enhanced Vision Language Models via Spatial Token Generation

Perceptio:通过空间标记生成增强视觉语言模型

Yuchen Li, Amanmeet Garg, Shalini Chaudhuri, Rui Zhao, Garin Kessler

机构 * Amazon(亚马逊)

AI总结 Perceptio通过生成2D和3D空间标记提升视觉语言模型的空间推理能力,结合语义分割和深度标记实现更精确的空间理解,提升多个基准测试性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18718 2026-03-20 cs.AI

MemMA: Coordinating the Memory Cycle through Multi-Agent Reasoning and In-Situ Self-Evolution

MemMA:通过多智能体推理和现场自进化协调内存循环

Minhua Lin, Zhiwei Zhang, Hanqing Lu, Hui Liu, Xianfeng Tang, Qi He, Xiang Zhang, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊) Microsoft(微软)

AI总结 MemMA通过多智能体推理和现场自进化协调内存循环,解决内存循环正向路径的战略盲区和反向路径的稀疏延迟监督问题,提升长周期交互性能。

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.04892 2026-03-20 econ.TH cs.GT cs.LG stat.ML

"Calibeating": Beating Forecasters at Their Own Game

Calibeating:在自身游戏中击败预测者

Dean P. Foster, Sergiu Hart

机构 * Hebrew University of Jerusalem, Center for Rationality DP-743(特拉维夫大学, 理性中心 DP-743) University of Pennsylvania(宾夕法尼亚大学) Amazon(亚马逊)

AI总结 本文提出通过改进校准而不损失专业性的方法,实现预测者之间的竞争,探讨校准与专业性的平衡问题。

Comments Corrected Appendix A.7 + new Appendix A.10. Included: Addendum and Errata to the published journal version (Theoretical Economics, 2023) and to arXiv previous version v2 (2022). Web page: http://www.ma.huji.ac.il/hart/publ.html#calib-beat

Journal ref Theoretical Economics 18 (2023), 4, 1441-1474

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18557 2026-03-20 cs.CL

Cross-Lingual LLM-Judge Transfer via Evaluation Decomposition

跨语言LLM判断转移 via 评估分解

Ivaxi Sheth, Zeno Jonke, Amin Mantrach, Saab Mansour

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) Amazon(亚马逊)

AI总结 本文提出基于通用标准集的评估框架,通过分解方法实现跨语言LLM判断转移,无需目标语言标注即可在多种语言和模型上提升评估性能。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏