arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Amazon(亚马逊)

2026-08-28 至 2026-08-28 共收录 4
2608.27268 2026-08-28 cs.AI cs.CL cs.HC 新提交

BrailleBench: Investigating Multi-Criteria Braille Comprehension in Large Language Models

BrailleBench:探究大型语言模型的多准则盲文理解能力

Jinghan Zhang, Fengran Mo, Zhiyu Chen, Xiaoyan Han, Kunpeng Liu, Chang-Tien Lu

机构 * Rochester Institute of Technology(罗切斯特理工学院) Amazon.com, Inc.(亚马逊公司) Virginia Tech(弗吉尼亚理工大学)

AI总结 本研究推出盲文理解基准BrailleBench,评估6款LLMs的盲文处理能力,发现其印刷体英语能力与盲文可及性存在差距,为盲文AI系统开发提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26432 2026-08-28 cs.SD cs.AI cs.CL 新提交

SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning

SpeechGym:一种用于通过强化学习训练语音智能体的原生音频 Gym

Jiajun Fan, Jingyuan Li, Prashanth Gurunath Shivakumar, Jia-Hong Huang, Qi Luo, M. Maruf, Ivan Bulyko, Ge Liu, Roger Ren

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon AGI Foundations(亚马逊AGI基础研究部)

AI总结 研究针对语音智能体训练中梯度无法流动、难以强化学习的问题,提出原生音频环境 SpeechGym,用每轮过程奖励解决稀疏性问题,使开放权重模型在语音基准上任务成功率翻倍且排名提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26319 2026-08-28 cs.CL cs.LG 新提交

When Is Noise Response Universal? Tokenization as the Hidden Variable in Language Models

噪声响应何时具有普适性?语言模型中作为隐藏变量的分词

Yefan Tao, Gerald Friedland, Luyang Kong

机构 * Amazon(亚马逊)

AI总结 该研究发现语言模型对噪声的响应一致性取决于噪声规模,核心是训练目标而非架构,追溯到分词机制,可用于预测和提升模型抗噪声能力。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26180 2026-08-28 cs.CL cs.AI 新提交

PACEShop: Evaluating Personalized, Actionable, Compositional, and Evidence-grounded Shopping Assistants

PACEShop:评估个性化、可操作、可组合且基于证据的购物助手

Weimin Lyu, Chen Luo, Guangrui Li, Yaochen Xie, Dhineshkumar Ramasubbu, Arief Koesdwiady, Wanqiu Long, Hansu Gu, Yutong Chen, Zheshen Wang, Dakuo Wang, Yi Liu

机构 * Amazon(亚马逊) Northeastern University(东北大学) Expedia(亿客行)

AI总结 针对现有购物助手评估基准未覆盖结构化回复联合评估目标的问题,提出 PACE 评估框架,构建含 22625 条记录的 PACEShop 基准数据集和 PACEJudge 协议,验证任务匹配输出契约对评估的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏