arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Amazon(亚马逊)

2026-08-28 至 2026-08-28 共收录 9
2608.27268 2026-08-28 cs.AI cs.CL cs.HC 新提交

BrailleBench: Investigating Multi-Criteria Braille Comprehension in Large Language Models

BrailleBench:探究大型语言模型的多准则盲文理解能力

Jinghan Zhang, Fengran Mo, Zhiyu Chen, Xiaoyan Han, Kunpeng Liu, Chang-Tien Lu

机构 * Rochester Institute of Technology(罗切斯特理工学院) Amazon.com, Inc.(亚马逊公司) Virginia Tech(弗吉尼亚理工大学)

AI总结 本研究推出盲文理解基准BrailleBench,评估6款LLMs的盲文处理能力,发现其印刷体英语能力与盲文可及性存在差距,为盲文AI系统开发提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26432 2026-08-28 cs.SD cs.AI cs.CL 新提交

SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning

SpeechGym:一种用于通过强化学习训练语音智能体的原生音频 Gym

Jiajun Fan, Jingyuan Li, Prashanth Gurunath Shivakumar, Jia-Hong Huang, Qi Luo, M. Maruf, Ivan Bulyko, Ge Liu, Roger Ren

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon AGI Foundations(亚马逊AGI基础研究部)

AI总结 研究针对语音智能体训练中梯度无法流动、难以强化学习的问题,提出原生音频环境 SpeechGym,用每轮过程奖励解决稀疏性问题,使开放权重模型在语音基准上任务成功率翻倍且排名提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26319 2026-08-28 cs.CL cs.LG 新提交

When Is Noise Response Universal? Tokenization as the Hidden Variable in Language Models

噪声响应何时具有普适性?语言模型中作为隐藏变量的分词

Yefan Tao, Gerald Friedland, Luyang Kong

机构 * Amazon(亚马逊)

AI总结 该研究发现语言模型对噪声的响应一致性取决于噪声规模,核心是训练目标而非架构,追溯到分词机制,可用于预测和提升模型抗噪声能力。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26180 2026-08-28 cs.CL cs.AI 新提交

PACEShop: Evaluating Personalized, Actionable, Compositional, and Evidence-grounded Shopping Assistants

PACEShop:评估个性化、可操作、可组合且基于证据的购物助手

Weimin Lyu, Chen Luo, Guangrui Li, Yaochen Xie, Dhineshkumar Ramasubbu, Arief Koesdwiady, Wanqiu Long, Hansu Gu, Yutong Chen, Zheshen Wang, Dakuo Wang, Yi Liu

机构 * Amazon(亚马逊) Northeastern University(东北大学) Expedia(亿客行)

AI总结 针对现有购物助手评估基准未覆盖结构化回复联合评估目标的问题,提出 PACE 评估框架,构建含 22625 条记录的 PACEShop 基准数据集和 PACEJudge 协议,验证任务匹配输出契约对评估的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22126 2026-08-28 cs.LG cs.CL 版本更新

Decoupled Physical Modeling and Execution for Physics Reasoning

用于物理推理的解耦物理建模与执行

Ye Zhang, Xuehang Guo, Rui Pan, Pengfei Yu, Denghui Zhang, Manling Li, Qingyun Wang

机构 * University of Pennsylvania(宾夕法尼亚大学) William & Mary(威廉玛丽学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司) Stevens Institute of Technology(史蒂文斯理工学院) Northwestern University(西北大学)

AI总结 该研究提出解耦物理建模与执行的统一框架,通过两阶段后训练策略提升小型大语言模型物理推理性能,在多个基准上实现约3%的平均性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08139 2026-08-28 cs.CV cs.AI 版本更新

Subspace Alignment for Vision-Language Model Test-time Adaptation

子空间对齐用于视觉-语言模型测试时适应

Zhichen Zeng, Wenxuan Bao, Xiao Lin, Ruizhong Qiu, Tianxin Wei, Xuying Ning, Yuchen Yan, Chen Luo, Monica Xiao Cheng, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

AI总结 SubTTA通过子空间对齐提升视觉-语言模型测试时适应性能,有效解决模态差距和视觉噪声问题。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04778 2026-08-28 cs.CV cs.AI cs.CL cs.MM 版本更新

CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models

CounterVid: 通过生成反事实视频缓解视频-语言模型中动作和时间幻觉

Tobia Poppi, Burak Uzkent, Amanmeet Garg, Lucas Porto, Garin Kessler, Yezhou Yang, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara, Florian Schiffers

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(帕尔马大学) Amazon Prime Video(亚马逊Prime视频)

AI总结 CounterVid通过生成反事实视频缓解视频-语言模型中动作和时间幻觉问题,提出反事实视频生成框架和MixDPO方法,提升时间推理和动作识别性能。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12979 2026-08-28 cs.AI cs.CL 版本更新

DeepPlanner: Scaling Planning Capability for Deep Research Agents via Advantage Shaping

DeepPlanner:通过优势塑造提升深度研究智能体的规划能力

Wei Fan, Wenlin Yao, Zheng Li, Feng Yao, Xin Liu, Liang Qiu, Qingyu Yin, Yangqiu Song, Bing Yin

机构 * The Hong Kong University of Science and Technology(香港科技大学) Amazon(亚马逊) University of California, San Diego(加州大学圣地亚哥分校)

AI总结 针对现有深度研究智能体规划阶段优化不足的问题,提出端到端 RL 框架 DeepPlanner,通过塑造 token 级优势与选择性提升样本级优势,在7个基准上以更低训练预算实现最优规划效果。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08143 2026-08-28 cs.HC cs.AI 版本更新

Communication styles and reader preferences of LLM- and human-authored COVID-19 information explanations: a case study

由大语言模型(LLM)与人类撰写的新冠疫情信息解释的沟通风格及读者偏好:一项案例研究

Jiawei Zhou, Kritika Venkatachalam, Minje Choi, Koustuv Saha, Munmun De Choudhury

机构 * School of Interactive Computing, Georgia Institute of Technology(交互计算学院,佐治亚理工学院) Amazon(亚马逊) Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(Siebel计算与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)

AI总结 本研究以健康事实核查为场景,对比LLM与人类新冠信息解释的沟通风格,发现LLM内容在说服性等质量指标上较弱但受读者偏好,揭示LLM在健康领域的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏