arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Amazon(亚马逊)

2026-09-01 至 2026-09-01 共收录 14
2608.31167 2026-09-01 cs.RO cs.AI 新提交

SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies

SUN:用于语言接地控制学习到真实策略的持久程序

Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao, Yuxin Jiang, Chenfanfu Jiang, Yingnian Wu, Demetri Terzopoulos, Ran Gong

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) Amazon(亚马逊公司) Robotics and AI Institute(机器人与人工智能研究院)

AI总结 本文提出语义统一(SUN)程序及系统Kuafu,由大型视觉语言系统自动合成,在9项任务中实现82.03%宏观成功率,优于相关基准,可将控制摊销为鲁棒策略,实现符号规划与数据驱动执行的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30614 2026-09-01 cs.CL 新提交

TaxCE : A Framework for Automated Taxonomy Construction and Evaluation at Scale

TaxCE:大规模自动分类法构建与评估框架

Sandeep Sricharan Mukku, Albert Aristotle Nanda, Rohit Pyati

机构 * Amazon(亚马逊)

AI总结 针对大规模非结构化反馈文本分类法构建的挑战,本文提出TaxCE框架,结合EEG指标的闭环迭代优化机制,在分类法质量上优于现有基线方法。

Comments EMNLP 2026 - Industry

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30258 2026-09-01 cs.CL cs.AI 新提交

Stratified Consistency Distillation for Natural Language Formalization

面向自然语言形式化的分层一致性蒸馏

Zhichao Hou, Ferhat Erata, Joe Lilien, MohamadAli Torkamani

机构 * North Carolina State University(北卡罗来纳州立大学) Amazon Web Services(亚马逊网络服务)

AI总结 该研究针对自然语言到逻辑公式翻译准确率提升难题,提出分层一致性蒸馏方法,经实验在Pass@K与等价逻辑相似度指标上获显著稳定提升,推进了逻辑翻译技术发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29513 2026-09-01 cs.LG cs.AI 新提交

On the Plasticity Collapse in Continual Machine Unlearning

持续机器遗忘中的可塑性崩溃

Yingdan Shi, Xiang Xu, Kaize Ding, Alfred O. Hero, Ren Wang

机构 * Illinois Institute of Technology(伊利诺伊理工学院) Amazon(亚马逊公司) Northwestern University(西北大学) University of Michigan(密歇根大学)

AI总结 本研究发现持续机器遗忘场景存在可塑性崩溃的固有问题,通过理论分析和多组实验证实其普遍性,为开发保可塑性遗忘算法提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29270 2026-09-01 cs.CL cs.AI 新提交

SHADOWBENCH: Toward Reliable Automatic Evaluation of Semantic Alignment in Autoformalization

SHADOWBENCH:迈向自动形式化中语义对齐的可靠自动评估

Hojae Han, Jongyoon Kim, Sanghyuk Park, Dongwook Cheon, Myungjae Jeon, Sunjong Choi, Soonho Kong, Wonseok Heo, Seung-won Hwang, Donghoon Hyeon

机构 * Electronics and Telecommunications Research Institute(电子通信研究院) Seoul National University(首尔大学) University of Maryland, College Park(马里兰大学帕克分校) Amazon Web Services(亚马逊网络服务)

AI总结 针对自动形式化评估的缺陷,该研究提出SA-Pass方法并构建ShadowBench基准,实验显示其与专家判断一致性达98.8%,且被用作ICML 2026 AI4Math挑战赛第4赛道基准。

Comments EMNLP 2026

Journal ref The 2026 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28648 2026-09-01 cs.AI cs.CL cs.LG 新提交

How Language Models Choose Sides: Internal Representations of Instruction Hierarchy

语言模型如何选择立场:指令层级的内部表征

Enrique Balp-Straffon, Chih-Hao Hsu, Rushiraj Gadhvi, Sunishchal Dev, Callum Stuart McDougall, Anusha Mujumdar

机构 * Amazon(亚马逊) National Taiwan University(国立台湾大学) Plaksha University(普拉卡莎大学) RAND Corporation(兰德公司) Algoverse Google DeepMind(谷歌DeepMind)

AI总结 本研究探究指令微调LLM在系统与用户指令冲突中的仲裁机制,构建含41对约束的基准评估8个模型,发现反层级模型Llama-3.1-8B的冲突结果可从残差流激活线性解码,干预效果取决于读出几何结构。

Comments Published at the ICML 2026 Mechanistic Interpretability workshop, 16 pages (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12564 2026-09-01 cs.LG 版本更新

Scaling Automatic Research Agents via World Models

通过世界模型扩展自动研究智能体

Xiyuan Yang, Sheikh Sarwar, Jingru Cheng, Zhan Shi, Duanshun Li, Huiyuan Chen, Haiyang Zhang, Xing Fan, Chenlei Guo, Jingrui He, Zhenyu Liao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司)

AI总结 针对自动研究智能体扩展时的训练瓶颈,提出WMRL方法,结合两种缓解措施提升收敛性,训练加速3-4倍且性能优于更大规模智能体,还可迁移至多类任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07469 2026-09-01 cs.CL cs.AI 版本更新

SynthAVE: Scalable Synthetic Labeling for E-Commerce with LLM-Arena Validation

SynthAVE:通过大语言模型领域验证实现电子商务的可扩展合成标注

Andrea Scarinci, Virginia Negri, Brayan Impata, Suleiman Khan, Victor Martinez, Marcello Federico

机构 * Amazon(亚马逊)

AI总结 研究针对电子商务属性提取微调大语言模型需大量标注数据、人工标注成本高的问题,提出SynthAVE基准及多LLM领域框架,通过多数投票验证合成标注,实现经济高效且质量与人工审核相当的大规模属性值提取验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06526 2026-09-01 cs.AI cs.LG 版本更新

CrowdMath: A Dataset of Crowdsourced Mathematical Research Discussions

CrowdMath: 众包数学研究讨论数据集

Sherin Muckatira, Jesse Geneson, Slava Gerovitch, Pavel Etingof, Mikhail Gronas, Anna Rumshisky

机构 * University of Massachusetts Lowell(马萨诸塞大学洛文分校) San Jose State University(圣何塞州立大学) Massachusetts Institute of Technology(麻省理工学院) Dartmouth College(达特茅斯学院) Amazon AGI(亚马逊人工智能研究院)

AI总结 提出CrowdMath数据集,包含164条专家标注的进展链,用于评估大语言模型在协作开放问题求解中的能力,发现模型在局部预测上表现良好但在角色分类上存在不足。

Comments 16 pages, 4 figures; Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03968 2026-09-01 cs.CL cs.AI 版本更新

QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards

QUBRIC:为超越可验证奖励的强化学习协同设计查询与评分标准

Rongzhi Zhang, Rui Feng, Zhihan Zhang, Jingfeng Yang, Qingyu Yin, Xin Liu, Zixuan Zhang, Priyanka Nigam, Bing Yin, Tuo Zhao, Chao Zhang

机构 * Amazon(亚马逊) Georgia Institute of Technology(佐治亚理工学院)

AI总结 针对基于评分标准的强化学习中查询分布固定导致的评分标准质量瓶颈,提出QUBRIC框架,通过协同设计查询与评分标准,利用教师关键点、对比生成和可学习性过滤,在ArenaHard上取得+5.5点提升,并泛化到法律、道德和叙事推理任务。

Comments Published in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01456 2026-09-01 cs.LG cs.CL cs.GT 版本更新

Truthful AI Advisors: A Pre-Specified Benchmark for Large Language Model Honesty Under Preference Misalignment

诚实的人工智能顾问:偏好错位下大语言模型诚实性的预设基准

Hamidreza Hasani Balyani, Seyed Pouyan Mousavi Davoudi, Alireza Amiri-Margavi, Amin Gholami Davodi, Arshia Gharagozlou

机构 * Amazon Lab126, HW Tech Org.(亚马逊实验室126,硬件技术组织) Computational Modeling and Simulation University of Pittsburgh(计算建模与仿真大学匹兹堡分校) Mathematics & Statistics Department University of Minnesota Duluth(数学与统计学系明尼苏达大学 Duluth 分校)

AI总结 通过Crawford-Sobel廉价谈话模型构建基准,评估大语言模型在偏好冲突时是否诚实,发现模型过度揭示信息,偏离策略最优。

Comments 24 pages, 6 figures. Code and data: https://github.com/iHamidHasani/cheap-talk-llm-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07699 2026-09-01 cs.CL cs.AI 版本更新

DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain

DRIP-R:零售领域决策与推理在现实政策模糊性下的基准测试

Hsuvas Borkakoty, Sebastian Pohl, Cheng Wang, Bei Chen, Yufang Hou

机构 * Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) Amazon Berlin(亚马逊柏林)

AI总结 DRIP-R基准测试通过现实零售政策模糊性构建无唯一正确解决方案的场景,评估LLM在模糊政策下的决策与推理能力,揭示其固有的系统性挑战。

Comments Accepted to EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14602 2026-09-01 cs.CL cs.AI cs.LG 版本更新

PA3: Policy-Aware Agent Alignment through Chain-of-Thought

PA3: 通过链式推理实现政策感知的智能体对齐

Shubhashis Roy Dipta, Daniel Bis, Kun Zhou, Lichao Wang, Benjamin Z. Yao, Chenlei Guo, Ruhi Sarikaya

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) Amazon Alexa AI(亚马逊Alexa AI)

AI总结 本文提出一种多阶段对齐方法,通过链式推理让模型在推理时回忆并应用相关业务政策,无需在上下文中包含完整政策,同时引入PolicyRecall奖励和hallucination惩罚,提升性能并减少字数。

Comments Accepted to EMNLP 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03244 2026-09-01 cs.LG cs.AI cs.CL 版本更新

ScalePRM: Training Process Reward Models by Scaling Verification Compute Without Ground Truth

SPARK:基于过程的奖励机制用于无参考强化学习

Salman Rahman, Sruthi Gorantla, Arpit Gupta, Swastik Roy, Nanyun Peng, Yang Liu

机构 * Amazon AGI(亚马逊人工智能实验室) UCLA(大学)

AI总结 SPARK提出一种无参考强化学习框架,通过生成和验证模型提升过程奖励模型性能,在数学推理任务中取得优于真实参考的方法的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏