arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Amazon(亚马逊)

2026-09-01 至 2026-09-01 共收录 6
2608.31167 2026-09-01 cs.RO cs.AI 新提交

SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies

SUN:用于语言接地控制学习到真实策略的持久程序

Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao, Yuxin Jiang, Chenfanfu Jiang, Yingnian Wu, Demetri Terzopoulos, Ran Gong

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) Amazon(亚马逊公司) Robotics and AI Institute(机器人与人工智能研究院)

AI总结 本文提出语义统一(SUN)程序及系统Kuafu,由大型视觉语言系统自动合成,在9项任务中实现82.03%宏观成功率,优于相关基准,可将控制摊销为鲁棒策略,实现符号规划与数据驱动执行的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30614 2026-09-01 cs.CL 新提交

TaxCE : A Framework for Automated Taxonomy Construction and Evaluation at Scale

TaxCE:大规模自动分类法构建与评估框架

Sandeep Sricharan Mukku, Albert Aristotle Nanda, Rohit Pyati

机构 * Amazon(亚马逊)

AI总结 针对大规模非结构化反馈文本分类法构建的挑战,本文提出TaxCE框架,结合EEG指标的闭环迭代优化机制,在分类法质量上优于现有基线方法。

Comments EMNLP 2026 - Industry

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30258 2026-09-01 cs.CL cs.AI 新提交

Stratified Consistency Distillation for Natural Language Formalization

面向自然语言形式化的分层一致性蒸馏

Zhichao Hou, Ferhat Erata, Joe Lilien, MohamadAli Torkamani

机构 * North Carolina State University(北卡罗来纳州立大学) Amazon Web Services(亚马逊网络服务)

AI总结 该研究针对自然语言到逻辑公式翻译准确率提升难题,提出分层一致性蒸馏方法,经实验在Pass@K与等价逻辑相似度指标上获显著稳定提升,推进了逻辑翻译技术发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29513 2026-09-01 cs.LG cs.AI 新提交

On the Plasticity Collapse in Continual Machine Unlearning

持续机器遗忘中的可塑性崩溃

Yingdan Shi, Xiang Xu, Kaize Ding, Alfred O. Hero, Ren Wang

机构 * Illinois Institute of Technology(伊利诺伊理工学院) Amazon(亚马逊公司) Northwestern University(西北大学) University of Michigan(密歇根大学)

AI总结 本研究发现持续机器遗忘场景存在可塑性崩溃的固有问题,通过理论分析和多组实验证实其普遍性,为开发保可塑性遗忘算法提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29270 2026-09-01 cs.CL cs.AI 新提交

SHADOWBENCH: Toward Reliable Automatic Evaluation of Semantic Alignment in Autoformalization

SHADOWBENCH:迈向自动形式化中语义对齐的可靠自动评估

Hojae Han, Jongyoon Kim, Sanghyuk Park, Dongwook Cheon, Myungjae Jeon, Sunjong Choi, Soonho Kong, Wonseok Heo, Seung-won Hwang, Donghoon Hyeon

机构 * Electronics and Telecommunications Research Institute(电子通信研究院) Seoul National University(首尔大学) University of Maryland, College Park(马里兰大学帕克分校) Amazon Web Services(亚马逊网络服务)

AI总结 针对自动形式化评估的缺陷,该研究提出SA-Pass方法并构建ShadowBench基准,实验显示其与专家判断一致性达98.8%,且被用作ICML 2026 AI4Math挑战赛第4赛道基准。

Comments EMNLP 2026

Journal ref The 2026 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28648 2026-09-01 cs.AI cs.CL cs.LG 新提交

How Language Models Choose Sides: Internal Representations of Instruction Hierarchy

语言模型如何选择立场:指令层级的内部表征

Enrique Balp-Straffon, Chih-Hao Hsu, Rushiraj Gadhvi, Sunishchal Dev, Callum Stuart McDougall, Anusha Mujumdar

机构 * Amazon(亚马逊) National Taiwan University(国立台湾大学) Plaksha University(普拉卡莎大学) RAND Corporation(兰德公司) Algoverse Google DeepMind(谷歌DeepMind)

AI总结 本研究探究指令微调LLM在系统与用户指令冲突中的仲裁机制,构建含41对约束的基准评估8个模型,发现反层级模型Llama-3.1-8B的冲突结果可从残差流激活线性解码,干预效果取决于读出几何结构。

Comments Published at the ICML 2026 Mechanistic Interpretability workshop, 16 pages (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏