arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Amazon(亚马逊)

2026-08-14 至 2026-08-14 共收录 4
2608.13522 2026-08-14 cs.LG cs.AI cs.LO cs.PL cs.SE 新提交

Vero: Can AI Agents Build Formally Verified Software Repositories?

Vero:AI智能体能否构建形式化验证的软件仓库?

Zhe Ye, Hantao Lou, Yuechun Sun, Peiyang Song, Zhengxu Yan, Timothe Kasriel, Qingyang Zhang, Kaiyu Yang, Soonho Kong, Jingxuan He, Dawn Song

机构 * University of Chicago(芝加哥大学) California Institute of Technology(加州理工学院) Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Amazon Web Services(亚马逊云计算服务) Apodex

AI总结 研究推出首个仓库级验证软件综合基准Vero,含43个多模块实例,评估发现前沿智能体仅解决27个实例,为相关研究提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12585 2026-08-14 cs.AI 新提交

Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces

推理评审团:用于评估推理轨迹的多模型共识机制

Congchao Wang, Diwakar Singh, Qiaozi Gao, Spyros Matsoukas, Yang Liu, Mahdi Namazifar

机构 * Amazon AGI(亚马逊AGI)

AI总结 本研究提出Reasoning Jury系统,以多LLM评审团及调控共识机制替代单模型评审员,其识别推理缺陷的准确率显著优于前沿模型,且开销仅为后者的8%-15%,还可用于理解推理LLM的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12574 2026-08-14 cs.AI cs.FL 新提交

Trie Automata for Constrained Decoding over Large Finite Sets

用于大有限集上约束解码的Trie自动机

Xingzi Xu, Karim Bouyarmane

机构 * Amazon(亚马逊公司)

AI总结 针对大型语言模型有限集约束解码的速度瓶颈,提出Trie自动机机制,通过预计算token掩码实现高效解码,在批量服务中吞吐量较XGrammar提升29倍,且编译与计算效率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12564 2026-08-14 cs.LG 新提交

Scaling Automatic Research Agents via World Models

通过世界模型扩展自动研究智能体

Xiyuan Yang, Sheikh Sarwar, Jingru Cheng, Zhan Shi, Duanshun Li, Huiyuan Chen, Haiyang Zhang, Chenlei Guo, Jingrui He, Zhenyu Liao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司)

AI总结 针对自动研究智能体扩展时的训练瓶颈,提出WMRL方法,结合两种缓解措施提升收敛性,训练加速3-4倍且性能优于更大规模智能体,还可迁移至多类任务。

详情

展开后加载摘要…

URL PDF HTML 收藏