Recursive Agent Optimization
递归智能体优化
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Amazon AGI Labs(亚马逊人工智能实验室)
AI总结 本文提出递归智能体优化方法,通过递归代理训练实现更高效的推理扩展和泛化能力,提升任务处理效率和泛化性能。
大厂专区
递归智能体优化
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Amazon AGI Labs(亚马逊人工智能实验室)
AI总结 本文提出递归智能体优化方法,通过递归代理训练实现更高效的推理扩展和泛化能力,提升任务处理效率和泛化性能。
帧级泄露陷阱:重新思考内在图像分解的评估协议,以源分离不确定性为案例研究
机构 * Amazon Web Services (AWS)(亚马逊网络服务(AWS))
AI总结 本文指出MPI Sintel数据集上学习内在图像分解的评估协议不一致,通过量化帧级泄露效应,提出基于场景级划分的评估标准,并展示源分离不确定性的应用与优势。
Comments Submitted to Journal of Electronic Imaging. 25 pages, 10 figures. Addresses evaluation protocol issues in intrinsic image decomposition and proposes source-separable uncertainty estimation
图let作为知识图谱基础模型中结构词汇的构建块
机构 * ScaDS.AI Dresden/Leipzig, Technische Universität Dresden(ScaDS.AI 德累斯顿/莱比锡,德累斯顿技术大学) ; Department of Mathematics, KNUST(数学系,库马西大学) ; alphaspeech - c/o alpha NT GmbH ; Amazon, Technische Universität Dresden(亚马逊,德累斯顿技术大学) ; TIB – Leibniz Information Centre for Science and Technology(TIB – 莱比锡科学与技术信息中心)
AI总结 本文提出基于图let词汇的模型无关框架,通过模式匹配挖掘知识图谱间的模式,提升跨图谱的链接预测性能。
更多并不总是更好:LLM代理构建中的跨组件干扰
机构 * Amazon(亚马逊)
AI总结 研究LLM代理系统中组件交互导致的性能下降,发现最优组件数量依赖任务和模型规模,贪心选择不可靠,需通过交互分析进行任务特定子集选择。
Comments 10 pages, 5 tables; preprint, under review
可解码但无法通过固定残差-流线性引导进行纠正:来自医疗LLM失败模式的证据
机构 * Amazon(亚马逊)
AI总结 研究探讨了LLM隐藏状态中线性可解码的失败信号能否用于纠正失败,通过Overthinking现象发现线性引导无法有效纠正,但可解码的失败结构支持生成后可靠性估计。
Comments 22 pages (14 main + 8 appendix), 5 figures, 7 tables. Under review
SAT: 为无协调自由插拔多LLM训练的单调改进保证的序列代理调优
机构 * Department of Electrical \& Computer Engineering, University of Arizona Tucson, Arizona USA ; Department of Mathematical Sciences, Rensselaer Polytechnic Institute Troy, New York USA ; Amazon Web Services New York USA ; Department of Electrical \& Computer Engineering, University of Arizona ; Department of Mathematical Sciences, Rensselaer Polytechnic Institute ; Amazon Web Services
AI总结 本文提出SAT方法,通过因子化策略和块坐标更新实现无协调的分布式训练,保证训练过程单调改进和插拔不变性,实验表明其在AIME24/25基准上性能优于Qwen3-32B。
Comments Published at AAMAS 2026
基于情境评分奖励的交替强化学习:超越标量化策略
机构 * Amazon(亚马逊)
AI总结 本文提出ARL-RR框架,通过逐个优化语义评分元类别,避免固定标量化,提升模型性能与训练效率。
感知型人形扑动:通过动作匹配链式动态人类技能
机构 * Amazon FAR(亚马逊FAR) ; UC Berkeley(加州大学伯克利分校) ; CMU(卡内基梅隆大学) ; Stanford University(斯坦福大学)
AI总结 本文提出感知型人形扑动框架,通过动作匹配和强化学习实现人形机器人在复杂环境中自主执行长时程视觉扑动任务,展示高动态扑动技能和多障碍物穿越能力。
Owen-Shapley策略优化:一种为生成搜索语言模型设计的原理性强化学习算法
机构 * Amazon Science(亚马逊科学) ; Situated Grounding and Natural Language (SIGNAL) Lab, Colorado State University(情境 grounding 和自然语言(SIGNAL)实验室,科罗拉多州立大学)
AI总结 本文提出Owen-Shapley策略优化算法,通过基于令牌边际贡献的序列优势再分配,解决生成搜索语言模型中因稀疏序列奖励导致的信用分配问题,实验表明其在Amazon ESCI和H&M Fashion数据集上表现优异。
Comments Added additional experiments, computational analysis and further revisions