Reward Modeling for Multi-Agent Orchestration
多智能体编排的奖励建模
机构 * Rutgers University(罗杰斯大学) ; Salesforce AI Research(Salesforce人工智能研究)
AI总结 提出OrchRM框架,通过自监督学习从多智能体执行中间产物构建奖励模型,无需人工标注,实现高效编排器训练和测试时扩展,在多个领域提升性能并降低计算成本。
Comments Preprint; work in progress
大厂专区
多智能体编排的奖励建模
机构 * Rutgers University(罗杰斯大学) ; Salesforce AI Research(Salesforce人工智能研究)
AI总结 提出OrchRM框架,通过自监督学习从多智能体执行中间产物构建奖励模型,无需人工标注,实现高效编排器训练和测试时扩展,在多个领域提升性能并降低计算成本。
Comments Preprint; work in progress