A Rubric-Supervised Critic from Sparse Real-World Outcomes
从稀疏现实结果中学习的评分监督批评者
AI总结 本文提出了一种从稀疏现实结果中学习的评分监督批评者模型,用于提升编码代理的训练和推理性能。
作者
Natural Language Processing
从稀疏现实结果中学习的评分监督批评者
AI总结 本文提出了一种从稀疏现实结果中学习的评分监督批评者模型,用于提升编码代理的训练和推理性能。
代理数据协议:统一多样化、高效的LLM代理微调数据集
机构 * Carnegie Mellon University(卡内基梅隆大学) ; The Ohio State University(俄亥俄州立大学) ; University of Hong Kong(香港大学) ; Duke University(杜克大学) ; Fujitsu Research(富士通研究) ; All Hands AI(全手AI)
AI总结 本文提出代理数据协议(ADP),通过统一多样化代理训练数据集,提升LLM代理微调效果,实现20%的性能提升并在多个基准上达到SOTA水平。