MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs
通过战略性大语言模型的自我对战激励多智能体推理的MARSHAL
机构 * SIGS, Tsinghua University(清华大学信号与系统系) ; EE, Tsinghua University(清华大学电子工程系) ; Aalto University(阿alto大学) ; Li Auto Inc.(李汽车公司) ; Infinigence AI Project Page Code Models(Infinigence AI项目页面代码模型)
AI总结 MARSHAL通过战略性LLM的自我对战激励多智能体推理,实现多智能体系统的性能提升。