TRACER: Turn-level Regret Matching with Inner Reinforcement Credit for Cooperative Multi-LLM Reasoning
TRACER: 基于内部强化信用与轮次级遗憾匹配的多LLM协作推理
机构 * Fudan University(复旦大学) ; Zhongguancun Academy(中关村学院) ; Academy for Advanced Interdisciplinary Studies, Peking University(北京大学先进交叉学科研究院)
AI总结 提出TRACER框架,通过控制器-遗憾层和生成-信用层分别学习发言时机与内容,解决多智能体强化学习中的稀疏奖励、搭便车和固定协议振荡问题,实现数学收敛的协作推理。
Comments 25 pages, 3 figures