Self-Compression of Chain-of-Thought via Multi-Agent Reinforcement Learning
通过多智能体强化学习实现链式思维的自我压缩
机构 * Renmin University of China(中国人民大学) ; Xiaohongshu Inc.(小红书公司) ; Institute of Automation,Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Southern California(南加州大学) ; Shandong University(山东大学)
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.CL
AI总结 通过多智能体强化学习实现链式思维的自我压缩,有效减少响应长度并提升准确性。