arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

CERA-MoA:协同进化路由机制与持续学习LLM智能体

CERA-MoA: Co-Evolving Routing Mechanisms with Continually Learning LLM Agents

Jiaxuan Jiang, Liyuan He, Zhixuan Fang

arXiv 2609.18779首次发表:更新:

发表机构

IIIS, Tsinghua University; School of Artificial Intelligence, Shanghai Jiao Tong University; Shanghai Qi Zhi Institute(清华大学交叉信息研究院; 上海交通大学人工智能学院; 上海期智研究院)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

CERA-MoA提出协同进化路由与持续学习智能体的迭代强化学习框架,通过预测性熟悉度估计和自适应路由机制,在性能与效率间取得平衡,并优于现有基线。

AI 中文摘要

当前的混合智能体(Mixture-of-Agents, MoA)范式通常将查询路由和智能体微调视为独立过程,限制了其应对不断演化的智能体能力的能力。这种脱节使得路由策略无法在训练后适应智能体能力的演化,也阻碍了智能体实现协同的数据驱动专业化。为解决这一问题,我们提出了CERA-MoA(用于混合智能体的协同进化路由器与持续学习智能体),一种迭代强化学习框架,其中动态路由器与独立智能体策略协同进化。我们设计了一个预测性熟悉度估计器,利用中间层隐藏状态来评估智能体间的语义能力,避免了完整rollout的开销。基于这些熟悉度分数,一种累积阈值自适应路由机制动态激活量身定制的最小智能体子集,在任务性能与效率之间取得平衡。通过根据智能体不断演化的能力主动为其分配针对性的训练样本,CERA-MoA促进了能力差异化。跨多个领域的广泛实验表明,CERA-MoA优于最先进的静态智能体路由和固定工作流微调基线。

英文摘要

Current Mixture-of-Agents (MoA) paradigms generally treat query routing and agent fine-tuning as separate processes, limiting their ability to respond to evolving agent capabilities. This disconnect prevents routing strategies from adapting to evolving agent capabilities during post-training and prevents agents from achieving synergistic data-driven specialization. To resolve this, we introduce CERA-MoA (Co-Evolving Router with continually learning Agents for Mixture-of-Agents), an iterative reinforcement learning framework where the dynamic router and independent agent policies co-evolve. We design a predictive familiarity estimator that leverages mid-layer hidden states to evaluate semantic competence among agents, avoiding the overhead of full rollouts. Based on these familiarity scores, a cumulative-threshold adaptive routing mechanism dynamically activates a tailored minimal agent subset, achieving a trade-off between task performance and efficiency. By proactively allocating targeted training samples to agents based on their evolving competence, CERA-MoA promotes capability differentiation. Extensive experiments across various domains demonstrate that CERA-MoA outperforms state-of-the-art static-agent routing and fix-workflow fine-tuning baselines.

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑