PRISMA: Reinforcement Learning Guided Two-Stage Policy Optimization in Multi-Agent Architecture for Open-Domain Multi-Hop Question Answering
PRISMA:基于强化学习的多智能体架构中两阶段策略优化
专题命中 知识库问答 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
AI总结 PRISMA通过两阶段组相对策略优化,结合推理引导协作,解决多跳问答中的检索崩溃和学习不稳定问题,实现高性能和稳定部署。