arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

EviBack:通过证据约束的教师退避进行搜索智能体强化学习

EviBack: Search-Agent Reinforcement Learning via Evidence-Constrained Teacher Backoff

Xiao Ma, Zhiquan Hu, Yi Wei, Chenchen Zhao, Yijun Chen, Jicheng Zhao, Yuming Li, Chuang Dai

arXiv 2607.23955首次发表:更新:

AI 中文总结

研究针对智能体RAG系统中全零展开组问题,提出EviBack方法,通过证据约束教师退避提供辅助监督。利用全自动管道生成两阶段教师,提升了下游F1等指标,在多个问答基准上取得更好效果。

AI 中文摘要

强化学习使智能体RAG系统能够从可验证的结果奖励中学习多轮搜索,但全零的展开组没有比较信号,可能会隐藏有用的搜索行为。我们提出了EviBack,一种证据约束的教师退避方法,在保留可验证的智能体奖励的同时,为这些组提供辅助监督。它将证据评估与答案细化分开,防止参考答案推翻证据不足的判断。一个全自动的、端到端的GPT-5.5辅助APE管道从手动编写的单提示双任务教师开始,自动划分和标记展开数据,并进行消融、任务分解、评估和选择,以生成一个门控的两阶段教师。与手动设计相比,生成的教师提高了下游F1和有效答案率,同时减少了搜索、重复查询和强制终止。在七个开放域问答基准和三个Qwen3规模上,EviBack比Search-R1提高了F1,并提高了单跳和多跳宏F1。我们保证代码将在后期公开。

英文摘要

Reinforcement learning enables Agentic RAG systems to learn multi-turn search from verifiable outcome rewards, but all- zero rollout groups provide no comparative signal and may hide useful search behavior. We present EviBack, an evidence- constrained Teacher backoff that supplies auxiliary super- vision to such groups while preserving verifiable Actor re- wards. It separates evidence assessment from answer refine- ment, preventing reference answers from overriding evidence- insufficiency judgments. A fully automated, end-to-end GPT- 5.5-assisted APE pipeline starts from a manually authored single-prompt dual-task Teacher, automatically partitions and labels rollout data, and performs ablation, task decomposition, evaluation, and selection to produce a gated two-stage Teacher. Compared with the manual design, the resulting Teacher im- proves downstream F1 and valid-answer rate while reduc- ing search, duplicate queries, and forced termination. Across seven open-domain QA benchmarks and three Qwen3 scales, EviBack improves F1 over Search-R1 and raises both single- and multi-hop macro F1. We guarantee that the code will be made publicly available at a later stage.

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑