重写关键之处:基于智能体强化学习的自适应多语言查询重写用于推理
Rewrite What Matters: Adaptive Multilingual Query Rewriting for Reasoning via Agentic Reinforcement Learning
查看机构详情
- Beijing Jiaotong University(北京交通大学)
- Tencent Inc(腾讯公司)
- University of Edinburgh(爱丁堡大学)
机构由 AI 辅助整理,请以论文原文为准。
浏览论文内容
中文总结 AI 辅助
针对多语言查询重写中一刀切策略的不足,提出基于强化学习的智能体框架mRewriter-R1,将重写视为多轮决策过程,通过自适应算子选择优化,提升推理性能并展现强泛化能力。
中文摘要 AI 辅助
在多语言场景中,语义等价但语言不同的查询可能会引导模型进入不同的推理轨迹,从而导致性能差异。为缓解这一差距,以往研究通常采用一刀切的查询重写策略(如翻译),这忽略了不同场景需要多样化的语义转换类型这一事实。在本文中,我们提出mRewriter-R1,一种基于强化学习的智能体多语言查询重写框架。与单轮重写不同,mRewriter-R1将多语言查询重写表述为多轮顺序决策过程,其中模型通过自适应算子选择动态执行多方面优化。实验结果表明,mRewriter-R1在不同大型推理骨干模型上优于所有强多语言重写基线。进一步分析显示,所学策略能根据查询特征自适应决定重写算子,展现出跨多样推理任务的强泛化能力,以及与异构推理语言模型的即插即用兼容性。
英文摘要
In multilingual scenarios, queries with equivalent semantics but in different languages could guide the model into different reasoning trajectories, leading to performance disparities. To mitigate this gap, previous studies typically apply a one-size-fits-all query rewriting strategy, such as translation, which overlooks the fact that different scenarios require diverse types of semantic transformations. In this paper, we propose mRewriter-R1, an agentic multilingual query rewriting framework with reinforcement learning. Unlike single-turn rewriting, mRewriter-R1 formulates multilingual query rewriting as a multi-turn sequential decision-making process, where the model dynamically performs multi-aspect optimization through adaptive operator selection. Experimental results demonstrate that mRewriter-R1 outperforms all strong multilingual rewriting baselines on different large reasoning backbones. Further analyses show that the learned policy can adaptively decide on rewriting operators according to query characteristics, exhibiting strong generalization ability across diverse reasoning tasks, and plug-and-play compatibility with heterogeneous reasoning language models.