Incentivizing Parametric Knowledge via Reinforcement Learning with Verifiable Rewards for Cross-Cultural Entity Translation
通过可验证奖励的强化学习激励参数知识用于跨文化实体翻译
机构 * TJUNLP Lab, Tianjin University, China(天津大学TJUNLP实验室) ; Alibaba Group, China(阿里巴巴集团)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出EA-RLVR框架,通过可验证奖励信号优化跨文化实体翻译,提升模型在实体翻译准确性和领域外泛化能力,实验表明在7k样本训练下模型性能显著提升。
Comments 23 pages, 11 figures, 11 tables