arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~
arXiv 2609.02366cs.CLcs.AI

NE-R1:通过强化学习增强命名实体识别模型

NE-R1: Enhancing Named Entity Recognition Model via Reinforcement Learning

发表机构北京大学深圳研究生院 · 百度公司 · 深圳大学
另 1 家 · 查看机构详情
  • Shenzhen Graduate School, Peking University(北京大学深圳研究生院)
  • Baidu, Inc.(百度公司)
  • Shenzhen University(深圳大学)
  • Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

机构由 AI 辅助整理,请以论文原文为准。

Meixuan Chen, Hehan Li, Ruizhi Zhao, Xin Lu, peizhi xu, Liwei Qian, LI Meifang, shuanglong li, Hanmeng Liu, Xin Pei, Yanbiao Ma

首次发表
浏览论文内容

中文总结 AI 辅助

该研究针对NER中长尾与领域实体识别难题,提出NE-R1框架,通过按需检索机制与两阶段训练结合强化学习优化,在多基准上实现F1分数提升,达SOTA性能。

中文摘要 AI 辅助

自大型语言模型(LLMs)问世以来,命名实体识别(NER)已取得显著进展。然而,由于参数化知识不足,长尾实体和领域特定实体的识别仍具挑战性。检索增强生成(RAG)提供了一种有前景的解决方案,可注入外部知识,但在处理熟悉案例时会引入噪声并产生不必要的成本。本文提出一种用于自适应检索增强NER的新型框架NE-R1,设计了NER的“按需检索”机制,并通过两阶段训练方法将其集成到模型中:(1)多任务指令调优初始化;(2)结合思维链(CoT)的端到端强化学习(RL)优化。为实现参数化知识与外部知识间的合理选择,设计了兼顾准确率与检索效益的多维奖励。NE-R1在多个基准上取得了最先进的性能,在领域内评估中平均F1分数提升2.52%,在零样本跨领域评估中平均F1分数提升1.18%。

英文摘要

Named Entity Recognition (NER) has achieved substantial progress since the advent of large language models (LLMs). Nevertheless, the recognition of long-tail and domain-specific entities remains challenging due to the deficiency in parametric knowledge. Retrieval-augmented generation (RAG) offers a promising remedy by injecting external knowledge, but it also introduces noise and unnecessary cost when dealing with familiar cases. In this paper, we propose NE-R1, a novel framework for adaptive retrieval-augmented NER. We design a "retrieval-on-demand" mechanism for NER. Then we integrate it into models by a two-stage training method: (1) multi-task instruction tuning initialization; (2) end-to-end RL optimization with CoT. To achieve reasonable selection between parameterized and external knowledge, we design a multi-dimensional reward considering both accuracy and retrieval benefit. NE-R1 achieves state-of-the-art performance on various benchmarks, with an average F1 score gain of 2.52% in in-domain evaluation and 1.18% in zero-shot cross-domain evaluation.

补充信息

↑