arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

JPO:用于刑事判决预测中结构化法律推理的司法策略优化

JPO: Juris Policy Optimization for Structured Legal Reasoning in Criminal Judgment Prediction

Zhaolu Kang, Yantao Liu, Tailong Luo, Leqi Zheng, Lei Wei, Chenghua Zhu, Junhao Gong, Jiachen Qian, Eric Hanchen Jiang, Jiaxin Liu, Yuan Wang, Hao Zhang, Zixia Wang, Rong Fu, Zheng Lin, Richeng Xuan, Zhichao Hu

arXiv 2608.29616首次发表:更新:

发表机构

Tencent; Peking University; Tsinghua University; City University of Hong Kong; University of California; University of Illinois Urbana-Champaign; Zhejiang University; University of Hong Kong(腾讯; 北京大学; 清华大学; 香港城市大学; 加利福尼亚大学; 伊利诺伊大学厄巴纳-香槟分校; 浙江大学; 香港大学)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

JPO是用于中国刑事判决预测的后训练框架,通过监督四步推理过程与带复合奖励的强化学习,提升判决预测及推理质量。

AI 中文摘要

刑事判决预测要求模型从案件事实中推断出法律条文、罪名及量刑结果。与标准分类任务不同,它涉及结构化推理过程:需将法律条文与事实匹配、罪名需由法律条文佐证、量刑结果需与罪名保持一致。现有方法优化最终标签,虽部分尝试评估推理质量,但评估方式间接,常依赖大语言模型(LLM)生成的准则,反映模型内部偏好而非司法裁决的固有逻辑结构。我们提出Juris Policy Optimization(JPO),这是用于中国刑事判决预测中结构化法律推理的后训练框架。JPO首先利用教师模型生成的推理依据监督标准化四步推理过程,随后采用强化学习,结合法律预测质量、推理结构完整性及跨步骤一致性的复合奖励函数。JPO进一步引入针对法律关键推理片段的词元级优势重加权与自适应裁剪。在多个开源语言模型及三个中国法律基准上的实验表明,相较于监督微调及强化学习基线,JPO持续提升判决预测与推理质量。

英文摘要

Criminal judgment prediction requires models to infer statutory articles, charges, and sentencing outcomes from case facts. Unlike standard classification tasks, it involves a structured reasoning process in which statutes should be matched with facts, charges should be justified by statutes, and sentencing outcomes should remain consistent with charges. Existing approaches optimize final labels, and while some have attempted to evaluate reasoning quality, their evaluations are indirect, often relying on LLM-generated rubrics that reflect model-internal preferences rather than the inherent logical structure of legal adjudication. We propose Juris Policy Optimization (JPO), a post-training framework for structured legal reasoning in Chinese criminal judgment prediction. JPO first uses teacher-generated rationales to supervise a standardized four-step reasoning process, and then applies reinforcement learning with a composite reward over legal prediction quality, reasoning structure completeness, and cross-step consistency. JPO further introduces token-level advantage reweighting and adaptive clipping for legally salient reasoning segments. Experiments on multiple open-source language models and three Chinese legal benchmarks show that JPO consistently improves both judgment prediction and reasoning quality over supervised fine-tuning and reinforcement learning baselines.

CommentsEMNLP 2026 Main

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑