Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis
奖励科学过程:面向代理数据分析的过程级奖励建模
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团)
专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出DataPRM,一种环境感知的生成过程奖励模型,通过主动验证和反思意识的三元奖励策略,提升动态数据分析任务中代理的性能,实验表明其在多个基准测试中表现优异。
Comments KDD 2026