Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents
先评估再改进:面向自动研究智能体的自动评分准则生成
机构 * Zhejiang University(浙江大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Zhejiang University of Technology(浙江工业大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出AutoSciRub框架,在自主科学研究前生成任务特定可执行评分准则,经多基准测试可提升智能体研究表现,为自主科研提供有效控制机制。
Comments Work in progress