ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition
ResearchBench: 通过基于灵感的任务分解对LLM在科学发现中的基准测试
机构 * Fudan University(复旦大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Nanyang Technological University(南洋理工大学) ; University of New South Wales(新南威尔士大学) ; National University of Singapore(新加坡国立大学) ; Wuhan University(武汉大学)
AI总结 本文提出ResearchBench,首个评估LLM在科学发现子任务中的基准,包含灵感检索、假设生成和排序,通过自动化框架提取跨12学科论文的关键信息,验证其准确性,并展示LLM在非分布任务中表现优异。
Comments Accepted by ACL 2026 (findings)