DARE-bench: Evaluating Modeling and Instruction Fidelity of LLMs in Data Science
DARE-bench: 评估LLMs在数据科学中的建模和指令忠实度
机构 * University of Houston(德克萨斯大学休斯顿分校) ; Snowflake AI Research(Snowflake人工智能研究院)
AI总结 DARE-bench通过提供可验证的真实值任务和大规模训练数据,有效评估和提升LLMs在数据科学中的建模和指令忠实度。
Comments Published as a conference paper at ICLR 2026. 10 pages plus appendix