arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

HARDEN:面向更难且保持答案不变的评测用例的约束进化搜索

HARDEN: Constrained Evolutionary Search for Harder, Answer-Preserving Evaluation Cases

Aditya Kumaran, Rahul Singhal, Karime Maamari, Amine Mhedhbi, Pradyumna Tambwekar

arXiv 2609.30571首次发表:更新:

发表机构

Distyl AI; Polytechnique Montréal; Mila – Quebec AI Institute(Distyl AI; 蒙特利尔理工学院; 米拉-魁北克人工智能研究所)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

HARDEN通过约束进化搜索在保持答案不变的前提下生成更难的评测用例,在多个基准和模型上平均降低准确率22.7%,最高达49.9%。

AI 中文摘要

语言模型通常在精心策划的基准上进行评估,而这些基准未能充分代表企业部署的复杂性。我们引入了HARDEN,一种约束进化搜索方法,用于将现有评测用例的输入调整为更具挑战性的变体,同时保持其预期输出不变。HARDEN沿着生成的领域特定复杂性轴进行搜索,同时强制执行可行性约束,如保持任务语义、真实性和执行有效性。在FinQA、PubMedQA和ContractNLI以及三种Qwen3.5模型规模(35B-A3B、122B-A10B和397B-A17B)上,HARDEN将任务-模型准确率平均降低了22.7%,相对于使用相同可行性检查的单遍基线,最高降低了49.9%。这些结果表明,进化搜索可以产生明显更难的有效评测用例。

英文摘要

Language models are often evaluated on curated benchmarks that underrepresent the complexity of enterprise deployments. We introduce HARDEN, a constrained evolutionary search method to adapt the input of existing evaluation cases into more challenging variants while keeping their expected outputs fixed. HARDEN searches along generated domain-specific complexity axes while enforcing feasibility constraints such as preserving task semantics, realism, and execution validity. Across FinQA, PubMedQA, and ContractNLI and three Qwen3.5 model scales (35B-A3B, 122B-A10B, and 397B-A17B), HARDEN reduces task-model accuracy by 22.7% on average and by up to 49.9% relative to single-pass baselines using the same feasibility checks. These results show that evolutionary search can produce substantially harder valid evaluation cases.

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑