POSTCONDBENCH: Benchmarking Correctness and Completeness in Formal Postcondition Inference
POSTCONDBENCH:形式化后置条件推理中的正确性与完备性基准测试
AI总结 本文提出POSTCONDBENCH多语言基准,用于评估LLM生成方法级后置条件的能力,发现正确性与完备性差距显著,仓库级依赖及方法复杂性会加剧该差距。
Journal ref In Findings of the Association for Computational Linguistics: ACL 2026, pages 35478-35507, San Diego, California, United States. Association for Computational Linguistics, 2026