Beyond Exact Match: How Evaluation Methodology Dominates Model Choice in LLM-Based Product Attribute Extraction
超越精确匹配:评估方法如何在基于大语言模型的产品属性提取中主导模型选择
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究基于大语言模型的产品属性提取中评估方法的影响,通过在MAVE基准上对比两种模型的四种提示策略,用精确和模糊匹配评估预测并审计标签,发现评估方法产生的方差远超模型和提示策略选择,且基准有一定噪声率,得出评估方法和数据质量主导模型选择等结论。
Comments 9 pages, 3 figures, 8 tables. Preprint under review. Code available at https://github.com/a-dwivedi/llm-product-attribute-extraction