Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation
无效度的测量:智能体AI评估中的复合可靠性问题
机构 * Red Hat, Inc.(红帽公司) ; Alma Mater Europaea University(欧洲母校大学)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI
AI总结 该研究指出智能体AI评估存在复合可靠性问题,任务生成、LLM模拟、评分者间信度三个层面的失效相乘降低效度,提出八项心理测量学改进建议以提升评估可信度。
Comments 34 pages (review/double-spaced format), 2 figures, 5 tables. Submitted to Knowledge-Based Systems (Elsevier)