ReliabilityBench: Evaluating LLM Agent Reliability Under Production-Like Stress Conditions
ReliabilityBench: 评估LLM代理在生产类压力条件下可靠性
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 ReliabilityBench通过评估LLM代理在生产类压力条件下的可靠性,提出统一的可靠性表面和动作元关系,评估不同模型和架构的可靠性表现。
Comments 18 pages, 5 figures, 8 tables. Evaluates ReAct vs Reflexion across four tool-using domains with perturbation (epsilon) and fault-injection (lambda) stress testing; 1,280 total episodes