A Four-Axis Trustworthiness Benchmark for LLM-as-Judge in Principle-Based Regulation
面向基于原则的监管的LLM作为评判者的四轴可信度基准
AI总结 本文提出面向基于原则监管的LLM评判者的四轴可信度基准,发布Principle-Bench并引入Ceca评估器,发现无方法在所有四轴占优,部署级LLM评判者需报告对抗性欺骗与事后校准等指标。
Comments 7 pages, 3 figures. Accepted at the KDD 2026 Workshop on Secure and Trustworthy Large Language Models (SeT-LLM), poster