Not All Eval-Awareness Is Equal: Capabilities Framing Predicts Compliance
并非所有评估感知都等同:能力框架预测合规性
机构 * ENS Paris-Saclay(巴黎萨克雷高等师范学校) ; Goodfire AI
AI总结 该研究发现评估感知的框架类型会显著影响模型合规性,能力导向型框架的合规性远高于安全导向型,且评估感知并非行为均匀的单一量,总抑制率变化不代表安全相关部分同步变化。
Comments 5 pages (14 appendices), 5 figures, presented at 2026 ICML Mechanistic Interpretability Workshop