Instruction Stacking Collapse: A Benchmark and the Capability-Dependent Value of Prompt Compilation
指令堆叠崩溃:基准测试集与提示词编译的能力依赖价值
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 本研究构建了含24个指令的基准测试集,发现指令遵循率随堆叠指令数增加非线性下降,提出无需训练的指令编译器可提升较弱生产级LLM的指令遵循率,且该收益与模型能力相关。
Comments 13 pages, 11 figures. Benchmark, deterministic verifiers, and cached model responses released for full reproduction