One Battle After Another: Probing LLMs' Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework
一战接一战:通过一个演进框架探测LLMs在多轮指令遵循中的极限
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Jilin University(吉林大学)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 本文提出EvolIF演进框架,通过多轮对话测试LLMs的指令遵循能力,揭示失败恢复和细粒度指令遵循的不足,GPT-5在鲁棒性上表现最佳。