Know When To Fold 'Em: Token-Efficient LLM Synthetic Data Generation via Multi-Stage In-Flight Rejection
知何时该收手:通过多阶段飞行拒绝实现令牌高效的大语言模型合成数据生成
机构 * Department of Computer Science University of Houston(计算机科学系休斯顿大学) ; IBM Research(IBM研究院)
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本文提出MSIFR框架,通过在生成过程中早期检测低质量轨迹以减少令牌浪费,提升合成数据生成效率,实验表明其在多个模型和基准上显著降低令牌消耗并保持准确性。
Comments 17 pages, 4 figures, 7 tables