Mix, Don't Tune: Bilingual Pre-Training Outperforms Hyperparameter Search in Data-Constrained Settings
混合,而非调参:双语预训练在数据受限环境下优于超参数搜索
机构 * Apple(苹果公司) ; DTU(丹麦技术大学)
AI总结 本文比较了双语混合与超参数调参在数据受限下的效果,发现混合在验证损失和下游任务准确率上提升更显著,且模型规模越大优势越明显。
大厂专区
混合,而非调参:双语预训练在数据受限环境下优于超参数搜索
机构 * Apple(苹果公司) ; DTU(丹麦技术大学)
AI总结 本文比较了双语混合与超参数调参在数据受限下的效果,发现混合在验证损失和下游任务准确率上提升更显著,且模型规模越大优势越明显。
原始生成,双重判断:从测试时扩展进行自我训练
机构 * Apple(苹果公司) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文提出DuST框架,通过双重判断空间提升代码生成与判断能力,实验显示在多个模型上显著提升测试时扩展性能。
轨迹归一化模型
机构 * Apple(苹果公司)
AI总结 本文提出轨迹归一化模型,通过精确的似然训练建模反向步骤作为条件归一化流,实现高效生成并在文本到图像任务中展现优越性能。
Comments 25 pages, 10 figures; corrected typos and citations