Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning
通过检索增强强化微调进行类比推理学习
机构 * Meta Superintelligence Labs(Meta超级智能实验室) ; Rice University(莱斯大学)
AI总结 提出RA-RFT框架,通过黄金相关性蒸馏训练检索器,并结合强化微调利用类比推理轨迹,提升数学推理性能。
大厂专区
通过检索增强强化微调进行类比推理学习
机构 * Meta Superintelligence Labs(Meta超级智能实验室) ; Rice University(莱斯大学)
AI总结 提出RA-RFT框架,通过黄金相关性蒸馏训练检索器,并结合强化微调利用类比推理轨迹,提升数学推理性能。
何时对齐,何时预测:多模态学习的相图
机构 * Technion(以色列理工学院) ; Genentech(基因泰克公司) ; Brown University(布朗大学) ; Meta AI, FAIR
AI总结 提出统一线性框架,通过信噪比模型揭示跨模态对齐与预测的互补失效模式,构建四区域相图指导多模态学习目标选择,并在非线性实验中验证。