Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning
通过检索增强强化微调进行类比推理学习
机构 * Meta Superintelligence Labs(Meta超级智能实验室) ; Rice University(莱斯大学)
AI总结 提出RA-RFT框架,通过黄金相关性蒸馏训练检索器,并结合强化微调利用类比推理轨迹,提升数学推理性能。
大厂专区
通过检索增强强化微调进行类比推理学习
机构 * Meta Superintelligence Labs(Meta超级智能实验室) ; Rice University(莱斯大学)
AI总结 提出RA-RFT框架,通过黄金相关性蒸馏训练检索器,并结合强化微调利用类比推理轨迹,提升数学推理性能。
何时对齐,何时预测:多模态学习的相图
机构 * Technion(以色列理工学院) ; Genentech(基因泰克公司) ; Brown University(布朗大学) ; Meta AI, FAIR
AI总结 提出统一线性框架,通过信噪比模型揭示跨模态对齐与预测的互补失效模式,构建四区域相图指导多模态学习目标选择,并在非线性实验中验证。
版本化延迟物化:面向大规模推荐系统的超长序列训练
机构 * Meta Platforms, Inc.(Meta平台)
AI总结 提出版本化延迟物化范式,通过归一化存储和即时序列重建消除数据冗余,支持超长用户交互历史训练,降低存储I/O开销并提升模型质量。
V-JEPA 2.1: 解锁视频自监督学习中的密集特征
机构 * FAIR at Meta(Meta的FAIR) ; Universidad de Zaragoza(萨拉戈萨大学)
AI总结 提出V-JEPA 2.1系列自监督模型,通过密集预测损失、深度自监督、多模态分词器和有效缩放,学习图像和视频的密集高质量视觉表示,在多个基准上取得最优性能。
混合使得马尔可夫上下文在线性赌博机中变得廉价
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Meta, Superintelligence Lab(Meta超智能实验室)
AI总结 针对马尔可夫上下文线性赌博机问题,提出一种基于均匀几何遍历性的约简方法,通过构建平稳替代动作集和延迟更新方案,实现了与标准线性赌博机相当的最坏情况遗憾界。