Learning to Use Tools: Reinforcement Learning for Tool-Integrated Mathematical Reasoning
学习使用工具:用于工具集成数学推理的强化学习
机构 * Stanford University(斯坦福大学)
AI总结 本研究针对Countdown任务,构建工具使用的SFT数据集并采用多种强化学习方法,结合计算器工具集成提升LLM数学推理,使pass@1达66.0%,显著降低计算与验证错误。
高校专区
学习使用工具:用于工具集成数学推理的强化学习
机构 * Stanford University(斯坦福大学)
AI总结 本研究针对Countdown任务,构建工具使用的SFT数据集并采用多种强化学习方法,结合计算器工具集成提升LLM数学推理,使pass@1达66.0%,显著降低计算与验证错误。
双向扩散桥用于多模态转换:往返之道
机构 * Stanford University(斯坦福大学)
AI总结 针对现有多模态转换方法的不足,提出BIT双向图像-文本扩散桥,实现双向生成且性能优于基线。
报告监督
机构 * Johns Hopkins University(约翰斯·霍普金斯大学) ; University Hospital Basel(巴塞尔大学医院) ; Stanford University(斯坦福大学) ; University of California, San Francisco(加利福尼亚大学旧金山分校) ; Italian Institute of Technology(意大利技术研究院) ; University of Bologna(博洛尼亚大学) ; École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) ; Johns Hopkins Medicine(约翰斯·霍普金斯医疗集团)
AI总结 本研究提出报告监督(R-Super)框架,利用大量放射学报告补充稀缺的肿瘤掩码训练数据,在肾脏和胰腺肿瘤分割任务上显著提升了AI的检测与分割性能。
Comments Published in Medical Image Analysis, 2026
AgentFold:用于蛋白质折叠模型设计的闭环智能体搜索
机构 * Hunan University(湖南大学) ; Nanjing University(南京大学) ; The Chinese University of Hong Kong(香港中文大学) ; Zhejiang University(浙江大学) ; Yale University(耶鲁大学) ; Wuhan University of Science and Technology(武汉科技大学) ; Southeast University(东南大学) ; Stanford University(斯坦福大学)
AI总结 AgentFold是将蛋白质折叠模型开发转化为闭环搜索的多智能体框架,以ESMFold为起点,通过MCTS策略分配计算资源,在匹配预算下较Codex提案提升lDDT 7.5%,优于随机搜索。
信任海量:KV缓存驱逐中的强制权重
机构 * Stanford University(斯坦福大学)
AI总结 该研究针对KV缓存驱逐规则,通过分析168192个注意力行的最优子集情况,提出无需训练的分配器ContourKV,其在配对比较中表现优于多数现有技术,且与最强基线持平。
Comments 18 pages; revised wording in 2.3 for increased accuracy (main results unchanged)
离散对数时钟:Transformer如何学习模乘法
机构 * Stanford University(斯坦福大学)
AI总结 通过乘法特征变换分析,发现Transformer在模乘法任务中学习到稀疏的傅里叶谱,其嵌入和MLP神经元主要编码少数乘法频率,表明模型实现了离散对数空间中的加法运算,即“离散对数时钟”算法。
Comments 5 pages, 5 figures. Accepted to the Mechanistic Interpretability Workshop at ICML 2026
学习的中继表示用于前向思考的离散扩散模型
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; University of Toronto(多伦多大学) ; Stanford University(斯坦福大学) ; Imperial College London(伦敦帝国学院) ; Mila ; Vijil
AI总结 提出Learned Relay Representations (Relay)方法,通过可微通道传递潜在信息,使掩码扩散模型在去噪步骤间前向思考,减少推理延迟并提升性能。
Comments 16 pages, 3 figures. Equal contribution: Benjamin Rozonoyer, Jacopo Minniti, and Dhruvesh Patel. Code: this https URL (https://github.com/jacopo-minniti/relay)
ABC:通过非马尔可夫扩散桥实现连续时间和空间中的任意子集自回归
机构 * Stanford University(斯坦福大学)
AI总结 本文提出ABC模型,通过非马尔可夫扩散桥在连续时间和空间中实现任意子集的自回归,解决了传统方法在结构相似性捕捉、噪声注入和条件化任意子集方面的不足。
SemEnrich:用于视觉-语言学习的医学报告语义增强
机构 * Stanford University(斯坦福大学) ; Stanford Center For Biomedical Informatics Research(斯坦福生物医学信息学研究中心)
AI总结 本文提出一种自监督的医学报告语义增强方法,通过句子语义聚类来丰富训练集中的阳性/中性发现,从而提升视觉-语言学习性能。
当城市教导汽车:从基础设施实现无标签的3D感知
机构 * The Ohio State University(俄亥俄州立大学) ; Google(谷歌) ; Cornell University(康奈尔大学) ; Stanford University(斯坦福大学) ; Boston University(波士顿大学)
AI总结 本文提出一种无标签的3D感知方法,利用道路设施作为无监督教师,通过固定视角和重复观测学习局部3D检测器,并广播预测作为伪标签监督,无需基础设施即可训练独立的车辆检测器。
Comments ECCV 2026; Project Page: this https URL (https://jinsuyoo.info/civet/)