Learning to Use Tools: Reinforcement Learning for Tool-Integrated Mathematical Reasoning
学习使用工具:用于工具集成数学推理的强化学习
机构 * Stanford University(斯坦福大学)
AI总结 本研究针对Countdown任务,构建工具使用的SFT数据集并采用多种强化学习方法,结合计算器工具集成提升LLM数学推理,使pass@1达66.0%,显著降低计算与验证错误。
高校专区
学习使用工具:用于工具集成数学推理的强化学习
机构 * Stanford University(斯坦福大学)
AI总结 本研究针对Countdown任务,构建工具使用的SFT数据集并采用多种强化学习方法,结合计算器工具集成提升LLM数学推理,使pass@1达66.0%,显著降低计算与验证错误。
双向扩散桥用于多模态转换:往返之道
机构 * Stanford University(斯坦福大学)
AI总结 针对现有多模态转换方法的不足,提出BIT双向图像-文本扩散桥,实现双向生成且性能优于基线。
报告监督
机构 * Johns Hopkins University(约翰斯·霍普金斯大学) ; University Hospital Basel(巴塞尔大学医院) ; Stanford University(斯坦福大学) ; University of California, San Francisco(加利福尼亚大学旧金山分校) ; Italian Institute of Technology(意大利技术研究院) ; University of Bologna(博洛尼亚大学) ; École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) ; Johns Hopkins Medicine(约翰斯·霍普金斯医疗集团)
AI总结 本研究提出报告监督(R-Super)框架,利用大量放射学报告补充稀缺的肿瘤掩码训练数据,在肾脏和胰腺肿瘤分割任务上显著提升了AI的检测与分割性能。
Comments Published in Medical Image Analysis, 2026