Disentangling Mathematical Reasoning in LLMs: A Methodological Investigation of Internal Mechanisms
解构大语言模型中的数学推理:对内部机制的调查
Tanja Baeumel, Josef van Genabith, Simon Ostermann
机构
*
German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)
;
Saarland University(萨尔兰大学)
;
Center for European Research in Trusted AI (CERTAIN)(可信人工智能欧洲研究中心)
Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards
用评分奖励模型治愈大语言模型数学推理中的奇迹步骤
Youliang Yuan, Qiuyang Mang, Jingbang Chen, Hong Wan, Xiaoyuan Liu, Junjielong Xu, Jen-tse Huang, Wenxuan Wang, Wenxiang Jiao, Pinjia He
机构
*
School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(数据科学学院,香港中文大学(深圳))
;
UC Berkeley(加州大学伯克利分校)
;
Zhejiang University(浙江大学)
;
Johns Hopkins University(约翰霍普金斯大学)
;
Renmin University of China(中国人民大学)
;
Xiaohongshu Inc.(小红书公司)
Document-Level Numerical Reasoning across Single and Multiple Tables in Financial Reports
跨单表和多表的财务报告中数字推理
Yi-Cheng Wang, Wei-An Wang, Chu-Song Chen
机构
*
Department of Computer Science and Information Engineering, National Taiwan University(国立台湾大学资讯工程学系)
;
FinTech Center, National Taiwan University(国立台湾大学金融科技中心)
BioAlchemy: Distilling Biological Literature into Reasoning-Ready Reinforcement Learning Training Data
生物炼金术:将生物文献提炼为可用于强化学习训练的数据
Brian Hsu, Ozan Gökdemir, Carlo Siebenschuh, Bruce Parrello, Neil Getty, Thomas S. Brettin, Rick L. Stevens, Ian T. Foster, Nicholas Chia, Arvind Ramanathan
机构
*
University of Chicago(芝加哥大学)
;
Argonne National Laboratory(阿贡国家实验室)
Distilling the Thought, Watermarking the Answer: A Principle Semantic Guided Watermark for Large Reasoning Models
提炼思维,标注答案:一种基于原则语义的水印方法用于大型推理模型
Shuliang Liu, Xingyu Li, Hongyi Liu, Dong Fang, Yibo Yan, Bingchen Duan, Qi Zheng, Lingfeng Su, Xuming Hu
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
The Hong Kong University of Science and Technology(香港科技大学)
;
LIGHTSPEED(光速)
ARISE: Agent Reasoning with Intrinsic Skill Evolution in Hierarchical Reinforcement Learning
ARISE: 在分层强化学习中通过内在技能进化实现智能体推理
Yu Li, Rui Miao, Zhengling Qi, Tian Lan
机构
*
Department of Electrical and Computer Engineering, George Washington University(乔治华盛顿大学电气与计算机工程系)
;
Department of Mathematical Sciences, University of Texas at Dallas(德克萨斯大学达拉斯分校数学科学系)
;
School of Business, George Washington University(乔治华盛顿大学商学院)