arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-16 至 2025-12-16 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 6 篇

2508.10019 2025-12-16 cs.CL cs.AI 84%

Decoupling Understanding from Reasoning via Problem Space Mapping for Small-Scale Model Reasoning

通过问题空间映射解耦理解与推理以提升小型模型推理能力

Li Wang, Changhao Zhang, Zengqi Xiu, Kai Lu, Xin Yu, Kui Zhang, Wenjun Wu

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 DURIT通过问题空间映射解耦理解和推理,提升小型模型在数学和逻辑推理任务中的性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24850 2025-12-16 cs.LG cs.AI cs.CL 82%

Harnessing Negative Signals: Reinforcement Distillation from Teacher Data for LLM Reasoning

利用负信号:从教师数据中进行强化蒸馏以提升大语言模型推理能力

Shuyao Xu, Cheng Peng, Jiangxuan Long, Weidi Xu, Wei Chu, Yuan Qi

机构 * National University of Singapore(国立新加坡大学) INF AI

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过强化蒸馏利用正负推理轨迹提升LLM推理性能,实验表明在少量数据下可达到与大量数据训练模型相当的性能。

Comments 22 pages, 10 figures. Code available at https://github.com/Tim-Siu/reinforcement-distillation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13106 2025-12-16 cs.LG cs.AI 81%

TraPO: A Semi-Supervised Reinforcement Learning Framework for Boosting LLM Reasoning

TraPO:一种用于提升大语言模型推理能力的半监督强化学习框架

Shenzhi Yang, Guangcheng Zhu, Xing Zheng, Yingfan MA, Zhongqi Chen, Bowen Song, Weiqiang Wang, Junbo Zhao, Gang Chen, Haobo Wang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 TraPO通过结合少量标注样本与大量未标注样本,提升大语言模型在数学推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02580 2025-12-16 cs.CL 79%

From Imitation to Discrimination: Toward A Generalized Curriculum Advantage Mechanism Enhancing Cross-Domain Reasoning Tasks

从模仿到辨别:一种通用的课程优势机制,增强跨领域推理任务

Changpeng Yang, Jinyang Wu, Yuchen Liu, Shuai Zhang, Yang Li, Qiliang Liang, Hongzhen Wang, Shuai Nie, Jiaming Xu, Runyu Shi, Ying Huang, Guoquan Zhang

机构 * \equalcontrib(1号机构)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 CAPO是一种基于优势信号的自适应课程机制,通过引导模仿学习和引入负信号提升跨领域推理任务的泛化能力。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03846 2025-12-16 cs.CL 70%

Do LLM Evaluators Prefer Themselves for a Reason?

大语言模型评估器为何偏好自己?

Wei-Lin Chen, Zhepei Wei, Xinyu Zhu, Shi Feng, Yu Meng

机构 * University of Virginia(弗吉尼亚大学) George Washington University(乔治华盛顿大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 研究探讨了大语言模型在评估时自我偏好现象的成因,发现更强模型更倾向于偏好自身输出,但其中大部分偏好源于客观质量优势,同时提出通过扩展策略可减少有害自我偏好。

Comments Added LMArena experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13063 2025-12-16 cs.CL cs.AI 62%

LLM Rationalis? Measuring Bargaining Capabilities of AI Negotiators

LLM Rationalis? 测量AI谈判者的协商能力

Cheril Shah, Akshit Agarwal, Kanak Garg, Mourad Heddaya

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了AI谈判者的协商能力,发现LLMs在谈判中系统性地锚定在极端位置,缺乏策略多样性,且协商能力不随模型改进而提升。

Comments Published in the First Workshop on Multi-Turn Interactions in Large Language Models at Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏