arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-20 至 2025-11-20 共收录 3 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3 篇

2511.15694 2025-11-20 cs.LG 80%

The Impact of Quantization on Large Reasoning Model Reinforcement Learning

量化对大推理模型强化学习的影响

Medha Kumar, Zifei Xu, Xin Wang, Tristan Webb

机构 * Pennsylvania State University(宾夕法尼亚州立大学) d-Matrix

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文研究了量化对大推理模型强化学习的影响,发现量化感知训练对学习过程有负面影响,而PTQ和QLoRA能提升性能。

Comments Accepted to the NeurIPS 2025 Efficient Reasoning Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15392 2025-11-20 cs.CL cs.AI 73%

DEPO: Dual-Efficiency Preference Optimization for LLM Agents

DEPO:用于LLM代理的双效偏好优化

Sirui Chen, Mengshi Zhao, Lei Xu, Yuying Zhao, Beier Zhu, Hanwang Zhang, Shengjie Zhao, Chaochao Lu

专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 DEPO通过双效偏好优化方法提升LLM代理的效率和性能,减少token和步骤消耗,同时在多个基准测试中表现优异。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15573 2025-11-20 cs.CY 50%

Two-Faced Social Agents: Context Collapse in Role-Conditioned Large Language Models

Vikram K Suresh

专题命中 数学推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏