arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-20 至 2026-02-20 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 6 篇

2505.17508 2026-02-20 cs.LG cs.AI cs.CL 83%

On the Design of KL-Regularized Policy Gradient Algorithms for LLM Reasoning

关于为LLM推理设计KL正则化策略梯度算法的设计

Yifan Zhang, Yifeng Liu, Huizhuo Yuan, Yang Yuan, Quanquan Gu, Andrew Chi-Chih Yao

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RPG通过统一KL正则化方法和改进的梯度估计,提升LLM推理准确率,实现稳定且可扩展的强化学习算法。

Comments Published in ICLR 2026; Project Page: https://github.com/complex-reasoning/RPG

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17025 2026-02-20 cs.LG 79%

WS-GRPO: Weakly-Supervised Group-Relative Policy Optimization for Rollout-Efficient Reasoning

WS-GRPO:弱监督组相对策略优化用于高效推理

Gagan Mundada, Zihan Huang, Rohan Surana, Sheldon Yu, Jennifer Yuntong Zhang, Xintong Li, Tong Yu, Lina Yao, Jingbo Shang, Julian McAuley, Junda Wu

机构 * University of California, San Diego(加州大学圣地亚哥分校) University of Toronto(多伦多大学) Adobe Research(Adobe研究) The University of New South Wales(新南威尔士大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 WS-GRPO 通过将终端奖励转换为正确性感知的指导,提高推理效率并减少冗余思考,同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17097 2026-02-20 cs.SD 67%

AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing

AudioChat: 通过Transfusion Forcing实现统一的音频讲故事、编辑与理解

William Chen, Prem Seetharaman, Rithesh Kumar, Oriol Nieto, Shinji Watanabe, Justin Salamon, Zeyu Jin

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Adobe Research(Adobe研究) OpenAI. Work performed while at Adobe(OpenAI)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)

AI总结 AudioChat通过Transfusion Forcing实现音频故事的生成、编辑与理解,结合LLM工具调用和结构化推理提升多轮交互能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17221 2026-02-20 cs.AI cs.CL cs.CY 62%

From Labor to Collaboration: A Methodological Experiment Using AI Agents to Augment Research Perspectives in Taiwan's Humanities and Social Sciences

从劳动到协作:利用AI代理增强台湾人文社会科学研究视角的方法学实验

Yi-Chih Huang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于AI代理的协作研究流程,通过实证分析验证其在人文社会科学中的可行性,并识别三种人机协作模式。

Comments also in Chinese

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12414 2026-02-20 cs.CL 57%

propella-1: Multi-Property Document Annotation for LLM Data Curation at Scale

propella-1:大规模LLM数据整理中的多属性文档标注

Maximilian Idahl, Benedikt Droste, Björn Plüster, Jan Philipp Harries

机构 * ellamind Leibniz University Hannover(汉诺威莱布尼茨大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 propella-1通过多属性文档标注提升大规模LLM数据整理的效率和质量,揭示预训练数据集在质量、推理深度和内容组成上的显著差异。

Comments Release: https://hf.co/collections/ellamind/propella-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18899 2026-02-20 cs.AI 57%

GAI: Generative Agents for Innovation

生成式智能体:创新的生成式智能体

Masahiro Sato

机构 * Tohoku University(东大大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 GAI通过生成式智能体的集体推理和内部状态机制,实现了对创新过程的模拟与复制。

Comments Added an Appendix section

详情

展开后加载摘要…

URL PDF HTML 收藏