arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-19 至 2026-01-19 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 7 篇

2601.11255 2026-01-19 cs.CL cs.LG 81%

Reasoning in Trees: Improving Retrieval-Augmented Generation for Multi-Hop Question Answering

树状推理:改进多跳问题回答的检索增强生成

Yuling Shi, Maolin Sun, Zijun Liu, Mo Yang, Yixiong Fang, Tianran Sun, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 RT-RAG通过构建推理树来提升多跳问题回答的准确性和一致性,实验结果显示其在F1和EM指标上均优于现有方法。

Comments Accepted to GLOW@WWW2026. Code available at https://github.com/sakura20221/RT-RAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10825 2026-01-19 cs.CL cs.CY cs.LG 81%

Reasoning Models Generate Societies of Thought

推理模型生成思想社会

Junsol Kim, Shiyang Lai, Nino Scherrer, Blaise Agüera y Arcas, James Evans

机构 * Google, Paradigms of Intelligence Team(谷歌,智能范式团队) University of Chicago(芝加哥大学) Santa Fe Institute(圣达菲研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 推理模型通过模拟多代理互动生成思想社会,提升推理准确性与多样性,揭示了社会结构对问题解决的促进作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11252 2026-01-19 cs.AI 79%

Beyond Model Scaling: Test-Time Intervention for Efficient Deep Reasoning

超越模型扩展:用于高效深度推理的测试时干预

Qianyue Wang, Jinwu Hu, Yufeng Wang, Huanxiang Lin, Bolin Chen, Zhiquan Wen, Yaofo Chen, Mingkui Tan

机构 * South China University of Technology(华南理工大学) Pazhou Laboratory(琶洲实验室) Peng Cheng Laboratory(鹏城实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 Think-with-Me通过测试时干预提升深度推理效率,实现准确性和推理长度的平衡,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07128 2026-01-19 cs.CL 79%

DeepSeek-R1 Thoughtology: Let's think about LLM Reasoning

DeepSeek-R1 思维学:让我们思考LLM推理

Sara Vera Marjanović, Arkil Patel, Vaibhav Adlakha, Milad Aghajohari, Parishad BehnamGhader, Mehar Bhatia, Aditi Khandelwal, Austin Kraft, Benno Krojer, Xing Han Lù, Nicholas Meade, Dongchan Shin, Amirhossein Kazemnejad, Gaurav Kamath, Marius Mosbach, Karolina Stańczak, Siva Reddy

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 DeepSeek-R1通过多步骤推理链实现复杂问题解决,研究揭示其推理性能的'甜点'及潜在安全漏洞。

Comments 135 pages, Published to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11332 2026-01-19 cs.CL 57%

Idea First, Code Later: Disentangling Problem Solving from Code Generation in Evaluating LLMs for Competitive Programming

先有想法,后写代码:在评估LLM用于竞技编程时,将问题解决与代码生成解耦

Sama Hadhoud, Alaa Elsetohy, Frederikus Hudi, Jan Christian Blaise Cruz, Steven Halim, Alham Fikri Aji

机构 * MBZUAI NAIST National University of Singapore(国立新加坡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出通过编辑稿而非代码来评估LLM在竞技编程中的问题解决能力,并引入数据集和评估方法,强调区分问题解决与实现的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11024 2026-01-19 cs.IR 50%

PruneRAG: Confidence-Guided Query Decomposition Trees for Efficient Retrieval-Augmented Generation

PruneRAG: 基于置信度的查询分解树用于高效的检索增强生成

Shuguang Jiao, Xinyu Xiao, Yunfan Wei, Shuhan Qi, Chengkai Huang, Quan Z. Michael Sheng, Lina Yao

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 PruneRAG通过基于置信度的查询分解树,提升检索增强生成的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18776 2026-01-19 cs.SE 50%

ThinkFL: Self-Refining Failure Localization for Microservice Systems via Reinforcement Fine-Tuning

ThinkFL: 通过强化微调实现微服务系统的自完善故障定位

Lingzhe Zhang, Yunpeng Zhai, Tong Jia, Chiming Duan, Siyu Yu, Jinyang Gao, Bolin Ding, Zhonghai Wu, Ying Li

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 ThinkFL通过强化微调提升微服务系统故障定位的准确性和效率,显著降低延迟并增强适应性。

Comments accepted by TOSEM'26

详情

展开后加载摘要…

URL PDF HTML 收藏