arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-01 至 2026-01-01 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 8 篇

2512.23988 2026-01-01 cs.CL cs.AI cs.LG 85%

Fantastic Reasoning Behaviors and Where to Find Them: Unsupervised Discovery of the Reasoning Process

非凡的推理行为及其发现位置:无监督发现推理过程

Zhenyu Zhang, Shujian Zhang, John Lambert, Wenxuan Zhou, Zhangyang Wang, Mingqing Chen, Andrew Hard, Rajiv Mathews, Lun Wang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Google DeepMind(谷歌DeepMind)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出无监督框架RISE,通过稀疏自编码器发现LLM推理行为,揭示可解释的推理特征并控制推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23713 2026-01-01 cs.CL cs.AI 84%

PyBangla at BLP-2025 Task 2: Enhancing Bangla-to-Python Code Generation with Iterative Self-Correction and Multilingual Agents

在BLP-2025任务2中提升孟加拉语到Python代码生成:通过迭代自我纠正和多语言代理

Jahidul Islam, Md Ataullha, Saiful Azad

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出BanglaCodeAct框架,通过多代理提示和迭代自我纠正,提升孟加拉语到Python代码生成的性能,实验显示Qwen3-8B结合该框架在开发集和盲测集上分别达到94.0%和71.6%的准确率。

Comments 6 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00743 2026-01-01 cs.CL cs.AI cs.LG 82%

Multi-step retrieval and reasoning improves radiology question answering with large language models

多步检索与推理提升大型语言模型在放射学问答中的表现

Sebastian Wind, Jeta Sopa, Daniel Truhn, Mahshad Lotfinia, Tri-Thien Nguyen, Keno Bressem, Lisa Adams, Mirabela Rusu, Harald Köstler, Gerhard Wellein, Andreas Maier, Soroosh Tayebi Arasteh

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RaR通过多步检索与推理提升放射学问答中大型语言模型的诊断准确性和事实一致性。

Comments Published in npj Digital Medicine

Journal ref npj Digit. Med. 8, 790 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24613 2026-01-01 cs.AI 79%

Group Deliberation Oriented Multi-Agent Conversational Model for Complex Reasoning

面向复杂推理的群体讨论导向多智能体对话模型

Zheyu Shi, Dong Qiu, Shanlong Yu

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种群体讨论导向的多智能体对话模型,通过三级角色架构和改进的优化策略,提升复杂推理任务的准确性和一致性。

Comments Accepted by IEEE ITCA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23848 2026-01-01 cs.CL cs.CE cs.LG 62%

Integrating Domain Knowledge for Financial QA: A Multi-Retriever RAG Approach with LLMs

在金融问答中整合领域知识:一种基于多检索器RAG方法与LLM的多检索器RAG方法

Yukun Zhang, Stefan Elbl Droguett, Samyak Jain

机构 * Department of Computer Science Stanford University(计算机科学系 斯坦福大学) Graduate School of Business Stanford University(商学院 斯坦福大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出一种基于多检索器RAG方法与LLM的金融问答系统,通过领域知识训练提升数值推理能力,验证了领域特定训练在不同模型规模下的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24615 2026-01-01 cs.AI 57%

Youtu-Agent: Scaling Agent Productivity with Automated Generation and Hybrid Policy Optimization

Youtu-Agent:通过自动化生成和混合策略优化提升代理生产力

Yuchen Shi, Yuzheng Cai, Siqi Cai, Zihan Xu, Lichao Chen, Yulei Qin, Zhijian Zhou, Xiang Fei, Chaofan Qiu, Xiaoyu Tan, Gang Li, Zongyi Li, Haojia Lin, Guocan Cai, Yong Mao, Yunsheng Wu, Ke Li, Xing Sun

机构 * Youtu-Agent Team(优图代理团队)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 Youtu-Agent通过自动化生成和混合策略优化提升LLM代理的生产力和性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23824 2026-01-01 cs.LG 57%

MS-SSM: A Multi-Scale State Space Model for Efficient Sequence Modeling

MS-SSM:一种用于高效序列建模的多尺度状态空间模型

Mahdi Karami, Ali Behrouz, Peilin Zhong, Razvan Pascanu, Vahab Mirrokni

机构 * Google Research(谷歌研究) Google DeepMind(谷歌DeepMind)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 MS-SSM通过多尺度状态空间模型提升序列建模效率,尤其在长程和分层任务中表现优异。

Comments In Second Conference on Language Modeling (COLM) (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22386 2026-01-01 cs.IR 50%

OxygenREC: An Instruction-Following Generative Framework for E-commerce Recommendation

OxygenREC: 一种用于电商推荐的指令遵循生成框架

Xuegang Hao, Ming Zhang, Alex Li, Xiangyu Qian, Zhi Ma, Yanlong Zang, Shijie Yang, Zhongxuan Han, Xiaolong Ma, Jinguang Liu, Zhen Li, Zhida Jiang, Shusheng Wang, Ning Tang, Yanchen Qiao, Chenxiang Yang, Chen Sun, Jincheng Yuan, Chunhua Peng, Heng Hu, Peijun Yang, Baopeng Yuan, Caiyun Qiu, Zhaolong Xing, Haofei Yuan, Haipeng Zhang, Yuzhang Guo, Weijie Ding, Jiahua Gao, Hao Huang, Zhen Chen, Tongxuan Liu, Pinghua Gong

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 OxygenREC通过快慢思考架构和语义对齐机制,实现低延迟多场景的深度推荐推理。

Comments 37 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏