arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-02 至 2026-02-02 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 11 篇

2601.22617 2026-02-02 cs.AI 88%

EntroCut: Entropy-Guided Adaptive Truncation for Efficient Chain-of-Thought Reasoning in Small-scale Large Reasoning Models

EntroCut: 基于熵的自适应截断以提高小型大推理模型中的链式推理效率

Hongxi Yan, Qingjie Liu, Yunhong Wang

机构 * 1 Beihang University, School of Computer Science \& Engineering, China 2 Zhongguancun Laboratory, China 3 Hangzhou Innovation Institute, China

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.AI

AI总结 EntroCut通过基于熵的自适应截断方法,显著提高小型大推理模型的推理效率,同时保持较高的准确性。

Comments Accepted by ICASSP26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09133 2026-02-02 cs.AI cs.LG math.ST stat.TH 81%

On the Provable Performance Guarantee of Efficient Reasoning Models

关于高效推理模型的可证明性能保证

Hao Zeng, Jianguo Huang, Bingyi Jing, Hongxin Wei, Bo An

机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) Southern University of Science(南方科技大学) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出PAC推理方法,通过动态切换思考与非思考模式,在用户指定容忍度下控制性能损失,实现高效推理与性能保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23032 2026-02-02 cs.AI 79%

Guided by Trajectories: Repairing and Rewarding Tool-Use Trajectories for Tool-Integrated Reasoning

轨迹引导:修复与奖励工具使用轨迹以实现工具集成推理

Siyu Gong, Linan Yue, Weibo Gao, Fangzhou Yao, Shimin Di, Lei Feng, Min-Ling Zhang

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院) Key Lab. of Computer Network and Information Integration (Southeast University), MOE, China(计算机网络与信息集成重点实验室(东南大学)) State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China, Hefei, China(认知智能国家重点实验室(中国科学技术大学))

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 AutoTraj通过自动修复和奖励工具使用轨迹,提升大型语言模型在工具集成推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17621 2026-02-02 cs.LG 79%

Navigate the Unknown: Enhancing LLM Reasoning with Intrinsic Motivation Guided Exploration

穿越未知:通过内在动机引导的探索增强大语言模型推理

Jingtong Gao, Ling Pan, Yejing Wang, Rui Zhong, Chi Lu, Maolin Wang, Qingpeng Cai, Peng Jiang, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 IMAGINE通过内在动机引导的探索增强大语言模型推理能力,提升复杂任务性能22.23%

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22536 2026-02-02 cs.AI 79%

Decoding in Geometry: Alleviating Embedding-Space Crowding for Complex Reasoning

解码中的几何学:缓解嵌入空间拥挤以促进复杂推理

Yixin Yang, Qingxiu Dong, Zhifang Sui

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出CraEG方法,通过几何引导重新加权缓解嵌入空间拥挤,提升大语言模型在数学问题解决中的推理能力和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08140 2026-02-02 cs.AI cs.FL cs.LG 73%

Lost in Transmission: When and Why LLMs Fail to Reason Globally

在传输中迷失:当且为什么大语言模型无法全球推理

Tobias Schnabel, Kiran Tomlinson, Adith Swaminathan, Jennifer Neville

专题命中 复杂问题求解 :reasoning(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 研究指出大语言模型在处理需要高带宽通信的任务时存在能力限制,并通过BAPO模型证明了链式思维能将复杂问题简化为易处理形式。

Comments 39 pages; NeurIPS 2025, spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10543 2026-02-02 cs.AI cs.CL 62%

Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing

通过解码过程中的安全意识探测防御大型语言模型的劫持攻击

Yinzhi Zhao, Ming Wang, Shi Feng, Xiaocui Yang, Daling Wang, Yifei Zhang

机构 * Northeastern University, China(东北大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 通过在解码过程中激活内在安全意识,提升大型语言模型对劫持攻击的防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22885 2026-02-02 cs.CL 57%

Leveraging LLMs For Turkish Skill Extraction

利用LLMs进行土耳其语技能提取

Ezgi Arslan İltüzer, Özgür Anıl Özlü, Vahid Farajijobehdar, Gülşen Eryiğit

机构 * Kariyer.net, R&D Center(Kariyer.net 研发中心) Istanbul Technical University(伊斯坦布尔技术大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文利用LLMs提升土耳其语技能提取性能,提出首个土耳其语技能提取数据集,并通过端到端流程实现0.56的性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21558 2026-02-02 cs.CL 57%

ASTRA: Automated Synthesis of agentic Trajectories and Reinforcement Arenas

ASTRA: 自动化合成代理轨迹与强化环境

Xiaoyu Tian, Haotian Wang, Shuaiting Chen, Hao Zhou, Kaichi Yu, Yudian Zhang, Jade Ouyang, Junxi Yin, Jiong Chen, Baoyan Guo, Lei Zhang, Junjie Tao, Yuansheng Song, Ming Cui, Chengwei Liu

机构 * Beike Language and Intelligence(北溪语言与智能)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 ASTRA通过可扩展数据合成和可验证强化学习,自动化训练工具增强语言模型代理,实现多轮稳定学习和高性能工具使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13926 2026-02-02 cs.CL 57%

BioMedSearch: A Multi-Source Biomedical Retrieval Framework Based on LLMs

BioMedSearch: 基于LLMs的多源生物医学检索框架

Congying Liu, Xingyuan Wei, Peipei Liu, Yiqing Shen, Yanxu Mao, Tiehan Cui

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Johns Hopkins University(约翰霍普金斯大学) Henan University(河南大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 BioMedSearch基于LLMs构建多源生物医学检索框架,通过整合文献、蛋白质数据库和网络搜索,提升复杂生物医学问题的准确回答能力。

Journal ref Proceedings of the IEEE International Conference on Bioinformatics and Biomedicine (BIBM), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08613 2026-02-02 cs.CL 57%

GraphGhost: Tracing Structures Behind Large Language Models

GraphGhost: 探索大型语言模型背后的结构

Xinnan Dai, Xianxuan Long, Chung-Hsiang Lo, Kai Guo, Shenglai Zeng, Dongsheng Luo, Jiliang Tang

机构 * Michigan State University(密歇根州立大学) Northeastern University(东北大学) Florida International University(佛罗里达国际大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 GraphGhost通过图分析揭示大型语言模型内部结构,捕捉推理过程中的关键节点与信息流,为理解模型决策提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏