arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-24 至 2026-02-24 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 11 篇

2602.18447 2026-02-24 cs.CL cs.AI 84%

ConfSpec: Efficient Step-Level Speculative Reasoning via Confidence-Gated Verification

ConfSpec:通过置信度门控验证实现高效的步骤级推测推理

Siran Liu, Cyril Y. He

机构 * Peking University(北京大学) ScitiX AI

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 ConfSpec通过置信度门控验证框架,在保持准确性的同时,实现高效步骤级推测推理,达到2.24倍的端到端加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19240 2026-02-24 cs.AI 83%

Topology of Reasoning: Retrieved Cell Complex-Augmented Generation for Textual Graph Question Answering

推理拓扑:检索细胞复杂度增强的生成用于文本图问题回答

Sen Zhao, Lincheng Zhou, Yue Chen, Ding Zou

机构 * Academy of Advanced Interdisciplinary Studies, Chongqing University of Posts and Telecommunications(重庆邮电大学先进交叉学科研究院) School of Computer Science and Technology, Chongqing University of Posts and Telecommunications(重庆邮电大学计算机科学与技术学院) Intelligent System Department, Zhongxing Telecom Equipment (ZTE)(中兴电信设备智能系统部)

专题命中 复杂问题求解 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出TopoRAG,通过将文本图提升为细胞复杂度,捕捉高维拓扑依赖,提升文本图问题回答的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23038 2026-02-24 cs.CL cs.AI cs.LG 82%

Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning

通过工具集成强化学习激励LLM裁判的代理推理

Ran Xu, Jingjing Chen, Jiayu Ye, Yu Wu, Jun Yan, Carl Yang, Hongkun Yu

机构 * Emory University(埃默里大学) Google(谷歌) Google Cloud AI Research(谷歌云人工智能研究)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TIR-Judge通过工具集成强化学习提升LLM裁判的推理能力,在多个基准测试中取得显著成效。

Comments ICLR 2026

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15077 2026-02-24 cs.LG cs.DB 79%

Think2SQL: Reinforce LLM Reasoning Capabilities for Text2SQL

Think2SQL: 通过可验证奖励强化学习增强大语言模型的推理能力以实现文本到SQL

Simone Papicchio, Simone Rossi, Luca Cagliero, Paolo Papotti

机构 * Politecnico di Torino(托斯卡纳理工学院) EURECOM

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出Think2SQL方法,通过可验证奖励强化学习增强大语言模型的推理能力,提升文本到SQL任务的性能。

Comments 26 pages, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13614 2026-02-24 cs.CL 79%

MemoTime: Memory-Augmented Temporal Knowledge Graph Enhanced Large Language Model Reasoning

MemoTime: 带记忆的时序知识图增强大语言模型推理

Xingyu Tan, Xiaoyang Wang, Qing Liu, Xiwei Xu, Xin Yuan, Liming Zhu, Wenjie Zhang

机构 * UNSW Data61(新南威尔士大学Data61) CSIRO(澳大利亚联邦科学与工业研究组织) UNSW Sydney Australia(新南威尔士大学悉尼分校) Data61, CSIRO(Data61,澳大利亚联邦科学与工业研究组织)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 MemoTime通过带记忆的时序知识图框架提升LLM的时序推理能力,解决多跳推理、多实体同步、运算符适应和经验重用等挑战,实现先进性能。

Comments Accepted by The Web Conference 2026 (WWW, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19372 2026-02-24 cs.RO cs.CV cs.LG 70%

Seeing Farther and Smarter: Value-Guided Multi-Path Reflection for VLM Policy Optimization

看得更远且更聪明:基于价值引导的多路径反射用于VLM策略优化

Yanting Yang, Shenyuan Gao, Qingwen Bu, Li Chen, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本研究提出了一种基于价值引导的多路径反射方法,用于提升VLM在机器人操作任务中的策略优化性能,通过解耦状态评估与动作生成,提高决策鲁棒性并减少推理时间。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12066 2026-02-24 cs.AI cs.LG 62%

AI Agents as Universal Task Solvers

AI代理作为通用任务求解器

Alessandro Achille, Stefano Soatto

机构 * AWS Agentic AI(AWS 代理人工智能)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出将AI代理视为随机动态系统,通过归纳推理框架,探讨学习推理的算法结构,揭示任务解决时间与算法信息的关系,并指出在无限制模型规模下,奖励信号可能导致暴力求解而非可转移策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19844 2026-02-24 cs.CR cs.AI cs.SE 57%

LLM-enabled Applications Require System-Level Threat Monitoring

依赖大语言模型的应用需要系统级威胁监控

Yedi Zhang, Haoyu Wang, Xianglin Yang, Jin Song Dong, Jun Sun

机构 * Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系) School of Computing and Information Systems, Singapore Management University, Singapore(新加坡管理学院计算机与信息系统学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文主张对依赖大语言模型的应用进行系统级威胁监控,以应对由此带来的安全挑战和确保可靠操作。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19158 2026-02-24 cs.AI 57%

DoAtlas-1: A Causal Compilation Paradigm for Clinical AI

DoAtlas-1:一种用于临床AI的因果编译范式

Yulong Li, Jianxu Chen, Xiwei Liu, Chuanyue Suo, Rong Xia, Zhixiang Lu, Yichen Li, Xinlin Zhuang, Niranjana Arun Menon, Yutong Xie, Eran Segal, Imran Razzak

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 DoAtlas-1通过因果编译范式将医学证据转化为可执行代码,提升临床AI的可审计性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00574 2026-02-24 cs.LG 57%

Bayesian Network Structure Discovery Using Large Language Models

利用大语言模型进行贝叶斯网络结构发现

Yinghuan Zhang, Yufei Zhang, Parisa Kordjamshidi, Zijun Cui

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Michigan State University(密歇根州立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文提出了一种利用大语言模型进行贝叶斯网络结构发现的统一框架,支持数据自由和数据感知设置,在无数据场景下通过PromptBN生成完整DAG,在有数据时通过ReActBN进一步优化结构。

Comments Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12268 2026-02-24 cs.AI 57%

CM2: Reinforcement Learning with Checklist Rewards for Multi-Turn and Multi-Step Agentic Tool Use

CM2:基于检查清单奖励的多轮多步代理工具使用的强化学习

Zhen Zhang, Kaiqiang Song, Xun Wang, Yebowen Hu, Weixiang Yan, Chenyang Zhao, Henry Peng Zou, Haoyun Deng, Sathish Reddy Indurthi, Shujian Liu, Simin Ma, Xiaoyang Wang, Xin Eric Wang, Song Wang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 CM2通过检查清单奖励提升多轮多步骤代理工具使用的强化学习效果,实现比监督微调更优的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏