arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-25 至 2026-08-25 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 14 篇

2412.06769 2026-08-25 cs.CL 版本更新 90%

Training Large Language Models to Reason in a Continuous Latent Space

训练大型语言模型在连续潜在空间中进行推理

Shibo Hao, Sainbayar Sukhbaatar, DiJia Su, Xian Li, Zhiting Hu, Jason Weston, Yuandong Tian

机构 * FAIR at Meta(Meta 的 FAIR)

专题命中 逻辑推理 :CoT(summary_cn,abstract);chain-of-thought(abstract,abstract_cn);reasoning(abstract);planning(abstract)

AI总结 本文提出名为Coconut的连续思维链新范式,将LLM推理状态表示为连续潜在空间中的隐藏状态,支持广度优先搜索,在需大量搜索的逻辑推理任务上优于CoT,实现更优的准确率效率权衡。

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16419 2026-08-25 cs.LG cs.AI q-bio.QM 版本更新 88%

PertMind: Eliciting Emergent Biological Reasoning in LLM via Reinforcement Learning on Cellular Perturbation Data

PertMind:通过细胞扰动数据的强化学习在大语言模型中引出涌现生物推理能力

Zhenchao Tang, Xiaogang Xu, Tianxu Lv, Jiahui Guan, Jiale Zhou, Haohuai He, Zhi Song, Hanbo Huang, Jiehui Huang, Jiafei Wu, Zhe Liu

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出PertMind模型,结合可信轨迹监督初始化与多层面强化信号,以细胞扰动图谱为强化学习环境训练,实现生物推理能力的涌现,且可迁移至多类生物任务。

Comments Withdrawn because one or more co-authors do not consent to the public posting of this work on arXiv. No replacement version will be submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22472 2026-08-25 cs.AI cs.CL 新提交 81%

Small Reasoning Models are Instruction Followers in Function Calling

小型推理模型是函数调用中的指令跟随者

Yalda Taheri, Mohammad Hassan Heydari, Erfan Naaman, Afsaneh Fatemi

机构 * Islamic Azad University(伊斯兰阿扎德大学) University of Isfahan(伊斯法罕大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出指令跟随式函数调用(IFFC)框架,将函数调用逻辑与主大语言模型解耦,交由专用小型模型处理,其性能优于原生和基于提示的函数调用基线,可高效部署于边缘计算场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21897 2026-08-25 cs.AI 新提交 79%

From Solver Feedback to Faithful Plans: Multi-Role Reinforcement Learning for Symbolic Planning

从求解器反馈到可信规划:用于符号规划的多角色强化学习

Chenghao Zhang, Yikai Mao, Shanqi Liu, Haoyu Gao, SaiSai Hu, Dan Roth

机构 * University of Pennsylvania(宾夕法尼亚大学) Georgia Institute of Technology(佐治亚理工学院) Pace University(佩斯大学)

专题命中 逻辑推理 :planning(title,abstract);分类 cs.AI

AI总结 该研究提出基于求解器的多角色强化学习框架,仅用求解器反馈实现无人工演示的自然语言转PDDL,在PlanBench上显著提升规划成功率与可信性,降低语义漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10390 2026-08-25 cs.AI 版本更新 79%

Neural-Symbolic Reasoning over Knowledge Graphs: A Survey from a Query Perspective

面向知识图谱的神经符号推理:一种查询视角的综述

Lihui Liu, Zihao Wang, Hanghang Tong

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该综述从查询视角全面梳理知识图谱推理,涵盖神经符号推理分类及与大语言模型的融合,旨在为多领域研究者提供当前态势与未来方向的相关见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21431 2026-08-25 cs.CV cs.MM 新提交 78%

Boosting Knowledge-based Visual Question Answering with Structured Context Reasoning

基于结构化上下文推理提升基于知识的视觉问答性能

Qiyou Liu, Yong Zhang, Jianjie Luo, Zhenguo Yang, Yi Yu

机构 * School of Computer Science, Guangdong University of Technology(广东工业大学计算机学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Graduate School of Advanced Science and Engineering, Hiroshima University(广岛大学先进科学与工程研究生院)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文提出SCoRe框架,通过上下文获取、选择、压缩三阶段处理多模态知识,在OK-VQA和A-OKVQA基准上性能优于现有最优方法,提升了基于知识的视觉问答效果。

Comments Accepted by ICME 2026. Source code is available at this https URL (https://github.com/WISLab-GDUT/SCoRe)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20719 2026-08-25 cs.SD cs.AI cs.MM eess.AS 版本更新 74%

ONOTE: Hypergraph-Grounded Omnimodal Reasoning for Computational Music Science

ONOTE:面向专家级音乐智能的多模态记谱处理基准测试

Menghe Ma, Siqing Wei, Yuecheng Xing, Ziyue Zhu, Zhenghong Lin, Yaheng Wang, Fanhong Meng, Peijun Han, Luu Anh Tuan, Haoran Luo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

专题命中 逻辑推理 :reasoning(title);分类 cs.AI

AI总结 本文提出ONOTE基准测试,通过确定性流程消除记谱系统偏差,揭示多模态模型在感知准确性和音乐理论理解间的根本分歧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21364 2026-08-25 cs.CL cs.AI cs.MM 新提交 62%

Distinguishing Revision and Delayed Elaboration in Incremental Narrative Interpretation

增量叙事理解中修订与延迟阐释的区分

Yi-Chun Chen

机构 * National Cheng Kung University(成功大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究区分增量叙事理解中的修订与延迟阐释两种更新算子,以视觉叙事为域验证结构化表征可支持二者,其结构差异对增量推理及混合符号-神经系统具重要意义。

Comments Accepted as a full paper for presentation at the 2026 Workshop on Computational Models of Narrative (CMN 2026). This preprint corresponds to the workshop version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20507 2026-08-25 cs.AI cs.LG 版本更新 62%

CacheSpec: Finding the Sweet Spot for Small Models in Large Language Models

MiniCache:用于高效大语言模型推理的具有小模型接口的可重复使用程序缓存

Jingquan Chen, Jie Feng, Jinghua Piao, Shaogang Hu, Yong Li

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型推理成本高的问题,提出MiniCache框架,将PoT程序转换为参数化缓存对象,通过重用小模型进行语义变量提取和推测性起草,减少目标大语言模型调用,实验证明其能提升推理性能,平衡延迟、缓存重用和准确性。

Comments Accepted by EMNLP 2026, codes via this https URL (https://github.com/chenjqQAQ/CacheSpec)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01479 2026-08-25 cs.LO cs.AI 版本更新 61%

An Information-Flow Perspective on Explainability Requirements: Specification and Verification

可解释性需求的信息流视角:规范与验证

Bernd Finkbeiner, Hadar Frenkel, Julian Siber

机构 * CISPA Helmholtz Center for Information Security(信息安全研究中心)

专题命中 逻辑推理 :reasoning(abstract,comments);分类 cs.AI

AI总结 该研究从信息流视角,采用扩展反事实因量化的认知时态逻辑,提出可解释性需求的规范与验证方法,实现有限状态模型的可解释性检查,可区分可解释与不可解释系统并支持隐私需求设定。

Comments This is an extended and corrected version of the paper presented at the 22nd International Conference on Principles of Knowledge Representation and Reasoning (KR 2025); see the appendix for details

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23543 2026-08-25 cs.AI 新提交 57%

How AI Assistance Affects Human Skill Development: A Study of Learning with Logic Puzzles

AI辅助如何影响人类技能发展:一项基于逻辑谜题学习的研究

Shang Wu, Catarina G Belem, Shuyuan Fu, Mark Steyvers, Padhraic Smyth

机构 * University of California, Irvine(加利福尼亚大学欧文分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究通过逻辑谜题实验发现,AI辅助会削弱人类长期技能发展,独立问题解决努力对技能提升更关键,低AI请求成本会增加AI使用频率且降低后续无辅助表现。

Comments Accepted at Human-AI Complementarity and Alignment (HCOMP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21827 2026-08-25 cs.CL 新提交 57%

Do Large Language Models Perform Well on Comprehending Poetic Logic in Modern Chinese Poetry?

大型语言模型在理解现代汉诗的诗意逻辑方面表现良好吗?

Tian Lan, Shanshan Wang, Zehua Duo, Jiang Li, Guanglai Gao, Derek F. Wong, Xiangdong Su

机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究科) University of Macau(澳门大学) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对当前LLMs在现代汉诗诗意逻辑理解评估上的缺口,构建首个基准Peony,评估发现主流LLMs存在相关理解局限,验证了Peony的有效性与必要性。

Comments 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21796 2026-08-25 cs.CV cs.AI 新提交 57%

SAFE-G: Structure-aware Faithful Evidence-guided Generation for Knowledge-based Visual Question Answering

SAFE-G:面向基于知识的视觉问答的结构感知忠实证据引导生成

Long Shu, Shuochen Liu, Wei Chen, Junda Lin, Zhi Zheng, Huijun Hou, Tong Xu

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) NIO(蔚来)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 针对KB-VQA现有方法难以捕捉结构关联、推理不忠实的问题,提出SAFE-G框架,通过混合搜索、图检索与证据对齐RL策略,在两个基准上准确率优于现有方法8.9%、3.5%。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21719 2026-08-25 cs.DC 新提交 50%

PowerSlider: Exploiting Phase Asymmetry for LLM Serving under Demand Response

PowerSlider:利用相位不对称性实现需求响应下的大语言模型服务

Yueying Li, Jiayang Chen, Yuanfan Chen, Leo Han, Haoran Qiu, Esha Choukse, Rodrigo Fonseca, Udit Gupta

专题命中 逻辑推理 :reasoning(abstract)

AI总结 PowerSlider通过分解大语言模型服务阶段并结合KKT在线求解器,在电网需求响应的时变功率上限下,显著提升了服务吞吐量与延迟性能。

详情

展开后加载摘要…

URL PDF HTML 收藏