arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-28 至 2026-08-28 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 9 篇

2608.26836 2026-08-28 cs.AI cs.CL 新提交 91%

SymbolLKG: Towards Verifiable Logical Reasoning via Logical Knowledge Graph and Symbolic Solvers

SymbolLKG:基于逻辑知识图谱与符号求解器的可验证逻辑推理研究

Haizhao Fan, Yuchi Xiong, Jize Wang, Xinping Guan, Xinyi Le

机构 * Shanghai JiaoTong University(上海交通大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 该研究针对大型语言模型逻辑推理的缺陷,提出结合逻辑知识图谱与动态求解器路由的神经-符号架构,在基准任务上优于现有方法,实现了可验证的高准确率逻辑推理。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26329 2026-08-28 cs.CL 新提交 83%

Neuro-symbolic PRM: Enhancing Scientific Reasoning via Structured Traces and Symbolic Verification

神经符号PRM:通过结构化轨迹与符号验证增强科学推理

Yuxin Zi, Cong Xu, Suparna Bhattacharya, Martin Foltin, Amit Sheth

机构 * AI Institute of South Carolina(南卡罗来纳州人工智能研究所) HPE Labs(慧与实验室) Indian AI Research Organisation(印度人工智能研究组织)

专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 该研究提出神经符号PRM框架,解耦推理为符号有效性与语义接地性,引入反事实符号扰动训练PRM,通过验证器优先搜索提升工具增强型LLM的科学推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26147 2026-08-28 cs.CL cs.CV 新提交 83%

CARE: Causally-Aligned Reasoning Exploration for Medical Large Language Models

CARE:面向医学大语言模型的因果对齐推理探索

Yucheng Zhou, Peng Luo, Qianning Wang, Chengzhong Xu, Jianbing Shen

机构 * University of Macau(澳门大学) Auckland University of Technology(奥克兰理工大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究针对医学大语言模型的推理缺陷,提出CARE框架,通过因果充分性与近端可学习性条件筛选训练经验,在医学基准上提升了推理一致性与训练稳定性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26107 2026-08-28 cs.AI 新提交 80%

EduRiskX: A Neuro-Symbolic Framework with F-Logic Reasoning for Early Academic Risk Prediction

EduRiskX:用于早期学业风险预测的神经符号框架,结合F-Logic推理

Yu Fu, Yongqi Kang, Yong Zhao, Rongfang Bie

机构 * Sichuan University(四川大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出结合F-Logic推理的神经符号框架EduRiskX,在OULAD数据集上实现了更高的早期学业风险预测性能,且可提供可解释的规则依据。

Comments Previously available on Research Square: this https URL (https://doi.org/10.21203/rs.3.rs-8877832/v1). This version presents the complete neuro-symbolic framework, EduRiskX, integrating temporal Transformers with F-Logic reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26114 2026-08-28 cs.AI cs.CL q-fin.CP 新提交 73%

CIFQA: A Deterministic Tool-Grounded Multi-Agent LLM Framework for Financial Query Answering

CIFQA:一种用于金融查询问答的确定性工具基多智能体大语言模型框架

Kunjesh Parekh, Anil Kumar Tiwari, Divya Saxena

机构 * School of Artificial Intelligence and Data Science, Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校人工智能与数据科学学院)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM多步骤金融计算易出错的问题,提出CIFQA多智能体框架,在定期存款查询基准上准确率达95.54%,且17B开源模型在该框架内表现优于更大前沿模型,证明架构设计对数值可靠性更关键。

Comments 16 pages, 5 figures, submitted for academic dissemination

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26013 2026-08-28 cs.CL 版本更新 57%

VISA: Agentic Self-Evolving Data Synthesis for Multimodal Instruction Following

VISA:用于多模态指令遵循的智能体式自进化数据合成

Min Zeng, Guanxin Tan, Libin Cen, Yafei Wen, Rui Hu, Liuyang Bian, Xiaolong Chen, Xiaoxin Chen

机构 * vivo AI Lab(vivo AI实验室)

专题命中 逻辑推理 :verifier(abstract);分类 cs.CL

AI总结 VISA是一种智能体式自进化数据合成框架,通过自进化循环优化多模态指令合成,在MM-IFEval等基准上提升了多模态指令遵循性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07261 2026-08-28 cs.CL 版本更新 57%

Why Knowing Both Hops Is Not Enough: Understanding Two-Hop Generalization in Language Models

仅知道两跳信息是不够:理解语言模型中的两跳泛化

Zili Zhang, Yilin Wang, Heng Wang, Herun Wan, Minnan Luo

机构 * Xi’an Jiaotong University(西安交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究针对语言模型两跳查询失败问题,在受控环境训练Transformer,揭示其泛化规律与跨层不匹配机制,提出循环式训练策略以提升分布外两跳泛化能力。

Comments EMNLP 2026, findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26197 2026-08-28 cs.SE 新提交 50%

Harness Engineering for Predictable Agentic Systems: An Empirical Study of Deterministic Execution Constraints

利用工程实现可预测的智能体系统:确定性执行约束的实证研究

Saransh Dhage

专题命中 逻辑推理 :planning(abstract)

AI总结 本研究通过实证探究harness工程中确定性执行约束对LLM智能体的影响,发现添加结构化规划可提升可复现性与任务成功率,但延迟存在模型依赖的成本差异。

Comments 9 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24232 2026-08-28 cs.IR 版本更新 50%

Strategy-Aware Parameter-Efficient Adaptation for LLM-based Auto-Bidding

基于大语言模型的自动出价的策略感知参数高效适配

Songyue Cai, Lianyu Wang, Shan Gu, Ziru Xu, Jian Xu, Xiaofeng Zhu, Bo Zheng

专题命中 逻辑推理 :reasoning(abstract)

AI总结 研究广告自动出价问题,提出SAGE框架,通过位置增强、文本对齐和约束门控LoRA三个组件,实现参数高效多模态对齐,在大规模基准实验中性能卓越,调整参数少,消融研究验证各组件贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏