arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-08 至 2026-01-08 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 10 篇

2601.03550 2026-01-08 cs.AI 85%

ReEfBench: Quantifying the Reasoning Efficiency of LLMs

ReEfBench: 量化大语言模型的推理效率

Zhizhang Fu, Yuancheng Gu, Chenkai Hu, Hanmeng Liu, Yue Zhang

机构 * Westlake University(西湖大学) Imperial College London(帝国理工学院) New York University(纽约大学) Hainan University(海南大学)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 ReEfBench通过神经符号框架量化LLM推理效率,揭示推理性能提升源于真实推理而非冗长性,并指出训练中混合长短CoT数据的风险及蒸馏模型的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14540 2026-01-08 cs.AI 83%

VERUS-LM: a Versatile Framework for Combining LLMs with Symbolic Reasoning

VERUS-LM:一种结合大语言模型与符号推理的多功能框架

Benjamin Callewaert, Simon Vandevelde, Joost Vennekens

机构 * Leuven.AI -- KU Leuven Institute for AI(Leuven.AI — 哥伦比亚大学莱顿人工智能研究所)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 VERUS-LM通过结合大语言模型与符号推理,提升复杂推理任务的适应性与效率,实现更广泛的推理能力。

Comments In Proceedings ICLP 2025, arXiv:2601.00047

Journal ref EPTCS 439, 2026, pp. 47-62

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11830 2026-01-08 cs.CV cs.AI 79%

VISTA: Mitigating Semantic Inertia in Video-LLMs via Training-Free Dynamic Chain-of-Thought Routing

VISTA: 通过无训练动态推理路由缓解视频大语言模型中的语义惯性

Hongbo Jin, Jiayu Ding, Siyi Xie, Guibo Luo, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 逻辑推理 :chain-of-thought(title);reasoning(abstract);分类 cs.AI

AI总结 VISTA通过动态推理路由和潜在推理共识机制,缓解视频大语言模型中的语义惯性问题,提升视频理解性能。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08930 2026-01-08 cs.GR 78%

How Does a Virtual Agent Decide Where to Look? Symbolic Cognitive Reasoning for Embodied Head Rotation

虚拟代理如何决定看向何处?基于具身头部旋转的符号认知推理

Juyeong Hwang, Seong-Eun Hong, JaeYoung Seon, Hyeongyeop Kang

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文提出SCORE框架,通过符号认知推理实现具身头部旋转,结合视觉-语言模型和大语言模型,使虚拟代理能合理预测头部运动及背后动机。

Comments 13 pages, 8 figures. Accepted to SIGGRAPH Asia Conference Papers '25

Journal ref SIGGRAPH Asia Conference Papers '25, December 15-18, 2025, Hongkong

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03261 2026-01-08 cs.CL cs.AI 62%

DeepResearch-Slice: Bridging the Retrieval-Utilization Gap via Explicit Text Slicing

DeepResearch-Slice: 通过显式文本切片弥合检索-利用差距

Shuo Lu, Yinuo Xu, Jianjie Cheng, Lingxiao He, Meng Wang, Jian Liang

机构 * NLPR & MAIS CASIA(CASIA NLPR与MAIS) School of AI UCAS(UCAS人工智能学院) Meituan Inc.(美团公司)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 DeepResearch-Slice通过显式文本切片技术,有效解决检索与利用之间的差距问题,提升模型在嘈杂环境中的鲁棒性。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05509 2026-01-08 cs.CL cs.AI 62%

LAG: Logic-Augmented Generation from a Cartesian Perspective

LAG: 从笛卡尔视角出发的逻辑增强生成

Yilin Xiao, Chuang Zhou, Yujing Zhang, Qinggang Zhang, Su Dong, Shengyuan Chen, Chang Yang, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LAG通过系统的问题分解、原子记忆库和逻辑感知推理,提升知识密集型任务的准确性和减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03560 2026-01-08 cs.AI 57%

FÆRDXEL: An Expert System for Danish Traffic Law

FÆRDXEL:丹尼亚交通法专家系统

Luís Cruz-Filipe, Jonas Vistrup

机构 * IT University of Copenhagen(哥本哈根IT大学) University of Southern Denmark(南丹麦大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 FÆRDXEL通过结合逻辑编程与可解释性界面,为丹麦交通法提供符号推理工具,并通过实证和专家评估验证其在法律领域的应用潜力。

Comments In Proceedings ICLP 2025, arXiv:2601.00047

Journal ref EPTCS 439, 2026, pp. 383-396

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16203 2026-01-08 cs.MA cs.AI 57%

Computing Universal Plans for Partially Observable Multi-Agent Routing Using Answer Set Programming

使用答案集编程计算部分可观测多智能体路由的通用计划

Fengming Zhu, Fangzhen Lin

机构 * Department of Computer Science(计算机科学系) Engineering Hong Kong University of Science(工程 香港理工大学)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文提出基于答案集编程的系统,用于计算部分可观测多智能体路由问题的通用计划,通过自定义动作偏好实现高效策略。

Comments In Proceedings ICLP 2025, arXiv:2601.00047

Journal ref EPTCS 439, 2026, pp. 143-166

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03417 2026-01-08 cs.CL 57%

Implicit Graph, Explicit Retrieval: Towards Efficient and Interpretable Long-horizon Memory for Large Language Models

隐式图,显式检索:迈向高效且可解释的长周期记忆 для 大语言模型

Xin Zhang, Kailai Yang, Hao Li, Chenyue Li, Qiyu Wei, Sophia Ananiadou

机构 * University of Manchester(曼彻斯特大学) Imperial College London(伦敦帝国学院) Stanford University(斯坦福大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 LatentGraphMem结合隐式图记忆与显式子图检索,实现高效且可解释的长周期记忆,提升大语言模型的推理能力与可解释性。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03781 2026-01-08 cs.CV 50%

MVP: Enhancing Video Large Language Models via Self-supervised Masked Video Prediction

MVP: 通过自监督掩码视频预测增强视频大型语言模型

Xiaokun Sun, Zezhong Wu, Zewen Ding, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 MVP通过自监督掩码视频预测提升视频大语言模型的时间推理和因果理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏