arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-04 至 2026-02-04 共收录 126 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 13 篇

2505.16552 2026-02-04 cs.CL 85%

Think Silently, Think Fast: Dynamic Latent Compression of LLM Reasoning Chains

静思速思:动态潜在空间压缩LLM推理链

Wenhui Tan, Jiaze Li, Jianzhong Ju, Zhenbo Luo, Ruihua Song, Jian Luan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 CoLaR通过动态潜在空间压缩LLM推理链,实现高效推理与灵活速度调整,提升数学推理任务的准确率和效率。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19326 2026-02-04 cs.CL 83%

Slot Filling as a Reasoning Task for SpeechLLMs

槽填充作为推理任务用于语音大语言模型

Kadri Hacioglu, Manjunath K E, Andreas Stolcke

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出通过推理任务提升语音大语言模型在槽填充任务中的性能,探讨了不同基础模型对推理语音LLM的影响。

Journal ref Proc. IEEE ICASSP, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02842 2026-02-04 cs.AI cs.CL cs.LG 82%

Chain of Simulation: A Dual-Mode Reasoning Framework for Large Language Models with Dynamic Problem Routing

模拟链:一种用于大语言模型的双模式推理框架,具有动态问题路由

Saeid Sheikhi

机构 * Faculty of Information Technology(信息科技学院) Electrical Engineering University of Oulu, Oulu, Finland, 90014(奥卢大学电气工程学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CoS是一种双模式推理框架,通过动态问题路由提升大语言模型的推理能力,实现更高效的准确性和效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02545 2026-02-04 cs.LG cs.AI 81%

Beyond Alignment: Expanding Reasoning Capacity via Manifold-Reshaping Policy Optimization

超越对齐:通过流形重塑策略优化扩展推理能力

Dayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Yang Li

机构 * Baidu Inc.(百度公司) Peking University(北京大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出流形重塑策略优化方法,通过几何干预扩展LLM的推理能力,实验证明其在数学任务中优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00294 2026-02-04 cs.LG cs.AI 73%

Free Draft-and-Verification: Toward Lossless Parallel Decoding for Diffusion Large Language Models

免费草稿与验证:迈向无损并行解码的扩散大语言模型

Shutong Wu, Jiawei Zhang

机构 * Department of Computer Sciences, University of Wisconsin--Madison, Madison, WI(计算机科学系,威斯康星大学麦迪逊分校,麦迪逊,WI)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 FreeDave是一种专为DLLMs设计的快速解码算法,通过无损并行解码实现高效推理,无需模型修改或额外模块,提升了推理速度而不影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03635 2026-02-04 cs.CL cs.LG 62%

TRE: Encouraging Exploration in the Trust Region

TRE: 在信任区域中鼓励探索

Chao Huang, Yujing Lu, Quangang Li, Shenghe Wang, Yan Wang, Yueyang Zhang, Long Xia, Jiashu Zhao, Zhiyuan Sun, Daiting Shi, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Baidu Inc.(百度公司) Wilfrid Laurier University(威尔弗里德·劳里埃大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 TRE通过在模型信任区域内鼓励探索,提升了大型语言模型在数学推理、组合搜索和偏好对齐任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03452 2026-02-04 cs.LG cs.AI 62%

Beyond Variance: Prompt-Efficient RLVR via Rare-Event Amplification and Bidirectional Pairing

超越方差:通过稀有事件放大和双向配对实现高效的提示式强化学习可验证奖励

Xin Sheng, Jiaxin Li, Yujuan Pang, Ran Peng, Yong Ma

机构 * Beijing University of Post(北京邮电大学) Sichuan Agricultural University(四川农业大学) RapidAI Research(RapidAI研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过稀有事件放大和双向配对方法提升提示式强化学习可验证奖励的样本效率和转移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03309 2026-02-04 cs.LG cs.AI 62%

Entropy-Gated Selective Policy Optimization:Token-Level Gradient Allocation for Hybrid Training of Large Language Models

熵门选择策略优化:用于大型语言模型混合训练的token级梯度分配

Yuelin Hu, Zhengxue Cheng, Wei Liu, Li Song

机构 * Department of Computer Science Anonymous University(计算机科学系 匿名大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 EGSPO通过token级梯度分配提升大型语言模型的混合训练效果,实现数学推理任务的性能提升并降低计算开销。

Comments accepted by cscwd2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02888 2026-02-04 cs.CL cs.AI 62%

HALT: Hallucination Assessment via Log-probs as Time series

HALT:通过log-prob作为时间序列进行幻觉评估

Ahmad Shapiro, Karan Taneja, Ashok Goel

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 HALT通过log-prob时间序列检测幻觉,比Lettuce更高效且兼容专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03075 2026-02-04 cs.CL 57%

ReMiT: RL-Guided Mid-Training for Iterative LLM Evolution

ReMiT: 通过强化学习指导的迭代大语言模型进化

Junjie Huang, Jiarui Qin, Di Yin, Weiwen Liu, Yong Yu, Xing Sun, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 ReMiT通过强化学习指导中训练过程,实现大语言模型的迭代进化,提升模型在数学、代码和推理任务上的表现。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03073 2026-02-04 cs.LG 57%

TMS: Trajectory-Mixed Supervision for Reward-Free, On-Policy SFT

TMS:轨迹混合监督用于无奖励、在线策略微调

Rana Muhammad Shahroz Khan, Zijie Liu, Zhen Tan, Charles Fleming, Tianlong Chen

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 TMS通过轨迹混合监督在无奖励的情况下提升大语言模型的保留能力,有效弥补了传统SFT与RL之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03679 2026-02-04 math.HO 50%

Footprints of the Walking of Numbers: A Dynamic Visualization Task for Understanding Decimal Numbers in Secondary Education

数字行走的足迹:一种动态可视化任务,用于理解中学阶段的小数

Felix De la Cruz Serrano

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出一种动态可视化任务,通过生成小数的几何路径帮助中学学生理解小数结构和特性。

Comments in Spanish language

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03060 2026-02-04 cs.CV 50%

IVC-Prune: Revealing the Implicit Visual Coordinates in LVLMs for Vision Token Pruning

IVC-Prune: 在大型视觉-语言模型中揭示隐式的视觉坐标以进行视觉标记剪枝

Zhichao Sun, Yidong Ma, Gang Liu, Yibo Chen, Xu Tang, Yao Hu, Yongchao Xu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Xiaohongshu Inc(小红书公司)

专题命中 数学推理 :reasoning(abstract)

AI总结 IVC-Prune通过揭示LVLMs中隐式的视觉坐标,提出一种无训练、提示感知的视觉标记剪枝方法,有效减少标记数量并保持高性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 逻辑推理 7 篇

2602.03640 2026-02-04 cs.IR cs.AI cs.CL 81%

Tutorial on Reasoning for IR & IR for Reasoning

信息检索与推理 for 推理的教程

Mohanna Hoveyda, Panagiotis Efstratiadis, Arjen de Vries, Maarten de Rijke

机构 * Radboud University(拉德堡德大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本教程探讨了信息检索与推理之间的关系,提出统一框架以指导推理增强的信息检索系统发展。

Comments Accepted to ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09369 2026-02-04 cs.LG cs.CL 81%

Encoder-Free Knowledge-Graph Reasoning with LLMs via Hyperdimensional Path Retrieval

无需编码器的知识图谱推理:通过超维路径检索实现LLM

Yezi Liu, William Youngwoo Chung, Hanning Chen, Calvin Yeung, Mohsen Imani

机构 * University of California, Irvine(加州大学 Irvine 分校)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 PathHD通过超维路径检索实现无需编码器的知识图谱推理,提升效率与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03530 2026-02-04 cs.CV 75%

Interpretable Logical Anomaly Classification via Constraint Decomposition and Instruction Fine-Tuning

通过约束分解和指令微调实现可解释的逻辑异常分类

Xufei Zhang, Xinjiao Zhou, Ziling Deng, Dongdong Geng, Jianxiong Wang

机构 * Beijing XingYun Digital Technology Co., Ltd.(北京星云数字技术有限公司)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 LogiCls通过约束分解和指令微调实现工业逻辑异常的可解释分类,结合视觉-语言框架和数据驱动的监督方法,提升异常检测的准确性和可解释性。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03822 2026-02-04 cs.CL 57%

They Said Memes Were Harmless-We Found the Ones That Hurt: Decoding Jokes, Symbols, and Cultural References

他们说迷因是无害的——我们发现了那些有害的:解码笑话、符号和文化参考

Sahil Tripathi, Gautam Siddharth Kashyap, Mehwish Nasim, Jian Yang, Jiechao Gao, Usman Naseem

机构 * Macquarie University(麦考瑞大学) The University of Western Australia(西澳大学) Stanford University(斯坦福大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗quentcourt研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 CROSS-ALIGN+通过三阶段框架解决迷因滥用检测中的文化盲区、边界模糊和可解释性问题,实现性能提升和决策可解释性。

Comments Accepted at the The Web Conference 2026 (Research Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03158 2026-02-04 cs.IR 50%

PAMAS: Self-Adaptive Multi-Agent System with Perspective Aggregation for Misinformation Detection

PAMAS:基于视角聚合的自适应多智能体系统用于虚假信息检测

Zongwei Wang, Min Gao, Junliang Yu, Tong Chen, Chenghua Lin

专题命中 逻辑推理 :reasoning(abstract)

AI总结 PAMAS通过自适应多智能体系统和视角聚合技术,有效解决虚假信息检测中的信息淹没问题,提升检测准确性和效率。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02752 2026-02-04 cs.SE 50%

Beyond the Prompt: Assessing Domain Knowledge Strategies for High-Dimensional LLM Optimization in Software Engineering

超越提示:评估领域知识策略在软件工程高维LLM优化中的应用

Srinath Srinivasan, Tim Menzies

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本研究比较了人类与人工智能策略在生成领域知识方面的效果,通过四种不同架构评估如何利用结构化知识整合提升LLM在高维优化中的表现。

Comments Accepted at MSR 2026 (Registered Reports Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02529 2026-02-04 physics.soc-ph 50%

How Much of the United States Can Still Host New Hyperscale Data Centers? A Constraint-Based Feasibility Analysis

美国还能有多少地方还能建设新的超大规模数据中心?一种基于约束的可行性分析

Milan Janosov

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文基于美国的地理空间框架,分析了在现有物理、基础设施和环境约束下,超大规模数据中心的可行建设区域,得出美国实际可行容量在数十吉瓦范围内。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 规划推理 25 篇

2602.03197 2026-02-04 cs.HC 88%

Exploring the Role of Tracing in AI-Supported Planning for Algorithmic Reasoning

探索在AI支持的规划中追踪的作用:用于算法推理

Yoshee Jain, Heejin Do, Zihan Wu, April Yi Wang

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract)

AI总结 本研究探讨了在AI支持的规划中使用追踪对算法推理的影响,发现追踪促使学习者转向目标导向的推理,并提高了部分正确解决方案的一致性,但未显著影响反馈质量。

Comments 14 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02873 2026-02-04 cs.CV 85%

ViThinker: Active Vision-Language Reasoning via Dynamic Perceptual Querying

ViThinker: 通过动态感知查询实现主动视觉-语言推理

Weihang You, Qingchan Zhu, David Liu, Yi Pan, Geng Yuan, Hanqi Jiang

机构 * School of Computing, University of Georgia(计算机学院,佐治亚大学) School of Engineering and Applied Science, Princeton University(工程与应用科学学院,普林斯顿大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 ViThinker通过动态感知查询实现主动视觉-语言推理,提升感知基础和推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03769 2026-02-04 cs.LG 83%

Reasoning with Latent Tokens in Diffusion Language Models

在扩散语言模型中使用潜在令牌进行推理

Andre He, Sean Welleck, Daniel Fried

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.LG

AI总结 本文提出通过引入潜在令牌提升扩散语言模型在需要全局一致性和前瞻性的推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03376 2026-02-04 cs.RO cs.CV 82%

PlanTRansformer: Unified Prediction and Planning with Goal-conditioned Transformer

PlanTRansformer: 一种结合目标条件变换器的统一预测与规划

Constantin Selzer, Fabina B. Flohr

机构 * Department of Electrical Engineering and Information Technology, Intelligent Vehicles Lab (IVL), Munich University of Applied Science(电气工程与信息科技系,智能车辆实验室(IVL),慕尼黑应用科学大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 PlanTRansformer通过整合目标条件预测、动态可行性等技术,提升自动驾驶中的预测与规划性能。

Comments Submitted and accepted at IEEE IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03255 2026-02-04 cs.AI 79%

LPS-Bench: Benchmarking Safety Awareness of Computer-Use Agents in Long-Horizon Planning under Benign and Adversarial Scenarios

LPS-Bench: 在长周期规划中评估计算机使用代理的安全意识基准测试

Tianyu Chen, Chujia Hu, Ge Gao, Dongrui Liu, Xia Hu, Wenjie Wang

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 LPS-Bench通过评估长周期规划中计算机使用代理的安全意识,揭示现有系统在安全行为维持方面的不足,并提出缓解策略以提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03097 2026-02-04 cs.AI 79%

De-conflating Preference and Qualification: Constrained Dual-Perspective Reasoning for Job Recommendation with Large Language Models

解构偏好与资格:基于大语言模型的约束双视角推理 job 推荐

Bryce Kan, Wei Yang, Emily Nguyen, Ganghui Yi, Bowen Yi, Chenxiao Yu, Yan Liu

机构 * University of Southern California(南加州大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 JobRec通过约束双视角推理解构偏好与资格,提升职位推荐的可控性和匹配质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02991 2026-02-04 cs.AI 79%

Large Language Models Can Take False First Steps at Inference-time Planning

大语言模型在推理时间规划中可能采取错误的初始步骤

Haijiang Yan, Jian-Qiao Zhu, Adam Sanborn

机构 * Department of Psychology, The University of Warwick(沃里克大学心理学系) Department of Psychology, The University of Hong Kong(香港大学心理学系)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 研究揭示了大语言模型在推理过程中因自我生成上下文积累导致的规划行为偏差,并通过实验验证了规划能力随上下文变化而变化的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15113 2026-02-04 cs.CL 79%

Inferring Scientific Cross-Document Coreference and Hierarchy with Definition-Augmented Relational Reasoning

基于定义增强的 relational 推理进行科学跨文档指代与层次推断

Lior Forer, Tom Hope

机构 * The Hebrew University of Jerusalem(希伯来大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出基于定义增强的relational推理方法,用于科学文本中的跨文档指代和层次推断,通过生成上下文依赖的概念定义和关系定义,提升模型对复杂科学概念的推理能力。

Comments Accepted to TACL. Pre-MIT Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03442 2026-02-04 cs.CL 70%

A-RAG: Scaling Agentic Retrieval-Augmented Generation via Hierarchical Retrieval Interfaces

A-RAG:通过分层检索接口扩展代理检索增强生成

Mingxuan Du, Benfeng Xu, Chiwei Zhu, Shaohan Wang, Pengyu Wang, Xiaorui Wang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(metastone技术公司)

专题命中 规划推理 :reasoning(abstract);test-time compute(abstract);分类 cs.CL

AI总结 A-RAG通过分层检索接口提升检索增强生成效果,有效利用模型能力并适应不同任务。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02995 2026-02-04 cs.AI 70%

Agent Alpha: Tree Search Unifying Generation, Exploration and Evaluation for Computer-Use Agents

Agent Alpha:通过树搜索统一生成、探索和评估计算机使用代理

Sizhe Tang, Rongqian Chen, Tian Lan

机构 * The George Washington University(乔治·华盛顿大学)

专题命中 规划推理 :planning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 Agent Alpha通过步骤级MCTS统一生成、探索和评估,实现计算机使用代理的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏