arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-15 至 2026-01-15 共收录 62 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3 篇

2601.09706 2026-01-15 cs.CL cs.AI cs.LG 67%

Value-Aware Numerical Representations for Transformer Language Models

具有价值意识的数值表示用于Transformer语言模型

Andreea Dutulescu, Stefan Ruseti, Mihai Dascalu

机构 * National University of Science and Technology(科学技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种价值意识的数值表示方法,通过在Transformer语言模型输入中加入前缀标记以显式编码数值,从而提升模型在算术任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09398 2026-01-15 cs.CL cs.AI cs.LG 67%

Ability Transfer and Recovery via Modularized Parameters Localization

通过模块化参数定位实现能力迁移与恢复

Songyao Jin, Kun Zhou, Wenqi Li, Peng Wang, Biwei Huang

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ACT通过激活差异局部化能力相关通道,实现能力迁移与恢复,提升多语言数学和科学推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22979 2026-01-15 cs.LG 57%

OptiMind: Teaching LLMs to Think Like Optimization Experts

OptiMind: 教授大语言模型像优化专家一样思考

Xinzhi Zhang, Zeyi Chen, Humishka Zope, Hugo Barbalho, Konstantina Mellou, Marco Molinaro, Janardhan Kulkarni, Ishai Menache, Sirui Li

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 OptiMind通过整合优化专业知识,提升大语言模型在混合整数线性规划中的公式准确性,实现20.7%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2601.08839 2026-01-15 cs.CL 57%

Recursive Knowledge Synthesis for Multi-LLM Systems: Stability Analysis and Tri-Agent Audit Framework

多LLM系统的递归知识合成:稳定性分析与三代理审计框架

Toshiyuki Shigemura

机构 * Independent Researcher(独立研究者)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 本文提出三代理框架用于多LLM系统稳定性分析,通过递归知识合成实现安全可靠的知识生成。

Comments 25 pages, 9 figures. Pilot feasibility study using public-access large language models without API-level orchestration

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 2 篇

2601.09446 2026-01-15 cs.CL cs.AI 89%

Improving Symbolic Translation of Language Models for Logical Reasoning

提升语言模型的符号翻译以增强逻辑推理

Ramya Keerthy Thatikonda, Jiuzhou Han, Wray Buntine, Ehsan Shareghi

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过微调和增量推理框架,提升小型语言模型在逻辑推理中的符号翻译能力,减少错误率并提高推理性能。

Comments The Third workshop of NeusymBridge @AAAI 2026 (Bridging Neurons and Symbols for NLP and Knowledge Graph Reasoning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09049 2026-01-15 cs.CL cs.AI 62%

Is Grokking Worthwhile? Functional Analysis and Transferability of Generalization Circuits in Transformers

Grokking是否值得?Transformer中泛化电路的功能分析与可迁移性

Kaiyu He, Zhang Mian, Peilin Wu, Xinya Du, Zhiyu Chen

机构 * Department of Computer Science University of Texas at Dallas(计算机科学系 德克萨斯大学达拉斯分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了Transformer中泛化电路的功能与可迁移性,发现grokking过程是整合记忆事实到自然推理路径,而非突然获得新范式,且其在迁移新知识时存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 12 篇

2601.09609 2026-01-15 cs.CL cs.AI 86%

DPWriter: Reinforcement Learning with Diverse Planning Branching for Creative Writing

DPWriter: 基于多样化规划分支的强化学习用于创造性写作

Qian Cao, Yahui Liu, Wei Bi, Yi Zhao, Ruihua Song, Xiting Wang, Ruiming Tang, Guorui Zhou, Han Li

机构 * Renmin University of China(中国人民大学) Kuaishou Technology(快手科技)

专题命中 规划推理 :planning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 DPWriter通过多样化规划分支方法提升创造性写作的输出多样性,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09215 2026-01-15 cs.CL 79%

UserLM-R1: Modeling Human Reasoning in User Language Models with Multi-Reward Reinforcement Learning

UserLM-R1: 通过多奖励强化学习建模人类推理在用户语言模型中的应用

Feng Zhang, Shijia Li, Chunmao Zhang, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Jingwen Xu, Han Liu

机构 * Meituan(美团) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Chinese Academy of Sciences(中国科学院大学) Dalian University of Technology(大连理工大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 UserLM-R1通过多奖励强化学习和动态目标驱动策略,提升用户语言模型在跨领域和对抗性场景中的推理与策略能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15676 2026-01-15 cs.AI cs.CL 73%

AutoToM: Scaling Model-based Mental Inference via Automated Agent Modeling

AutoToM: 通过自动化代理建模实现基于模型的心理推理扩展

Zhining Zhang, Chuanyang Jin, Mung Yao Jia, Shunchi Zhang, Tianmin Shu

机构 * Peking University(北京大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 AutoToM通过自动化代理建模实现可扩展、稳健且可解释的心理推理,优于现有方法并支持在线心理推理。

Comments NeurIPS 2025 (Spotlight). 42 pages, 11 figures, 15 tables. Website at https://chuanyangjin.com/AutoToM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09259 2026-01-15 cs.AI 70%

MAXS: Meta-Adaptive Exploration with LLM Agents

MAXS: 基于LLM代理的元适应性探索

Jian Zhang, Zhiyuan Wang, Zhangqi Wang, Yu He, Haoran Luo, li yuan, Lingling Zhang, Rui Mao, Qika Lin, Jun Liu

机构 * Xi’an Jiaotong University(西安交通大学) Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) South China University of Technology(华南理工大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 MAXS通过元适应性探索框架提升LLM代理在多工具推理中的全局有效性和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09113 2026-01-15 cs.AI 70%

The AI Hippocampus: How Far are We From Human Memory?

人工智能海马体:我们离人类记忆还有多远?

Zixia Jia, Jiaqi Li, Yipeng Kang, Yuxuan Wang, Tong Wu, Quansen Wang, Xiaobo Wang, Shuyi Zhang, Junzhe Shen, Qing Li, Siyuan Qi, Yitao Liang, Di He, Zilong Zheng, Song-Chun Zhu

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文综述了大语言模型和多模态大语言模型中记忆机制的分类与研究进展,探讨了隐性、显性和代理记忆框架,以及多模态场景下的记忆整合与挑战。

Journal ref Transactions on Machine Learning Research (11/2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09032 2026-01-15 cs.AI 70%

The Hierarchy of Agentic Capabilities: Evaluating Frontier Models on Realistic RL Environments

代理能力的层级:在现实强化学习环境中评估前沿模型

Logan Ritchie, Sushant Mehta, Nick Heiner, Mason Yu, Edwin Chen

机构 * Surge AI

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文评估了前沿AI模型在现实强化学习环境中的代理能力层级,揭示了模型在工具使用、规划、适应性等任务上的能力差异及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09353 2026-01-15 cs.AI 57%

Monte-Carlo Tree Search with Neural Network Guidance for Lane-Free Autonomous Driving

基于神经网络引导的蒙特卡罗树搜索用于无车道自动驾驶

Ioannis Peridis, Dimitrios Troullinos, Georgios Chalkiadakis, Pantelis Giankoulidis, Ioannis Papamichail, Markos Papageorgiou

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种基于神经网络引导的蒙特卡罗树搜索方法,用于无车道环境下的自动驾驶,旨在提高交通流率并优化安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.08832 2026-01-15 eess.SY cs.AI cs.CY cs.SY 57%

A Taxonomy and Review of Algorithms for Modeling and Predicting Human Driver Behavior

自动驾驶中人类驾驶行为建模与预测算法的分类与综述

Raunak P. Bhattacharyya, Kyle Brown, Juanran Wang, Katherine Driggs-Campbell, Mykel J. Kochenderfer

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文对自动驾驶中人类驾驶行为建模与预测算法进行了分类和综述,统一了意图估计、特质估计和运动预测方法,并指出了该领域未来的研究方向。

Comments This revision has been accepted for publication in the Proceedings of the IEEE. The final version is available on IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09151 2026-01-15 cs.LG 57%

Interpretable Probability Estimation with LLMs via Shapley Reconstruction

通过Shapley重构实现LLM的可解释概率估计

Yang Nan, Qihao Wen, Jiahao Wang, Pengfei He, Ravi Tandon, Yong Ge, Han Xu

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 PRISM通过Shapley值重构提升LLM概率估计的透明性和准确性,适用于金融、医疗等多个领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04748 2026-01-15 cs.AI cs.MA 57%

When Single-Agent with Skills Replace Multi-Agent Systems and When They Fail

当单智能体与技能取代多智能体系统以及何时会失败

Xiaoxiao Li

机构 * Trusted and Efficient AI (TEA) Lab(可信高效人工智能实验室) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) CIFAR AI Chair(CIFAR人工智能 chair)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨单智能体通过技能库替代多智能体系统在复杂推理中的有效性及局限性,提出基于认知科学的技能选择有限容量理论,并通过层次路由验证其可行性。

Comments 25 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08956 2026-01-15 cs.CV 50%

Variance-Penalized MC-Dropout as a Learned Smoothing Prior for Brain Tumour Segmentation

方差惩罚的MC-Dropout作为脑肿瘤分割的学得平滑先验

Satyaki Roy Chowdhury, Golrokh Mirzaei

机构 * Department of Computer Science(计算机科学系) Engineering, The Ohio State University(工程系,俄亥俄州立大学)

专题命中 规划推理 :planning(abstract)

AI总结 UAMSA-UNet通过结合多尺度注意机制和学习的平滑先验,提升脑肿瘤分割的精度和效率,同时减少计算量。

Comments Accepted by ISBI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23903 2026-01-15 cs.CV 50%

Scaling Remote Sensing Foundation Models: Data Domain Tradeoffs at the Peta-Scale

在百亿级数据规模下扩展遥感基础模型:在百亿级数据规模下的领域权衡

Charith Wickrema, Eliza Mace, Hunter Brown, Heidys Cabrera, Nick Krall, Matthew O'Neill, Shivangi Sarkar, Lowell Weissman, Eric Hughes, Guido Zarrella

机构 * The MITRE Corporation(MITRE公司)

专题命中 规划推理 :reasoning(abstract)

AI总结 研究探讨了在百亿级数据规模下扩展遥感基础模型的挑战与权衡,通过训练更大规模的视觉Transformer主干,揭示了数据受限与模型参数受限之间的关系,并提出了优化数据收集和计算资源的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 2 篇

2601.09430 2026-01-15 cs.CV 82%

Video-MSR: Benchmarking Multi-hop Spatial Reasoning Capabilities of MLLMs

Video-MSR: 多跳空间推理能力的MLLMs基准测试

Rui Zhu, Xin Shen, Shuchen Wu, Chenxi Miao, Xin Yu, Yang Li, Weikang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc.(百度公司) Nanjing University(南京大学) The University of Queensland(昆士兰大学) Peking University(北京大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 Video-MSR通过四个任务评估MLLMs的多跳空间推理能力,发现模型在复杂推理中存在显著不足,并通过微调提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09031 2026-01-15 cs.RO cs.AI 57%

Generalizable Geometric Prior and Recurrent Spiking Feature Learning for Humanoid Robot Manipulation

可推广的几何先验与递归脉冲特征学习用于双足机器人操作

Xuetao Li, Wenke Huang, Mang Ye, Jifeng Xuan, Bo Du, Sheng Liu, Miao Li

机构 * School of Computer Science, School of Robotics, Institute of Technological Sciences, Wuhan University(计算机学院、机器人学院、技术科学研究院、武汉大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出RGMP-S方法,通过几何先验和递归脉冲网络提升双足机器人操作的泛化能力与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 2 篇

2601.09260 2026-01-15 cs.AI 87%

Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models

高效路径与密集奖励:用于大语言模型的概率流推理

Yan Liu, Feng Zhang, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Han Liu, Yangdong Deng

机构 * Meituan(美团) Tsinghua University(清华大学) Peking University(北京大学) Dalian University of Technology(大连理工大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);verifier(abstract)

AI总结 CoT-Flow通过概率流框架提升大语言模型的推理效率与性能,采用流引导解码和流强化学习方法实现信息高效推理路径和密集奖励函数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09350 2026-01-15 cs.CV 50%

See More, Store Less: Memory-Efficient Resolution for Video Moment Retrieval

看清更多,存储更少:视频时刻检索的内存高效解决方案

Mingyu Jeon, Sungjin Han, Jinkwon Hwang, Minchol Kwon, Jonghee Kim, Junyeong Kim

机构 * Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学) Electronics and Telecommunications Research Institute (ETRI)(电子与电信研究院)

专题命中 测试时计算 :reasoning(abstract)

AI总结 SMORE通过查询引导的描述和自适应压缩技术,在视频时刻检索中实现高信息分辨率与内存效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 复杂问题求解 6 篇

2601.09281 2026-01-15 cs.AI 85%

STaR: Sensitive Trajectory Regulation for Unlearning in Large Reasoning Models

STaR:用于大推理模型中去学习的敏感轨迹调节

Jingjing Zhou, Gaoxiang Cong, Li Su, Liang Li

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 STaR通过敏感轨迹调节方法,实现了大推理模型中高效且稳定的隐私保护去学习,减少隐私泄露风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09278 2026-01-15 cs.AI 79%

M$^3$Searcher: Modular Multimodal Information Seeking Agency with Retrieval-Oriented Reasoning

M$^3$Searcher: 模块化多模态信息检索代理与检索导向推理

Xiaohan Yu, Chao Feng, Lang Mei, Chong Chen

机构 * Huawei Cloud BU(华为云业务单元)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 M$^3$Searcher是一种模块化多模态信息检索代理,通过检索导向的多目标奖励机制,提升多模态任务中的事实准确性、推理合理性和检索忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09694 2026-01-15 cs.CL cs.AI cs.CV 62%

LLMs can Compress LLMs: Adaptive Pruning by Agents

LLMs可以压缩LLMs:通过代理的自适应剪枝

Sai Varun Kodathala, Rakesh Vunnam

机构 * Research and Development, Sports Vision, Inc.(研发部,Sports Vision公司) Research and Development, Vizworld Inc.(研发部,Vizworld公司)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过代理引导的自适应剪枝方法,有效压缩LLMs,提升事实知识保留和模型性能。

Comments 17 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08747 2026-01-15 cs.CL cs.AI 62%

To Retrieve or To Think? An Agentic Approach for Context Evolution

是检索还是思考?一种情境演化的代理方法

Rubing Chen, Jian Wang, Wenjie Li, Xiao-Yong Wei, Qing Li

机构 * Department of Computing, The Hong Kong Polytechnic University(计算系,香港理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Agentic Context Evolution (ACE)方法,通过代理动态决策在检索与推理间切换,提升知识密集型任务的生成效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09116 2026-01-15 cs.CV cs.AI 57%

LP-LLM: End-to-End Real-World Degraded License Plate Text Recognition via Large Multimodal Models

LP-LLM:基于大多模态模型的端到端真实世界退化车牌文本识别

Haoyan Gong, Hongbin Liu

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 LP-LLM通过端到端结构感知多模态推理框架,结合字符感知模块和LoRA微调策略,提升真实世界退化车牌文本识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09440 2026-01-15 cs.SE 50%

DepRadar: Agentic Coordination for Context Aware Defect Impact Analysis in Deep Learning Libraries

DepRadar:深度学习库中基于上下文的缺陷影响分析代理协调

Yi Gao, Xing Hu, Tongtong Xu, Jiali Zhao, Xiaohu Yang, Xin Xia

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 DepRadar通过代理协调框架实现深度学习库中缺陷影响分析,结合静态分析与领域规则提高准确性和可解释性,有效识别受影响程序。

Comments Published in 48th International Conference on Software Engineering (ICSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 推理评测 22 篇

2601.09088 2026-01-15 cs.LG cs.CL 87%

Distribution-Aligned Sequence Distillation for Superior Long-CoT Reasoning

面向优越长链推理的分布对齐序列蒸馏

Shaotian Yan, Kaiyuan Liu, Chen Shen, Bing Wang, Sinan Fan, Jun Zhang, Yue Wu, Zheng Wang, Jieping Ye

机构 * Alibaba Cloud Computing(阿里巴巴云 computing)

专题命中 推理评测 :reasoning(title,abstract);CoT(title);分类 cs.CL、cs.LG

AI总结 本文提出DASD-4B-Thinking模型,通过改进序列蒸馏方法,实现高效推理性能,仅用448K样本达到SOTA效果。

Comments Project Page: https://github.com/D2I-ai/dasd-thinking

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16281 2026-01-15 cs.RO cs.AI cs.LG 86%

Do What You Say: Steering Vision-Language-Action Models via Runtime Reasoning-Action Alignment Verification

按言行事:通过运行时推理-动作对齐验证引导视觉-语言-动作模型

Yilin Wu, Anqi Li, Tucker Hermans, Fabio Ramos, Andrea Bajcsy, Claudia Pérez-D'Arpino

机构 * NVIDIA(NVIDIA公司) Carnegie Mellon University(卡内基梅隆大学) University of Utah(犹他大学) University of Sydney(悉尼大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 通过运行时推理-动作对齐验证方法提升视觉-语言-动作模型的鲁棒性和行为组合能力

详情

展开后加载摘要…

URL PDF HTML 收藏