arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-12 至 2026-02-12 共收录 86 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 7 篇

2509.21124 2026-02-12 cs.AI cs.CL 86%

Expanding Reasoning Potential in Foundation Model by Learning Diverse Chains of Thought Patterns

通过学习多样的思维链模式扩展基础模型的推理潜力

Xuemiao Zhang, Can Ren, Chengying Tu, Rongxiang Weng, Shuo Wang, Hongfei Yan, Jingang Wang, Xunliang Cai

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Meituan(美团) State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过学习富含高价值推理模式的多样化数据,扩展基础模型的推理潜力,显著提升模型在数学推理任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10632 2026-02-12 cs.SC cs.AI 85%

The Neurosymbolic Frontier of Nonuniform Ellipticity: Formalizing Sharp Schauder Theory via Topos-Theoretic Reasoning Models

非均匀椭圆性神经符号前沿:通过拓扑学推理模型形式化精确Schauder理论

Suyash Mishra

机构 * Suyash Mishra

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文通过拓扑学推理模型形式化精确Schauder理论,结合神经符号大推理模型解决非均匀椭圆正则性理论中的关键问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08554 2026-02-12 cs.LG stat.ML 79%

Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization

通过群体扩散策略优化提升扩散语言模型的推理能力

Kevin Rojas, Jiahe Lin, Kashif Rasul, Anderson Schneider, Yuriy Nevmyvaka, Molei Tao, Wei Deng

机构 * Georgia Institute of Technology(佐治亚理工学院) ML Research, Morgan Stanley(摩根士丹利机器学习研究部)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出GDPO算法,通过减少ELBO估计的方差提升扩散语言模型的推理能力,实验证明其在多个基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09718 2026-02-12 cs.CL cs.AI 62%

StatLLaMA: Multi-Stage training for domain-optimized statistical large language models

StatLLaMA:面向统计领域优化的多阶段训练方法

Jing-Yi Zeng, Guan-Hua Huang

机构 * Institute of Statistics, National Yang Ming Chiao Tung University(统计研究所,国立阳明交通大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 StatLLaMA通过多阶段训练方法优化统计领域,实现高效且平衡的模型性能。

Comments 31 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02482 2026-02-12 cs.LG 57%

Expanding the Capabilities of Reinforcement Learning via Text Feedback

通过文本反馈扩展强化学习的能力

Yuda Song, Lili Chen, Fahim Tajwar, Remi Munos, Deepak Pathak, J. Andrew Bagnell, Aarti Singh, Andrea Zanette

机构 * Department of XXX, University of YYY, Location, Country(YYY大学XXX系) School of ZZZ, Institute of WWW, Location, Country(WWW研究所ZZZ学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出通过文本反馈改进强化学习的方法,通过自我蒸馏和反馈建模在推理、数学和写作任务中超越基线性能。

Comments 43 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23279 2026-02-12 cs.CL 57%

Unveiling Super Experts in Mixture-of-Experts Large Language Models

揭示混合专家大语言模型中的超级专家

Zunhai Su, Qingyuan Li, Hao Zhang, Weihao Ye, Qibo Xue, YuLei Qian, Yuchen Xie, Ngai Wong, Kehong Yuan

机构 * Tsinghua University(清华大学) Meituan(美团) Xiamen University(厦门大学) Nanjing University(南京大学) The University of Hong Kong(香港大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 研究揭示了混合专家大语言模型中起关键作用的超级专家,通过分析其影响发现其在数学推理中的重要性,并探讨了压缩这些专家对模型性能的显著影响。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10597 2026-02-12 cs.CY 50%

Llama-Polya: Instruction Tuning for Large Language Model based on Polya's Problem-solving

Llama-Polya:基于波利亚问题解决框架的大型语言模型指令调优

Unggi Lee, Yeil Jeong, Chohui Lee, Gyuri Byun, Yunseo Lee, Minji Kang, Minji Jeon

专题命中 数学推理 :reasoning(abstract)

AI总结 Llama-Polya通过整合波利亚问题解决框架,提升大型语言模型在数学推理和教学对齐方面的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2602.10481 2026-02-12 cs.CR cs.AI cs.MA 57%

Protecting Context and Prompts: Deterministic Security for Non-Deterministic AI

保护上下文和提示:非确定性AI的确定性安全

Mohan Rajagopalan, Vinay Rao

机构 * MACAW Security, Inc.(MACAW安全公司)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出认证提示和上下文技术,通过加密验证和策略代数实现LLM的预防性安全,有效防止提示注入和上下文操纵攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 5 篇

2602.10494 2026-02-12 cs.CL 85%

Canvas-of-Thought: Grounding Reasoning via Mutable Structured States

Canvas-of-Thought:通过可变的结构化状态进行推理

Lingzhuang Sun, Yuxia Zhu, Ruitong Liu, Hao Liang, Zheng Sun, Caijun Jia, Honghao He, Yuchen Wu, Siyuan Li, Jingxuan Wei, Xiangxiang Zhang, Bihui Yu, Wentao Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) New York University(纽约大学) Westlake University(西湖大学)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 Canvas-CoT通过引入HTML Canvas实现可变结构化状态,提升多模态推理效率与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11096 2026-02-12 cs.CL cs.AI 84%

Safety Recovery in Reasoning Models Is Only a Few Early Steering Steps Away

推理模型中的安全恢复仅需几步早期引导步骤

Soumya Suvra Ghosal, Souradip Chakraborty, Vaibhav Singh, Furong Huang, Dinesh Manocha, Amrit Singh Bedi

机构 * University of Maryland, College Park(马里兰大学哥伦比亚学院) IIT, Bombay(孟买印度理工学院) University of Central Florida(佛罗里达中央大学)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 SafeThink通过在推理早期干预减少攻击成功率,提升推理模型的安全性

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10816 2026-02-12 cs.CL cs.AI 76%

Beyond Confidence: The Rhythms of Reasoning in Generative Models

超越置信度:生成模型推理的节奏

Deyuan Liu, Zecheng Wang, Zhanyue Qin, Zhiying Tu, Dianhui Chu, Dianbo Sui

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 逻辑推理 :reasoning(title);分类 cs.CL、cs.AI

AI总结 本文提出δ_TC B度量标准,用于评估生成模型在预测稳定性方面的鲁棒性,揭示了传统度量在上下文学习中的不足,并为提升模型稳定性提供新方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10598 2026-02-12 cs.AI cs.LG 62%

Neuro-symbolic Action Masking for Deep Reinforcement Learning

神经符号动作遮蔽用于深度强化学习

Shuai Han, Mehdi Dastani, Shihan Wang

机构 * Utrecht University(乌得勒支大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 NSAM通过自动学习符号模型与深度策略优化结合,提升深度强化学习的样本效率并减少约束违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09447 2026-02-12 cs.SE cs.AI cs.CL 62%

SWE-AGI: Benchmarking Specification-Driven Software Construction with MoonBit in the Era of Autonomous Agents

SWE-AGI:在自主代理时代利用MoonBit进行规范驱动软件构建的基准测试

Zhirui Zhang, Hongbo Zhang, Haoxiang Fei, Zhiyuan Bao, Yubin Chen, Zhengyu Lei, Ziyue Liu, Yixuan Sun, Mingkun Xiao, Zihang Ye, Yu Zhang, Hongcheng Zhu, Yuxiang Wen, Heung-Yeung Shum

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SWE-AGI通过MoonBit评估LLM在规范驱动下的软件构建能力,揭示了AI辅助开发中代码阅读瓶颈及模型性能随任务难度变化的特性。

Comments 20 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 19 篇

2506.12365 2026-02-12 cs.CL cs.DB 83%

Advances in LLMs with Focus on Reasoning, Adaptability, Efficiency and Ethics

大语言模型的进展:聚焦推理、适应性、效率和伦理

Asifullah Khan, Muhammad Zaeem Khan, Aleesha Zainab, Saleha Jamshed, Sadia Ahmad, Kaynat Khatib, Faria Bibi, Abdul Rehman

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文综述了大语言模型在推理、适应性、效率和伦理方面的进展,探讨了关键技术和挑战,提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10485 2026-02-12 cs.AI 79%

Abstraction Generation for Generalized Planning with Pretrained Large Language Models

基于预训练大语言模型的通用规划抽象生成

Zhenhe Cui, Huaxiang Xia, Hangjun Shen, Kailun Luo, Yong He, Wei Liang

机构 * Hunan University of Science and Technology(湖南科技大学) Dongguan University of Technology(东莞理工学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出利用预训练大语言模型生成通用规划的抽象,并通过自动化调试修正抽象,以提升规划效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10439 2026-02-12 cs.SD cs.AI eess.AS 79%

AudioRouter: Data Efficient Audio Understanding via RL based Dual Reasoning

AudioRouter: 通过基于强化学习的双推理实现数据高效的音频理解

Liyang Chen, Hongkai Chen, Yujun Cai, Sifan Li, Qingwen Ye, Yiwei Wang

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 AudioRouter通过强化学习双推理机制,以更少的数据训练实现LALMs在音频理解上的高效提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10771 2026-02-12 cs.CV cs.RO 78%

From Steering to Pedalling: Do Autonomous Driving VLMs Generalize to Cyclist-Assistive Spatial Perception and Planning?

从转向到踩踏:自动驾驶VLMs是否能泛化到骑行辅助的空间感知与规划?

Krishna Kanth Nakka, Vedasri Nakka

专题命中 规划推理 :planning(title);reasoning(abstract)

AI总结 本文提出CyclingVQA基准,评估自动驾驶VLMs在骑行辅助场景中的感知与推理能力,发现现有模型在骑行特定交通提示理解上存在不足,需进一步改进。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07695 2026-02-12 cs.AI cs.CL cs.IR cs.MM 73%

EventCast: Hybrid Demand Forecasting in E-Commerce with LLM-Based Event Knowledge

EventCast:基于LLM事件知识的电子商务混合需求预测

Congcong Hu, Yuang Shi, Fan Huang, Yang Xiang, Zhou Ye, Ming Jin, Shiyu Wang

机构 * ByteDance China(字节跳动中国) National University of Singapore(新加坡国立大学) Griffith University(格里菲斯大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 EventCast通过整合LLM事件知识提升电子商务需求预测精度,实现86.9%和97.7%的MAE和MSE改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10910 2026-02-12 cs.RO 71%

Safe mobility support system using crowd mapping and avoidance route planning using VLM

基于人群映射与避让路线规划的安全移动支持系统

Sena Saito, Kenta Tabata, Renato Miyagusuku, Koichi Ozaki

机构 * Graduate School of Regional Development and Creativity, Division of Engineering and Agriculture, Graduate School, Utsunomiya University(乌市大学研究生院区域发展与创意学院,工程与农业系)

专题命中 规划推理 :planning(title)

AI总结 本文提出利用视觉-语言模型和高斯过程回归生成动态人群密度地图,以提升自主机器人在拥挤环境中的安全导航能力。

Journal ref 2025 IEEE International Conference on Real-time Computing and Robotics (RCAR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01253 2026-02-12 cs.AI cs.SY eess.SY q-bio.NC 70%

Metareasoning in uncertain environments: a meta-BAMDP framework

在不确定环境中进行元推理:一个元Bayes-适应MDP框架

Prakhar Godara, Tilman Diego Alemán

机构 * Department of Psychology(心理学系) Institut für Geometrie und Praktische Mathematik(几何与应用数学研究所)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出元Bayes-适应MDP框架,用于处理未知奖励和转移分布环境中的元推理问题,并在伯努利老虎机任务中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11124 2026-02-12 cs.CV 67%

PhyCritic: Multimodal Critic Models for Physical AI

PhyCritic:面向物理AI的多模态批评模型

Tianyi Xiong, Shihao Wang, Guilin Liu, Yi Dong, Ming Li, Heng Huang, Jan Kautz, Zhiding Yu

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 PhyCritic通过双阶段RLVR流程优化,提升物理AI任务中的感知和推理能力,实现对物理任务的高效评估和改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04683 2026-02-12 cs.SD 67%

UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization

UniAudio 2.0:一种具有文本对齐因子化音频标记化的统一音频语言模型

Dongchao Yang, Yuanyuan Wang, Dading Chong, Songxiang Liu, Xixin Wu, Helen Meng

机构 * The Chinese University of Hong Kong, China(香港中文大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 UniAudio 2.0通过引入ReasoningCodec和统一自回归架构,实现了文本对齐的因子化音频标记化,提升了音频理解和生成性能,并在多种任务中展现了强大的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10490 2026-02-12 cs.IR 67%

ChainRec: An Agentic Recommender Learning to Route Tool Chains for Diverse and Evolving Interests

ChainRec: 一个用于路由工具链的代理推荐学习系统,以应对多样化和演变的兴趣

Fuchun Li, Qian Li, Xingyu Gao, Bocheng Pan, Yang Wu, Jun Zhang, Huan Yu, Jie Jiang, Jinsheng Xiao, Hailong Shi

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 ChainRec通过动态选择推理工具的代理推荐系统,提升冷启动和兴趣演变场景下的推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10479 2026-02-12 cs.SE 67%

From Prompt-Response to Goal-Directed Systems: The Evolution of Agentic AI Software Architecture

从提示-响应到目标导向系统:代理AI软件架构的演变

Mamdouh Alenezi

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文探讨了代理AI从提示-响应到目标导向系统的架构演变,提出了生产级代理的参考架构、多代理拓扑分类及企业加固检查表,强调标准化代理循环和可审计控制机制的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09849 2026-02-12 cs.RO 67%

BagelVLA: Enhancing Long-Horizon Manipulation via Interleaved Vision-Language-Action Generation

BagelVLA: 通过交错视觉-语言-动作生成增强长时程操作

Yucheng Hu, Jianke Zhang, Yuanfei Luo, Yanjiang Guo, Xiaoyu Chen, Xinshu Sun, Kun Feng, Qingzhou Lu, Sheng Chen, Yangang Zhang, Wei Li, Jianyu Chen

机构 * Tsinghua University(清华大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 BagelVLA通过整合语言规划、视觉预测和动作生成,提升复杂长时程操作任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00181 2026-02-12 cs.LG cs.AI stat.ML 62%

Orion-Bix: Bi-Axial Attention for Tabular In-Context Learning

Orion-Bix:用于表格上下文学习的双轴注意力

Mohamed Bouadi, Pratinav Seth, Aditya Tanna, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Orion-Bix通过双轴注意力与元学习方法,实现了高效且鲁棒的少样本表格学习,优于基线模型并在基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06717 2026-02-12 cs.LG cs.AI 62%

Proficient Graph Neural Network Design by Accumulating Knowledge on Large Language Models

通过在大型语言模型上积累知识来精通图神经网络设计

Jialiang Wang, Hanmo Liu, Shimin Di, Zhili Wang, Jiachuan Wang, Lei Chen, Xiaofang Zhou

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Southeast University(东南大学) HoHuawei Hong Kong Research Center (HKRC)(华为香港研究中心) University of Tsukuba(筑波大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DesiGNN通过在大型语言模型上积累知识,提升图神经网络设计的自动化水平,实现高效精准的模型生成。

Comments Accepted at WSDM 2026. Title changed from "Computation-friendly graph neural network design by accumulating knowledge on large language models" to "Proficient Graph Neural Network Design by Accumulating Knowledge on Large Language Models"

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09651 2026-02-12 cs.CV cs.AI cs.LG 62%

Geospatial Representation Learning: A Survey from Deep Learning to The LLM Era

地理空间表示学习:从深度学习到大语言模型时代的一次综述

Xixuan Hao, Yutian Jiang, Xingchen Zou, Jiabo Liu, Yifang Yin, Song Gao, Flora Salim, Tianrui Li, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) The University of New South Wales(新南威尔士大学) Southwest Jiaotong University(西南交通大学) Institute for Infocomm Research (I$^2$R), A*STAR(信息通信研究院(I$^2$R),A*STAR)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了从深度学习到大语言模型时代的地理空间表示学习,探讨了其方法、应用及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16376 2026-02-12 cs.CL 57%

Polymer-Agent: Large Language Model Agent for Polymer Design

聚合物代理:用于聚合物设计的大型语言模型代理

Vani Nigam, Achuth Chandrasekhar, Amir Barati Farimani

机构 * Department of Materials Science and Engineering, Carnegie Mellon University(材料科学与工程系,卡内基梅隆大学) Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于LLM的聚合物代理,通过结构-性质预测和生成技术,助力实验室研究人员高效发现新型聚合物结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10159 2026-02-12 cs.CV cs.LG 57%

Beyond Closed-Pool Video Retrieval: A Benchmark and Agent Framework for Real-World Video Search and Moment Localization

超越封闭池视频检索:面向真实世界视频搜索和时刻定位的基准与代理框架

Tao Yu, Yujia Yang, Haopeng Jin, Junhao Gong, Xinlong Chen, Yuxuan Zhou, Shanbin Zhang, Jiabing Yang, Xinming Wang, Hongzhu Yi, Ping Nie, Kai Zou, Zhang Zhang, Yan Huang, Liang Wang, Yeshani, Ruiwen Tao, Jin Ma, Haijin Liang, Jinwen Luo

机构 * CASIA UCAS Tencent(腾讯) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出RVMS-Bench和RACLO框架,用于评估现实世界中基于模糊记忆的视频检索和时刻定位,揭示现有模型在该任务上的不足。

Comments 49 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏