arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-17 至 2026-02-17 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 10 篇

2506.08672 2026-02-17 cs.CL cs.AI cs.LG 82%

RuleReasoner: Reinforced Rule-based Reasoning via Domain-aware Dynamic Sampling

RuleReasoner: 基于领域感知动态采样的强化规则推理

Yang Liu, Jiaqi Li, Zilong Zheng

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RuleReasoner通过领域感知动态采样方法提升规则推理性能,优于现有大型推理模型。

Comments ICLR 2026 camera ready, 28 pages, 10 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14428 2026-02-17 cs.CL 79%

LLM-Guided Knowledge Distillation for Temporal Knowledge Graph Reasoning

基于大语言模型的知识蒸馏的时序知识图谱推理

Wang Xing, Wei Song, Siyu Lin, Chen Wu, Man Wang

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) School of Information Science and Engineering, Chongqing Jiaotong University(重庆交通大学信息科学与工程学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一种基于大语言模型的知识蒸馏框架,用于提升时序知识图谱推理性能,通过引入大语言模型作为辅助指导者,实现更高效的模型压缩与训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15005 2026-02-17 cs.CL cs.IR 74%

Learning User Interests via Reasoning and Distillation for Cross-Domain News Recommendation

通过推理和蒸馏学习用户兴趣以实现跨领域新闻推荐

Mengdan Zhu, Yufan Zhao, Tao Di, Yulan Yan, Liang Zhao

机构 * Microsoft(微软公司) Emory University(埃默里大学)

专题命中 测试时计算 :reasoning(title);分类 cs.CL

AI总结 本文提出通过推理和蒸馏学习用户兴趣的方法,提升跨领域新闻推荐的性能和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13248 2026-02-17 cs.AI cs.CL cs.RO 73%

X-Blocks: Linguistic Building Blocks of Natural Language Explanations for Automated Vehicles

X-Blocks: 自然语言解释的语义构建块用于自动驾驶车辆

Ashkan Y. Zadeh, Xiaomeng Li, Andry Rakotonirainy, Ronald Schroeter, Sebastien Glaser, Zishuo Zhu

机构 * Queensland University of Technology (QUT)(昆士兰科技大学) ARC Training Centre for Automated Vehicles in Rural and Remote Regions (AVR3)(农村和偏远地区自动化车辆培训中心)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 X-Blocks框架通过分层分析识别自动驾驶车辆自然语言解释的构建块,提供场景感知解释的设计原则,提升透明性和用户信任。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14910 2026-02-17 cs.AI 70%

Position: Introspective Experience from Conversational Environments as a Path to Better Learning

位置:对话环境中的反思经验作为更好学习的路径

Claudiu Cristian Musat, Jackson Tolins, Diego Antognini, Jingling Li, Martin Klissarov, Tom Duerig

机构 * Google DeepMind(谷歌DeepMind)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 本文提出通过对话环境中的反思经验提升学习效果,强调社会互动对推理能力的培养作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20802 2026-02-17 cs.LG cs.AI 62%

Reinforcement Learning via Self-Distillation

通过自我蒸馏进行强化学习

Jonas Hübotter, Frederike Lübeck, Lejs Behric, Anton Baumann, Marco Bagatella, Daniel Marta, Ido Hakimi, Idan Shenfeld, Thomas Kleine Buening, Carlos Guestrin, Andreas Krause

机构 * ETH Zurich(苏黎世联邦理工学院) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) MIT(麻省理工学院) Stanford(斯坦福大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过自我蒸馏策略优化(SDPO)提升强化学习在可验证环境中的样本效率和准确性,利用自身反馈改进策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00499 2026-02-17 cs.LG cs.AI stat.ML 62%

ESPO: Entropy Importance Sampling Policy Optimization

ESPO:熵重要性采样策略优化

Yuepeng Sheng, Yuwei Huang, Shuman Liu, Anxiang Zeng, Haibo Zhang

机构 * LLM Team, Shopee Pte. Ltd.(Shopee 股份有限公司大语言模型团队)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ESPO通过结合细粒度更新与稳定训练,解决梯度利用率不足问题,提升大语言模型在复杂推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14060 2026-02-17 cs.CL 57%

LM-Lexicon: Improving Definition Modeling via Harmonizing Semantic Experts

LM-Lexicon:通过和谐语义专家提升定义建模

Yang Liu, Jiaye Yang, Weikang Li, Jiahui Liang, Yang Li, Lingyong Yan

机构 * BIGAI Baidu Inc.(百度公司) Peking University(北京大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL

AI总结 LM-Lexicon通过语义专家学习和混合架构提升定义建模效果,实现BLEU分数提升7%,并优化领域级路由机制

Comments EACL 2026 (Oral), 22 pages, 12 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14050 2026-02-17 cs.LG 57%

Position Encoding with Random Float Sampling Enhances Length Generalization of Transformers

基于随机浮点采样的位置编码增强变换器的长度泛化能力

Atsushi Shimizu, Shohei Taniguchi, Yutaka Matsuo

机构 * Daiwa Securities(大和证券) The University of Tokyo(东京大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 本研究提出随机浮点采样方法,通过增强位置编码的泛化能力,提升变换器在长序列处理和常识推理任务中的表现。

Comments To appear at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17315 2026-02-17 cs.CL 57%

HIPPO: Enhancing the Table Understanding Capability of LLMs through Hybrid-Modal Preference Optimization

HIPPO:通过混合模态偏好优化增强大语言模型的表格理解能力

Haolan Wang, Zhenghao Liu, Xinze Li, Xiaocui Yang, Yu Gu, Yukun Yan, Qi Shi, Fangfang Li, Chong Chen, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 HIPPO 通过混合模态偏好优化提升大语言模型的表格理解能力,实现 4% 的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏