arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-12 至 2026-02-12 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 5 篇

2602.10494 2026-02-12 cs.CL 85%

Canvas-of-Thought: Grounding Reasoning via Mutable Structured States

Canvas-of-Thought:通过可变的结构化状态进行推理

Lingzhuang Sun, Yuxia Zhu, Ruitong Liu, Hao Liang, Zheng Sun, Caijun Jia, Honghao He, Yuchen Wu, Siyuan Li, Jingxuan Wei, Xiangxiang Zhang, Bihui Yu, Wentao Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) New York University(纽约大学) Westlake University(西湖大学)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 Canvas-CoT通过引入HTML Canvas实现可变结构化状态,提升多模态推理效率与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11096 2026-02-12 cs.CL cs.AI 84%

Safety Recovery in Reasoning Models Is Only a Few Early Steering Steps Away

推理模型中的安全恢复仅需几步早期引导步骤

Soumya Suvra Ghosal, Souradip Chakraborty, Vaibhav Singh, Furong Huang, Dinesh Manocha, Amrit Singh Bedi

机构 * University of Maryland, College Park(马里兰大学哥伦比亚学院) IIT, Bombay(孟买印度理工学院) University of Central Florida(佛罗里达中央大学)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 SafeThink通过在推理早期干预减少攻击成功率,提升推理模型的安全性

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10816 2026-02-12 cs.CL cs.AI 76%

Beyond Confidence: The Rhythms of Reasoning in Generative Models

超越置信度:生成模型推理的节奏

Deyuan Liu, Zecheng Wang, Zhanyue Qin, Zhiying Tu, Dianhui Chu, Dianbo Sui

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 逻辑推理 :reasoning(title);分类 cs.CL、cs.AI

AI总结 本文提出δ_TC B度量标准,用于评估生成模型在预测稳定性方面的鲁棒性,揭示了传统度量在上下文学习中的不足,并为提升模型稳定性提供新方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10598 2026-02-12 cs.AI cs.LG 62%

Neuro-symbolic Action Masking for Deep Reinforcement Learning

神经符号动作遮蔽用于深度强化学习

Shuai Han, Mehdi Dastani, Shihan Wang

机构 * Utrecht University(乌得勒支大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 NSAM通过自动学习符号模型与深度策略优化结合,提升深度强化学习的样本效率并减少约束违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09447 2026-02-12 cs.SE cs.AI cs.CL 62%

SWE-AGI: Benchmarking Specification-Driven Software Construction with MoonBit in the Era of Autonomous Agents

SWE-AGI:在自主代理时代利用MoonBit进行规范驱动软件构建的基准测试

Zhirui Zhang, Hongbo Zhang, Haoxiang Fei, Zhiyuan Bao, Yubin Chen, Zhengyu Lei, Ziyue Liu, Yixuan Sun, Mingkun Xiao, Zihang Ye, Yu Zhang, Hongcheng Zhu, Yuxiang Wen, Heung-Yeung Shum

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SWE-AGI通过MoonBit评估LLM在规范驱动下的软件构建能力,揭示了AI辅助开发中代码阅读瓶颈及模型性能随任务难度变化的特性。

Comments 20 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏