arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-11 至 2026-02-11 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 4 篇

2602.09945 2026-02-11 cs.AI 85%

Closing Reasoning Gaps in Clinical Agents with Differential Reasoning Learning

通过差异推理学习关闭临床代理中的推理差距

Jinsong Liu, Yuhang Jiang, Ramayya Krishnan, Rema Padman, Yiye Zhang, Jiang Bian

机构 * Dept. of Population Health Sciences, Weill Cornell Medicine, Cornell University(人口健康科学系,韦尔·科恩医学中心,康奈尔大学)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 DRL通过学习推理差异改进临床代理,提升问答和预测任务的准确性和推理可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09443 2026-02-11 cs.AI 79%

P1-VL: Bridging Visual Perception and Scientific Reasoning in Physics Olympiads

P1-VL: 联结视觉感知与物理竞赛中的科学推理

Yun Luo, Futing Wang, Qianjia Cheng, Fangchen Yu, Haodi Lei, Jianhao Yan, Chenxi Li, Jiacheng Chen, Yufeng Zhao, Haiyuan Wan, Yuchen Zhang, Shenghe Zheng, Junchi Yao, Qingyang Zhang, Haonan He, Wenxuan Zeng, Li Sheng, Chengxing Xie, Yuxin Zuo, Yizhuo Li, Yulun Wu, Rui Huang, Dongzhan Zhou, Kai Chen, Yu Qiao, Lei Bai, Yu Cheng, Ning Ding, Bowen Zhou, Peng Ye, Ganqu Cui

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 P1-VL通过融合课程强化学习和代理增强技术,成为首个在物理竞赛中获得12枚金牌的开源视觉-语言模型,展示了卓越的科学推理能力和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08658 2026-02-11 cs.CL 79%

Fundamental Reasoning Paradigms Induce Out-of-Domain Generalization in Language Models

基本推理范式诱导语言模型的领域外泛化

Mingzi Cao, Xingwei Tan, Mahmud Elahi Akhter, Marco Valentino, Maria Liakata, Xi Wang, Nikolaos Aletras

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究通过诱导基本推理范式提升语言模型的领域外泛化能力,实验表明方法在现实任务中性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09801 2026-02-11 cs.MA 50%

Tiny Moves: Game-based Hypothesis Refinement

Tiny Moves: 基于游戏的假设精炼

Agnieszka Dobrowolska, Rogier Hintzen, Martin Balla, Karl Gemayel, Sabine Reichert, Thomas Charman, Jen Ning Lim, Lindsay Edwards, Anna Gogleva

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出基于游戏的假设精炼方法,通过LLM代理在共享状态上进行渐进式推理移动,有效提升科学发现中假设修正的精度与可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏