arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-05 至 2026-02-05 共收录 89 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 7 篇

2602.04246 2026-02-05 cs.CL 85%

CoLT: Reasoning with Chain of Latent Tool Calls

CoLT:基于链式潜在工具调用的推理

Fangwei Zhu, Zhifang Sui

机构 * School of Computer Science, State Key Laboratory of Multimedia Information Processing, Peking University(计算机学院、多媒体信息处理国家重点实验室、北京大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 CoLT通过将潜在推理转化为工具调用,实现高效推理,提升模型效率与准确性,适用于多种解码器结构和强化学习算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04380 2026-02-05 cs.LG cs.AI 81%

Beyond KL Divergence: Policy Optimization with Flexible Bregman Divergences for LLM Reasoning

超越KL散度:基于灵活Bregman散度的群体策略优化用于大语言模型推理

Rui Yuan, Mykola Khandoga, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出GBMPO框架,通过灵活Bregman散度提升大语言模型在数学推理和代码生成任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04391 2026-02-05 cs.CL 79%

Beyond Rejection Sampling: Trajectory Fusion for Scaling Mathematical Reasoning

超越拒绝采样:轨迹融合用于扩展数学推理

Jie Deng, Hanshuang Tong, Jun Li, Shining Liang, Ning Wu, Hongzhi Li, Yutao Xie

机构 * Microsoft(微软)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 TrajFusion通过融合错误与正确推理轨迹,改进数学推理微调,提升复杂问题表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04417 2026-02-05 cs.LG cs.AI 73%

EMA Policy Gradient: Taming Reinforcement Learning for LLMs with EMA Anchor and Top-k KL

EMA策略梯度:通过EMA锚点和Top-k KL驯服LLM的强化学习

Lunjun Zhang, Jimmy Ba

机构 * University of Toronto(多伦多大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 EMA-PG通过EMA锚点和Top-k KL估计器提升LLM强化学习性能,显著提高数学推理和代理任务表现

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00843 2026-02-05 cs.AI cs.HC 57%

Benchmarking Large Language Models for Diagnosing Students' Cognitive Skills from Handwritten Math Work

对大型语言模型诊断学生手写数学作业认知技能的基准测试

Yoonsu Kim, Hyoungwook Jin, Hayeon Doh, Eunhye Kim, Dongyun Jung, Seungju Kim, Kiyoon Choi, Jinho Son, Juho Kim

机构 * School of Computing, KAIST, Daejeon, Republic of Korea(韩国庆熙大学计算机学院) University of Michigan, Ann Arbor, USA(美国密歇根大学) Ewha Womans University, Seoul, Republic of Korea(韩国成均馆大学) AlgorithmLabs, Seoul, Republic of Korea(韩国AlgorithmLabs公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文评估了18种大型语言模型在诊断学生手写数学作业认知技能时的表现,发现模型在模糊证据下表现不佳,揭示了模型在证据处理上的系统性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01075 2026-02-05 cs.AI 57%

ConvexBench: Can LLMs Recognize Convex Functions?

ConvexBench: LLMs能否识别凸函数?

Yepeng Liu, Yu Huang, Yu-Xiang Wang, Yingbin Liang, Yuheng Bu

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) University of Pennsylvania(宾夕法尼亚大学) UC San Diego(加州大学圣地亚哥分校) The Ohio State University(俄亥俄州立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 ConvexBench通过分治框架解决LLM在深度函数组合中识别凸性的挑战,显著提升大深度下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02463 2026-02-05 cs.AI 57%

Extending RLVR to Open-Ended Tasks via Verifiable Multiple-Choice Reformulation

通过可验证的多选改写扩展RLVR以应对开放性任务

Mengyu Zhang, Siyu Ding, Weichong Yin, Yu Sun, Hua Wu

机构 * Baidu Ernie Team(百度文心团队)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出VMR-RLVR方法,通过将开放性任务数据转化为可验证的多选格式,提升LLM在无明确真实值情况下开放性任务的推理能力。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2602.04846 2026-02-05 cs.LO cs.PL 50%

CSLib: The Lean Computer Science Library

CSLib: 用于证明计算机科学定理和编写形式验证代码的轻量级框架

Clark Barrett, Swarat Chaudhuri, Fabrizio Montesi, Jim Grundy, Pushmeet Kohli, Leonardo de Moura, Alexandre Rademaker, Sorrachai Yingchareonthawornchai

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 CSLib是一个旨在提升Lean在计算机科学领域应用的开源框架,通过增强形式验证能力促进教育与研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09696 2026-02-05 cs.HC 50%

Patterns for a New Generation: AI and Agents

新一代的模式:人工智能与代理

Joseph Corneli, Charles J. Danoff, Raymond S. Puzio, Sridevi Ayloo, Sergio Belich, Andre Wilkinson, Mary Tedeschi, Pauline Mosley

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出利用设计模式指导代理行为,展示基于LLM的系统能读取生成模式,并探讨其在软件开发、教育等领域的应用潜力。

Comments 10 pages with 4 page appendix; to appear in Proceedings of Pattern Languages of Programs 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 3 篇

2602.04144 2026-02-05 cs.AI cs.LG 73%

OMG-Agent: Toward Robust Missing Modality Generation with Decoupled Coarse-to-Fine Agentic Workflows

OMG-Agent:迈向鲁棒缺失模态生成的解耦粗到细代理工作流

Ruiting Dai, Zheyu Wang, Haoyu Yang, Yihan Liu, Chengzhi Wang, Zekun Zhang, Zishan Huang, Jiaman Cen, Lisi Mo

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

AI总结 OMG-Agent通过解耦粗到细的代理工作流,有效解决多模态数据缺失问题,提升生成的鲁棒性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04486 2026-02-05 cs.CL 57%

Beyond Unimodal Shortcuts: MLLMs as Cross-Modal Reasoners for Grounded Named Entity Recognition

超越单模态捷径:MLLMs作为跨模态推理器用于 grounded 命名实体识别

Jinlong Ma, Yu Zhang, Xuefeng Bai, Kehai Chen, Yuwei Wang, Zeming Liu, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MCR方法,通过多风格推理模式注入和约束引导的可验证优化,解决MLLMs在跨模态推理中的模态偏见问题,提升 grounded 命名实体识别的性能。

Comments GMNER

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04056 2026-02-05 eess.SY cs.RO cs.SY 50%

Modular Safety Guardrails Are Necessary for Foundation-Model-Enabled Robots in the Real World

模块化安全护栏是现实世界中由基础模型赋能的机器人所必需的

Joonkyung Kim, Wenxi Chen, Davood Soleymanzadeh, Yi Ding, Xiangbo Gao, Zhengzhong Tu, Ruqi Zhang, Fan Fei, Sushant Veer, Yiwei Lyu, Minghui Zheng, Yan Gu

机构 * Purdue University(普渡大学) Amazon(亚马逊公司) NVIDIA(英伟达公司)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出模块化安全护栏以解决现实世界中由基础模型赋能的机器人在开放、长尾和随时间适应的环境中的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 26 篇

2601.21358 2026-02-05 cs.AI cs.CL 92%

Latent Chain-of-Thought as Planning: Decoupling Reasoning from Verbalization

潜在的思维链作为规划:将推理与言说解耦

Jiecong Wang, Hao Peng, Chunyang Liu

机构 * Beihang University(北航大学) Didi Chuxing(滴滴出行)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(title,abstract);planning(title,abstract);CoT(abstract)

AI总结 PLaT通过解耦推理与言说,实现了更灵活的推理过程和更高的可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04326 2026-02-05 cs.AI cs.CL cs.MA 88%

From Assumptions to Actions: Turning LLM Reasoning into Uncertainty-Aware Planning for Embodied Agents

从假设到行动:将大语言模型推理转化为具有不确定性的代理规划

SeungWon Seo, SooBin Lim, SeongRae Noh, Haneul Kim, HyeongYeop Kang

机构 * Department of Computer Science and Engineering, Korea University(计算机科学与工程系,韩国大学)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.CL、cs.AI

AI总结 PCE框架通过结构化决策树将LLM推理中的假设转化为可靠策略,提升多智能体环境下的规划效率和任务完成率。

Comments 31 pages, 10 figures, Accepted ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03900 2026-02-05 cs.AI 87%

Knowledge Model Prompting Increases LLM Performance on Planning Tasks

知识模型提示增强了LLM在规划任务上的性能

Erik Goh, John Kos, Ashok Goel

机构 * School of Interactive Computing(交互计算学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 TMK框架通过显式任务分解和因果推理提升LLM在规划任务中的性能,使其在复杂符号任务中达到97.3%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04256 2026-02-05 cs.RO cs.AI 83%

AppleVLM: End-to-end Autonomous Driving with Advanced Perception and Planning-Enhanced Vision-Language Models

AppleVLM: 端到端自主驾驶与高级感知和规划增强的视觉语言模型

Yuxuan Han, Kunyuan Wu, Qianyi Shao, Renxiang Xiao, Zilu Wang, Cansen Jiang, Yi Xiao, Liang Hu, Yunjiang Lou

机构 * Shenzhen Key Lab for Advanced Motion Control and Modern Automation Equipments(深圳先进运动控制系统与现代自动化装备重点实验室) Guangdong Provincial Key Laboratory of Intelligent Morphing Mechanisms and Adaptive Robotics(广东省智能变形机制与适应机器人省重点实验室) School of Intelligence Science and Engineering(智能科学与工程学院) Harbin Institute of Technology(哈尔滨工业大学) National Key Laboratory of Smart Farm Technologies and Systems(国家智能农业技术与系统重点实验室) Autonomous Driving Center(自动驾驶中心) Shanghai Utopilot Technology Co.Ltd.(上海驭目科技有限公司)

专题命中 规划推理 :planning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 AppleVLM通过引入先进的视觉和规划编码器,提升端到端自动驾驶的感知和决策能力,实现复杂环境下的稳健驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04515 2026-02-05 cs.RO cs.CV 82%

EgoActor: Grounding Task Planning into Spatial-aware Egocentric Actions for Humanoid Robots via Visual-Language Models

EgoActor: 通过视觉语言模型将任务规划接地于空间感知的自我中心动作以实现人形机器人

Yu Bai, MingMing Yu, Chaojie Li, Ziyi Bai, Xinlong Wang, Börje F. Karlsson

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 EgoActor通过视觉语言模型将高层任务指令转化为精确的空间感知动作,实现人形机器人在真实和模拟环境中的稳健任务规划与运动执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04184 2026-02-05 cs.CV cs.AI cs.LG cs.RO 81%

Natural Language Instructions for Scene-Responsive Human-in-the-Loop Motion Planning in Autonomous Driving using Vision-Language-Action Models

基于视觉-语言-动作模型的自动驾驶场景响应式人机协同运动规划的自然语言指令

Angel Martinez-Sanchez, Parthib Roy, Ross Greer

机构 * University of California, Merced(加州大学默塞德分校)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究利用视觉-语言-动作模型,通过指令条件规划提升自动驾驶的鲁棒性和轨迹对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01374 2026-02-05 cs.LG cs.AI cs.PL 81%

REASONING COMPILER: LLM-Guided Optimizations for Efficient Model Serving

推理编译器:基于大语言模型的高效模型服务优化

Annabelle Sujun Tang, Christopher Priebe, Rohan Mahapatra, Lianhui Qin, Hadi Esmaeilzadeh

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 推理编译器利用大语言模型进行编译优化,通过上下文感知决策提升样本效率,实现高效模型服务。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04392 2026-02-05 cs.CL 79%

Evaluating the Presence of Sex Bias in Clinical Reasoning by Large Language Models

通过大语言模型评估临床推理中的性别偏见存在性

Isabel Tsintsiper, Sheng Wong, Beth Albert, Shaun P Brennecke, Gabriel Davis Jones

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 研究发现大语言模型在临床推理中存在性别偏见,不同模型表现不同,需谨慎配置与监督以确保医疗应用的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02542 2026-02-05 cs.LG cs.CR 79%

OverThink: Slowdown Attacks on Reasoning LLMs

OverThink: 对推理大语言模型的减速攻击

Abhinav Kumar, Jaechul Roh, Ali Naseh, Marzena Karpinska, Mohit Iyyer, Amir Houmansadr, Eugene Bagdasarian

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Simon Fraser University(西蒙弗雷泽大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 OverThink攻击通过注入伪装推理问题,迫使推理大语言模型消耗更多token,从而增加延迟和成本,同时探讨了其防御和影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04129 2026-02-05 cs.RO cs.AI cs.ET cs.MA 79%

KGLAMP: Knowledge Graph-guided Language model for Adaptive Multi-robot Planning and Replanning

KGLAMP:基于知识图谱的自适应多机器人规划与再规划语言模型

Chak Lam Shek, Faizan M. Tariq, Sangjae Bae, David Isele, Piyush Gupta

机构 * Honda Research Institute, USA(本田研究院) University of Maryland, College Park(马里兰大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 KGLAMP通过知识图谱引导LLM实现异构多机器人系统的自适应规划与再规划,提升动态环境下的规划效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04085 2026-02-05 cs.SD cs.CL 79%

BASS: Benchmarking Audio LMs for Musical Structure and Semantic Reasoning

BASS:用于音乐结构和语义推理的音频语言模型基准测试

Min Jang, Orevaoghene Ahia, Nazif Tamer, Sachin Kumar, Yulia Tsvetkov, Noah A. Smith

机构 * University of Washington(华盛顿大学) The Ohio State University(俄亥俄州立大学) Allen Institute for AI(人工智能研究所)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 BASS通过评估音频语言模型在音乐结构和语义推理方面的性能,揭示了现有模型在高层次推理任务上的局限性,并为音乐推荐和搜索提供评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03974 2026-02-05 cs.AI 79%

Active Epistemic Control for Query-Efficient Verified Planning

主动认知控制用于查询高效的验证规划

Shuhui Qu

机构 * Stanford University(斯坦福大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 主动认知控制通过结合基于模型的信念管理和范畴可行性检查,实现查询高效的验证规划,在交互环境中减少重新规划轮次。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04454 2026-02-05 cs.CV 78%

Seg-ReSearch: Segmentation with Interleaved Reasoning and External Search

Seg-ReSearch: 基于交织推理和外部搜索的分割

Tianming Liang, Qirui Du, Jian-Fang Hu, Haichao Jiang, Zicheng Lin, Wei-Shi Zheng

机构 * ISEE Lab, Sun Yat-sen University(中山大学ISEE实验室)

专题命中 规划推理 :reasoning(title,abstract)

AI总结 Seg-ReSearch通过交织推理和外部搜索提升分割系统处理动态开放世界查询的能力,有效克服现有方法的知识瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04315 2026-02-05 cs.RO cs.CV 78%

GeneralVLA: Generalizable Vision-Language-Action Models with Knowledge-Guided Trajectory Planning

GeneralVLA:具备知识引导轨迹规划的通用视觉-语言-动作模型

Guoqing Ma, Siheng Wang, Zeyu Zhang, Shan Yu, Hao Tang

机构 * CASIA(中国科学院自动化研究所) Peking University(北京大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 GeneralVLA通过知识引导轨迹规划,实现无需真实数据或示范的通用视觉-语言-动作模型,提升机器人零样本操作和数据生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17489 2026-02-05 cs.CL cs.AI 73%

MapCoder-Lite: Distilling Multi-Agent Coding into a Single Small LLM

MapCoder-Lite:将多智能体编码 distilling 进单一小型 LLM

Woongkyu Lee, Junhee Cho, Jungwook Choi

机构 * Hanyang University(翰阳大学) Samsung SDS(三星SDS)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 MapCoder-Lite通过三支柱方法将多智能体编码distilling进单一7B模型,显著提升代码生成性能并降低资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04118 2026-02-05 cs.LG cs.AI cs.CL 67%

Policy Learning with a Language Bottleneck

具有语言瓶颈的策略学习

Megha Srivastava, Cedric Colas, Dorsa Sadigh, Jacob Andreas

机构 * Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) Inria(法国国家信息与自动化技术研究院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过语言瓶颈框架,AI代理能生成可解释的策略规则,提升与人类的协作效率。

Comments Accepted to TMLR (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03351 2026-02-05 cs.AI cs.CY cs.LG 62%

Building Interpretable Models for Moral Decision-Making

构建道德决策的可解释模型

Mayank Goel, Aritra Das, Paras Chopra

机构 * Lossfunk Ashoka University(阿什oka大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种定制的Transformer模型,用于研究神经网络在道德决策中的表现,并通过可解释性技术揭示了道德推理的分布特性。

Comments 8 pages, 4 figures, accepted to AAAI'26 Machine Ethics Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04304 2026-02-05 cs.CV cs.AI cs.CL 62%

Beyond Static Cropping: Layer-Adaptive Visual Localization and Decoding Enhancement

超越静态裁剪:层适应的视觉定位与解码增强

Zipeng Zhu, Zhanghao Hu, Qinglin Zhu, Yuxi Hong, Yijun Liu, Jingyong Su, Yulan He, Lin Gui

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) King’s College London(伦敦大学国王学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LASER方法,通过动态层适应提升视觉定位和解码精度,解决静态裁剪在复杂推理任务中的局限性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏