arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-19 至 2026-02-19 共收录 62 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 5 篇

2504.00869 2026-02-19 cs.CL cs.AI 81%

m1: Unleash the Potential of Test-Time Scaling for Medical Reasoning with Large Language Models

m1:通过大语言模型的测试时缩放释放医疗推理的潜力

Xiaoke Huang, Juncheng Wu, Hui Liu, Xianfeng Tang, Yuyin Zhou

机构 * UC Santa Cruz(加州大学圣克ruz分校) Amazon Research(亚马逊研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出m1方法,通过测试时缩放提升医疗推理能力,发现最佳推理预算和医学知识不足是关键瓶颈。

Comments 17 pages; 7 figures; Data, code, and models: https://github.com/UCSC-VLAA/m1 ; Accepted by ML4H'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15843 2026-02-19 cs.CL cs.AI 73%

The Perplexity Paradox: Why Code Compresses Better Than Math in LLM Prompts

困惑性悖论:为什么代码在LLM提示中比数学压缩得更好

Warren Johnson

机构 * Bona Opera Studios(博纳歌剧工作室)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文揭示代码在LLM提示中比数学压缩更有效的原因,并提出TAAC算法实现更高效的压缩。

Comments 19 pages, 5 figures, 4 tables. Second paper in TAAC research series. Code and data at https://github.com/micoverde/taac-llm-compression

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15194 2026-02-19 cs.LG cs.CL 73%

Evolving Language Models without Labels: Majority Drives Selection, Novelty Promotes Variation

无需标签的进化语言模型:多数驱动选择,新颖性促进变异

Yujun Zhou, Zhenwen Liang, Haolin Liu, Wenhao Yu, Kishan Panaganti, Linfeng Song, Dian Yu, Xiangliang Zhang, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Notre Dame(圣母大学) University of Virginia(弗吉尼亚大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

AI总结 EVOL-RL通过结合多数稳定性与新颖性探索,实现无需标签的自我改进语言模型,提升推理能力和领域外泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16554 2026-02-19 cs.LO cs.AI cs.ET quant-ph 57%

MerLean: An Agentic Framework for Autoformalization in Quantum Computation

MerLean:一个用于量子计算自动形式化的代理框架

Yuanjie Ren, Jinzheng Li, Yidi Qi

机构 * Massachusetts Institute of Technology(麻省理工学院) Northeastern University(东北大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 MerLean通过自动化形式化框架将量子计算论文中的数学语句转化为Lean代码并回译为可读格式,实现端到端验证,为同行评审和合成数据训练提供实用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16066 2026-02-19 cs.AI 57%

Improving Interactive In-Context Learning from Natural Language Feedback

通过自然语言反馈提升交互式上下文学习

Martin Klissarov, Jonathan Cook, Diego Antognini, Hao Sun, Jingling Li, Natasha Jaques, Claudiu Musat, Edward Grefenstette

机构 * Google DeepMind(谷歌DeepMind)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出一种框架,通过自然语言反馈提升模型交互式上下文学习能力,使模型在多轮交互中表现更优,并具备自我纠正能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2508.02515 2026-02-19 cs.CL cs.LG 62%

PoeTone: A Framework for Constrained Generation of Structured Chinese Songci with LLMs

PoeTone: 一个用于基于LLM生成结构化中文词的约束生成框架

Zhan Qu, Shuzhou Yuan, Michael Färber

专题命中 代码与定理证明 :chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 PoeTone框架通过约束生成和评估方法,提升LLM在生成结构化中文词中的表现,实现正式符合度提升5.88%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15831 2026-02-19 cs.HC cs.MA 50%

A2H: Agent-to-Human Protocol for AI Agent

A2H:AI代理的代理到人类协议

Zhiyuan Liang, Enfang Cui, Qian Wei, Rui She, Tianzheng Li, Minxin Guo, Yujun Cheng

专题命中 代码与定理证明 :planning(abstract)

AI总结 A2H协议通过统一机制使人类成为可发现的可解析实体,推动AI代理向人类连接的智能基础设施发展。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 4 篇

2602.15874 2026-02-19 cs.CL cs.LG 86%

P-RAG: Prompt-Enhanced Parametric RAG with LoRA and Selective CoT for Biomedical and Multi-Hop QA

P-RAG:结合LoRA和选择性CoT的增强型参数RAG

Xingda Lyu, Gongfu Lyu, Zitai Yan, Yuxin Jiang

专题命中 逻辑推理 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 P-RAG通过LoRA和选择性CoT提升生物医学问答的准确性和可扩展性。

Journal ref Proceedings of International Conference on Computing and Data Science Symposium: Application of Machine Learning in Engineering, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16050 2026-02-19 cs.AI cs.CL 81%

Evidence-Grounded Subspecialty Reasoning: Evaluating a Curated Clinical Intelligence Layer on the 2025 Endocrinology Board-Style Examination

基于证据的专科推理:在2025年内分泌学委员会式考试上评估一个经过精心编纂的临床智能层

Amir Hosseinian, MohammadReza Zare Shahneh, Umer Mansoor, Gilbert Szeto, Kirill Karlin, Nima Aghaeepour

机构 * January AI Stanford University(斯坦福大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于证据的专科推理系统Mirror,在内分泌学考试中超越了现有LLM,展现出高准确率和证据可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15858 2026-02-19 cs.CL cs.AI 81%

State Design Matters: How Representations Shape Dynamic Reasoning in Large Language Models

状态设计至关重要:表示如何塑造大语言模型中的动态推理

Annie Wong, Aske Plaat, Thomas Bäck, Niki van Stein, Anna V. Kononova

机构 * Leiden Institute of Advanced Computer Science(莱顿先进计算机科学研究所) Leiden University(莱顿大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大语言模型中状态表示设计对动态推理的影响,发现自然语言表示和空间编码对性能至关重要,但长期任务仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21190 2026-02-19 cs.CR 78%

The Trojan Example: Jailbreaking LLMs through Template Filling and Unsafety Reasoning

恶意示例:通过模板填充和不安全推理实现大语言模型的劫持

Mingrui Liu, Sixiao Zhang, Cheng Long, Kwok Yan Lam

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 TrojFill通过模板填充和不安全推理漏洞,实现对大语言模型的安全过滤绕过,展示了对齐LLM的系统性弱点。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 11 篇

2602.16671 2026-02-19 cs.SE cs.AI 88%

SPARC: Scenario Planning and Reasoning for Automated C Unit Test Generation

SPARC:面向自动化C单元测试生成的场景规划与推理

Jaid Monwar Chowdhury, Chi-An Fu, Reyhaneh Jabbarvand

机构 * Bangladesh University of Engineering and Technology(孟加拉工程科技大学) National Taiwan University(台湾国立大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划推理 :reasoning(title,abstract);planning(title);self-correction(abstract);分类 cs.AI

AI总结 SPARC通过神经符号方法和场景规划,提升C语言单元测试生成的覆盖率和代码质量,显著优于传统方法。

Comments 9 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07680 2026-02-19 cs.CV cs.AI cs.LG cs.RO 84%

Vision and Language: Novel Representations and Artificial intelligence for Driving Scene Safety Assessment and Autonomous Vehicle Planning

视觉与语言:新颖的表示方法和人工智能用于驾驶场景安全评估与自动驾驶规划

Ross Greer, Maitrayee Keskar, Angel Martinez-Sanchez, Parthib Roy, Shashank Shriram, Mohan Trivedi

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了视觉-语言表示在自动驾驶安全评估和规划中的应用,提出轻量级危险检测、轨迹规划框架整合及自然语言约束方法,强调表示-任务对齐的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08177 2026-02-19 cs.CV cs.AI 83%

MedReasoner: Reinforcement Learning Drives Reasoning Grounding from Clinical Thought to Pixel-Level Precision

MedReasoner: 通过强化学习实现从临床思维到像素级精度的推理 grounding

Zhonghao Yan, Muxi Diao, Yuxuan Yang, Ruoyan Jing, Jiayuan Xu, Kaizhou Zhang, Lele Yang, Yanxi Liu, Kongming Liang, Zhanyu Ma

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 MedReasoner 通过强化学习实现从临床推理到像素级精度的医学影像 grounding,提出统一医学推理 grounding 任务和 U-MRG-14K 数据集,展示其在医学影像分析中的优越性能。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24157 2026-02-19 cs.LG cs.AI 81%

Experience-based Knowledge Correction for Robust Planning in Minecraft

基于经验的知识修正以实现Minecraft中的鲁棒规划

Seungjoon Lee, Suhwan Kim, Minhyeon Oh, Youngsik Yoon, Jungseul Ok

机构 * Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系) Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 XENON通过经验修正知识,提升Minecraft中的鲁棒规划能力,优于现有方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10992 2026-02-19 cs.LG cs.NI 79%

ReaCritic: Reasoning Transformer-based DRL Critic-model Scaling For Wireless Networks

ReaCritic: 基于推理的变压器DRL批评模型扩展用于无线网络

Feiran You, Hongyang Du

机构 * Department of Electrical and Electronic Engineering, University of Hong Kong(香港大学电子与电气工程系)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 ReaCritic通过引入基于推理的变压器结构,提升DRL在无线网络中的适应性和性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10999 2026-02-19 cs.HC cs.AI 79%

Cocoa: Co-Planning and Co-Execution with AI Agents

Cocoa:基于AI代理的协同规划与协同执行

K. J. Kevin Feng, Kevin Pu, Matt Latzke, Tal August, Pao Siangliulue, Jonathan Bragg, Daniel S. Weld, Amy X. Zhang, Joseph Chee Chang

机构 * University of Washington(华盛顿大学) University of Toronto(多伦多大学) Allen Institute for AI(人工智能研究院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 Cocoa通过协同规划与执行机制,提升人机协作灵活性,支持复杂研究任务的自主可控与高效执行。

Comments CHI 2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01945 2026-02-19 cs.MA cs.CG 78%

Homotopy-Aware Multi-Agent Path Planning on Plane

平面中具有同伦意识的多智能体路径规划

Kazumi Kasaura

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出基于Dynnikov坐标的高效框架,用于平面中多智能体路径规划,通过结合优先规划生成多个同伦不同的解决方案,并验证其在避免局部最优解方面的有效性。

Comments 23 pages with 5 pages of references and appendices, 25 figures

Journal ref Journal of Artificial Intelligence Research 85, Article 15 (February 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16313 2026-02-19 cs.CL 70%

MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks

MemoryArena:评估多会话代理任务中的代理记忆

Zexue He, Yu Wang, Churan Zhi, Yuanzhe Hu, Tzu-Ping Chen, Lang Yin, Ze Chen, Tong Arthur Wu, Siru Ouyang, Zihan Wang, Jiaxin Pei, Julian McAuley, Yejin Choi, Alex Pentland

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学) University of Pittsburgh(匹兹堡大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 MemoryArena是一个用于评估多会话代理任务中代理记忆的统一评估环境,揭示了现有长上下文记忆基准在代理任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15870 2026-02-19 cs.CL 70%

VDLM: Variable Diffusion LMs via Robust Latent-to-Text Rendering

VDLM: 通过鲁棒的潜在到文本渲染实现变量扩散语言模型

Shuhui Qu

机构 * Stanford University(斯坦福大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 VDLM通过分离语义规划与文本渲染,利用嵌入空间后训练和鲁棒解码技术,在扩散语言模型中实现更高效的多步推理和长形式生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18825 2026-02-19 cs.AI cs.CL cs.GT 62%

EconEvals: Benchmarks and Litmus Tests for Economic Decision-Making by LLM Agents

EconEvals: 用于LLM代理经济决策的基准测试和litmus测试

Sara Fish, Julia Shephard, Minkai Li, Ran I. Shorrer, Yannai A. Gonczarowski

机构 * Harvard University(哈佛大学) Penn State University(宾夕法尼亚州立大学)

专题命中 规划推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 EconEvals提出了一种用于评估LLM经济决策能力的基准测试和litmus测试框架,通过多个冲突目标任务量化LLM的权衡响应和可靠性,为经济决策中的LLM评估提供了新方法。

Comments v3 was a major revision with updated experiments and analysis; v4 consists of minor edits

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16106 2026-02-19 cs.SE 50%

Algorithm-Based Pipeline for Reliable and Intent-Preserving Code Translation with LLMs

基于算法的可靠且意图保留的代码翻译管道

Shahriar Rumi Dipto, Saikat Mondal, Chanchal K. Roy

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种基于算法的代码翻译管道,通过引入语言中立的中间规范提升翻译准确性和可靠性,实验结果显示其在多个指标上均优于直接翻译方法。

Comments Accepted at 34th IEEE/ACM International Conference on Program Comprehension (ICPC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 5 篇

2602.13912 2026-02-19 cs.AI cs.CL cs.GR 81%

From Pixels to Policies: Reinforcing Spatial Reasoning in Language Models for Content-Aware Layout Design

从像素到政策:为内容感知布局设计增强语言模型的空间推理能力

Sha Li, Stefano Petrangeli, Yu Shen, Xiang Chen

机构 * Virginia Tech(弗吉尼亚理工学院) Adobe Research(Adobe研究)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 LaySPA通过强化学习框架增强语言模型的空间推理能力,实现内容感知布局设计,提升布局结构有效性与视觉质量,同时减少标注样本需求和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15918 2026-02-19 cs.CV cs.AI 79%

EarthSpatialBench: Benchmarking Spatial Reasoning Capabilities of Multimodal LLMs on Earth Imagery

EarthSpatialBench: 多模态大语言模型在地球影像上空间推理能力的基准测试

Zelin Xu, Yupu Zhang, Saugat Adhikari, Saiful Islam, Tingsong Xiao, Zibo Liu, Shigang Chen, Da Yan, Zhe Jiang

机构 * University of Florida(佛罗里达大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 EarthSpatialBench是一个用于评估多模态大语言模型在地球影像上空间推理能力的综合基准测试,涵盖空间距离、方向、拓扑关系及复杂几何查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15864 2026-02-19 cs.RO cs.CV 78%

ReasonNavi: Human-Inspired Global Map Reasoning for Zero-Shot Embodied Navigation

ReasonNavi: 人类启发的全局地图推理用于零样本具身导航

Yuzhuo Ao, Anbang Wang, Yu-Wing Tai, Chi-Keung Tang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Dartmouth College(达特茅斯学院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 ReasonNavi通过结合多模态大语言模型与确定性规划器,实现人类启发的全局地图推理,提供无需微调的零样本具身导航解决方案。

Comments 18 pages, 6 figures, Project page: https://reasonnavi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16537 2026-02-19 cs.CV cs.AI cs.CL cs.RO 62%

RoboSpatial: Teaching Spatial Understanding to 2D and 3D Vision-Language Models for Robotics

RoboSpatial: 教授机器人2D和3D视觉-语言模型空间理解能力

Chan Hee Song, Valts Blukis, Jonathan Tremblay, Stephen Tyree, Yu Su, Stan Birchfield

机构 * The Ohio State University(俄亥俄州立大学) NVIDIA(英伟达)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 RoboSpatial通过构建大规模空间理解数据集,提升机器人2D和3D视觉-语言模型的空间推理能力。

Comments CVPR 2025 (Oral); Project Website: https://chanh.ee/RoboSpatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16105 2026-02-19 cs.AI 57%

GPSBench: Do Large Language Models Understand GPS Coordinates?

GPSBench: 大型语言模型是否理解GPS坐标?

Thinh Hung Truong, Jey Han Lau, Jianzhong Qi

机构 * University of Melbourne(墨尔本大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 GPSBench通过评估14种LLMs在地理空间推理中的表现,揭示了其在GPS坐标理解和现实地理推理上的挑战与差异。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 3 篇

2602.16702 2026-02-19 cs.CV 82%

Saliency-Aware Multi-Route Thinking: Revisiting Vision-Language Reasoning

具有显著性意识的多路由思考:重新审视视觉-语言推理

Mingjia Shi, Yinhan He, Yaochen Zhu, Jundong Li

机构 * University of Virginia(弗吉尼亚大学)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract)

AI总结 本文提出Saliency-Aware Principle(SAP)方法,通过高层次推理原则提升视觉-语言推理的稳定性与效率,减少幻觉并提升响应速度。

Comments preprint 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12281 2026-02-19 cs.RO cs.AI cs.SY eess.SY 57%

Scaling Verification Can Be More Effective than Scaling Policy Learning for Vision-Language-Action Alignment

在视觉-语言-动作对齐中,验证比策略学习更具效率

Jacky Kwok, Xilun Zhang, Mengdi Xu, Yuejiang Liu, Azalia Mirhoseini, Chelsea Finn, Marco Pavone

机构 * Stanford University(斯坦福大学) NVIDIA Research(NVIDIA研究)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出CoVer-VLA验证方法,通过测试时验证在视觉-语言-动作对齐中实现22%的在分布和13%的分布外收益,同时在现实世界实验中进一步提升45%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10067 2026-02-19 cs.LG 57%

Features as Rewards: Scalable Supervision for Open-Ended Tasks via Interpretability

特征作为奖励:通过可解释性实现开放性任务的可扩展监督

Aaditya Vikram Prasad, Connor Watts, Jack Merullo, Dhruvil Gala, Owen Lewis, Thomas McGrath, Ekdeep Singh Lubana

专题命中 测试时计算 :test-time compute(abstract);分类 cs.LG

AI总结 本文提出通过特征作为奖励实现开放性任务的可扩展监督,利用强化学习流程减少幻觉并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏