arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-19 至 2026-02-19 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11 篇

2602.16671 2026-02-19 cs.SE cs.AI 88%

SPARC: Scenario Planning and Reasoning for Automated C Unit Test Generation

SPARC:面向自动化C单元测试生成的场景规划与推理

Jaid Monwar Chowdhury, Chi-An Fu, Reyhaneh Jabbarvand

机构 * Bangladesh University of Engineering and Technology(孟加拉工程科技大学) National Taiwan University(台湾国立大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划推理 :reasoning(title,abstract);planning(title);self-correction(abstract);分类 cs.AI

AI总结 SPARC通过神经符号方法和场景规划,提升C语言单元测试生成的覆盖率和代码质量,显著优于传统方法。

Comments 9 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07680 2026-02-19 cs.CV cs.AI cs.LG cs.RO 84%

Vision and Language: Novel Representations and Artificial intelligence for Driving Scene Safety Assessment and Autonomous Vehicle Planning

视觉与语言:新颖的表示方法和人工智能用于驾驶场景安全评估与自动驾驶规划

Ross Greer, Maitrayee Keskar, Angel Martinez-Sanchez, Parthib Roy, Shashank Shriram, Mohan Trivedi

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了视觉-语言表示在自动驾驶安全评估和规划中的应用,提出轻量级危险检测、轨迹规划框架整合及自然语言约束方法,强调表示-任务对齐的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08177 2026-02-19 cs.CV cs.AI 83%

MedReasoner: Reinforcement Learning Drives Reasoning Grounding from Clinical Thought to Pixel-Level Precision

MedReasoner: 通过强化学习实现从临床思维到像素级精度的推理 grounding

Zhonghao Yan, Muxi Diao, Yuxuan Yang, Ruoyan Jing, Jiayuan Xu, Kaizhou Zhang, Lele Yang, Yanxi Liu, Kongming Liang, Zhanyu Ma

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 MedReasoner 通过强化学习实现从临床推理到像素级精度的医学影像 grounding,提出统一医学推理 grounding 任务和 U-MRG-14K 数据集,展示其在医学影像分析中的优越性能。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24157 2026-02-19 cs.LG cs.AI 81%

Experience-based Knowledge Correction for Robust Planning in Minecraft

基于经验的知识修正以实现Minecraft中的鲁棒规划

Seungjoon Lee, Suhwan Kim, Minhyeon Oh, Youngsik Yoon, Jungseul Ok

机构 * Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系) Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 XENON通过经验修正知识,提升Minecraft中的鲁棒规划能力,优于现有方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10992 2026-02-19 cs.LG cs.NI 79%

ReaCritic: Reasoning Transformer-based DRL Critic-model Scaling For Wireless Networks

ReaCritic: 基于推理的变压器DRL批评模型扩展用于无线网络

Feiran You, Hongyang Du

机构 * Department of Electrical and Electronic Engineering, University of Hong Kong(香港大学电子与电气工程系)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 ReaCritic通过引入基于推理的变压器结构,提升DRL在无线网络中的适应性和性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10999 2026-02-19 cs.HC cs.AI 79%

Cocoa: Co-Planning and Co-Execution with AI Agents

Cocoa:基于AI代理的协同规划与协同执行

K. J. Kevin Feng, Kevin Pu, Matt Latzke, Tal August, Pao Siangliulue, Jonathan Bragg, Daniel S. Weld, Amy X. Zhang, Joseph Chee Chang

机构 * University of Washington(华盛顿大学) University of Toronto(多伦多大学) Allen Institute for AI(人工智能研究院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 Cocoa通过协同规划与执行机制,提升人机协作灵活性,支持复杂研究任务的自主可控与高效执行。

Comments CHI 2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01945 2026-02-19 cs.MA cs.CG 78%

Homotopy-Aware Multi-Agent Path Planning on Plane

平面中具有同伦意识的多智能体路径规划

Kazumi Kasaura

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出基于Dynnikov坐标的高效框架,用于平面中多智能体路径规划,通过结合优先规划生成多个同伦不同的解决方案,并验证其在避免局部最优解方面的有效性。

Comments 23 pages with 5 pages of references and appendices, 25 figures

Journal ref Journal of Artificial Intelligence Research 85, Article 15 (February 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16313 2026-02-19 cs.CL 70%

MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks

MemoryArena:评估多会话代理任务中的代理记忆

Zexue He, Yu Wang, Churan Zhi, Yuanzhe Hu, Tzu-Ping Chen, Lang Yin, Ze Chen, Tong Arthur Wu, Siru Ouyang, Zihan Wang, Jiaxin Pei, Julian McAuley, Yejin Choi, Alex Pentland

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学) University of Pittsburgh(匹兹堡大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 MemoryArena是一个用于评估多会话代理任务中代理记忆的统一评估环境,揭示了现有长上下文记忆基准在代理任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15870 2026-02-19 cs.CL 70%

VDLM: Variable Diffusion LMs via Robust Latent-to-Text Rendering

VDLM: 通过鲁棒的潜在到文本渲染实现变量扩散语言模型

Shuhui Qu

机构 * Stanford University(斯坦福大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 VDLM通过分离语义规划与文本渲染,利用嵌入空间后训练和鲁棒解码技术,在扩散语言模型中实现更高效的多步推理和长形式生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18825 2026-02-19 cs.AI cs.CL cs.GT 62%

EconEvals: Benchmarks and Litmus Tests for Economic Decision-Making by LLM Agents

EconEvals: 用于LLM代理经济决策的基准测试和litmus测试

Sara Fish, Julia Shephard, Minkai Li, Ran I. Shorrer, Yannai A. Gonczarowski

机构 * Harvard University(哈佛大学) Penn State University(宾夕法尼亚州立大学)

专题命中 规划推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 EconEvals提出了一种用于评估LLM经济决策能力的基准测试和litmus测试框架,通过多个冲突目标任务量化LLM的权衡响应和可靠性,为经济决策中的LLM评估提供了新方法。

Comments v3 was a major revision with updated experiments and analysis; v4 consists of minor edits

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16106 2026-02-19 cs.SE 50%

Algorithm-Based Pipeline for Reliable and Intent-Preserving Code Translation with LLMs

基于算法的可靠且意图保留的代码翻译管道

Shahriar Rumi Dipto, Saikat Mondal, Chanchal K. Roy

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种基于算法的代码翻译管道,通过引入语言中立的中间规范提升翻译准确性和可靠性,实验结果显示其在多个指标上均优于直接翻译方法。

Comments Accepted at 34th IEEE/ACM International Conference on Program Comprehension (ICPC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏