arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-26 至 2026-02-26 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 17 篇

2602.21952 2026-02-26 cs.CV 87%

MindDriver: Introducing Progressive Multimodal Reasoning for Autonomous Driving

MindDriver: 引入渐进多模态推理用于自动驾驶

Lingjun Zhang, Yujian Yuan, Changjie Wu, Xinyuan Chang, Xin Cai, Shuang Zeng, Linzhe Shi, Sijin Wang, Hang Zhang, Mu Xu

机构 * Amap, Alibaba Group(阿里集团蚂巴公司) The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学) Xi’an Jiaotong University(西安交通大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 MindDriver通过渐进多模态推理框架提升自动驾驶系统的推理能力,实现语义到物理空间的转化与轨迹规划,展现优异的性能表现。

Comments CVPR2026; Yujian Yuan and Lingjun Zhang contributed equally with random order

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22072 2026-02-26 cs.CL cs.AI 86%

Understanding Artificial Theory of Mind: Perturbed Tasks and Reasoning in Large Language Models

理解人工智能理论 of mind:受扰任务和大语言模型中的推理

Christian Nickel, Laura Schrewe, Florian Mai, Lucie Flek

机构 * Bonn-Aachen International Center for Information Technology (b-it)(波恩-埃森国际信息科技中心) University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) Research Center Trustworthy Data Science and Security (RC-Trust)(可信数据科学与安全研究中心) University of Duisburg-Essen(埃森-杜伊斯堡大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过扰动任务和链式推理提示探讨大语言模型的理论 of mind能力,发现其鲁棒性受扰动影响显著,CoT提示虽提升整体表现,但对某些扰动类别却降低准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21533 2026-02-26 cond-mat.mtrl-sci cs.LG 79%

Reasoning-Driven Design of Single Atom Catalysts via a Multi-Agent Large Language Model Framework

通过多智能体大语言模型框架进行基于推理的单原子催化剂设计

Dong Hyeon Mok, Seoin Back, Victor Fung, Guoxiang Hu

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出一种多智能体大语言模型框架,用于基于推理的单原子催化剂设计,通过迭代推理和上下文学习发现高性能催化剂并突破传统缩放关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21595 2026-02-26 cs.RO 78%

SPOC: Safety-Aware Planning Under Partial Observability And Physical Constraints

SPOC:在部分可观测性和物理约束下安全意识的规划

Hyungmin Kim, Hobeom Jeon, Dohyung Kim, Minsu Jang, Jeahong Kim

机构 * 1 ETRI School, University of Science Technology, South Korean 2 Social Robotics Laboratory, Electronics

专题命中 规划推理 :planning(title,abstract)

AI总结 SPOC是一个用于评估安全意识具身任务规划的基准测试,通过整合部分可观测性、物理约束和逐步规划,解决现实环境中安全与可行性评估的问题。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10855 2026-02-26 eess.IV cs.CV 78%

Transformer-based cardiac substructure segmentation from contrast and non-contrast computed tomography for radiotherapy planning

基于变换器的心脏亚结构从对比和非对比计算机断层扫描进行放疗规划

Aneesh Rangnekar, Nikhil Mankuzhy, Jonas Willmann, Chloe Min Seo Choi, Abraham Wu, Maria Thor, Andreas Rimner, Harini Veeraraghavan

专题命中 规划推理 :planning(title,abstract)

AI总结 本研究提出基于变换器的SMIT模型,通过平衡课程学习实现高效训练,准确分割心脏亚结构,提升放疗规划的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21447 2026-02-26 cs.CR cs.AI cs.CL cs.LG 75%

Adversarial Intent is a Latent Variable: Stateful Trust Inference for Securing Multimodal Agentic RAG

对抗意图是潜在变量:用于安全多模态代理RAG的状态信任推断

Inderjeet Singh, Vikas Pahuja, Aishvariya Priya Rathina Sabapathy, Chiara Picardi, Amit Giloni, Roman Vainshtein, Andrés Murillo, Hisashi Kojima, Motoyoshi Sekiya, Yuki Unno, Junichi Suga

机构 * Fujitsu Research of Europe, UK(富士通欧洲研究机构,英国) Fujitsu Limited, Japan(富士通株式会社,日本)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MMA-RAG^T框架,通过状态化信任推断提升多模态代理RAG的安全性,实验显示攻击成功率显著降低。

Comments 13 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19439 2026-02-26 cs.AI cs.LG math.OC 73%

OptiRepair: Closed-Loop Diagnosis and Repair of Supply Chain Optimization Models with LLM Agents

OptiRepair:基于LLM代理的闭环供应链优化模型诊断与修复

Ruicheng Ao, David Simchi-Levi, Xinshang Wang

机构 * Massachusetts Institute of Technology(麻省理工学院) Alibaba Group(阿里巴巴集团)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 OptiRepair通过训练LLM代理实现供应链优化模型的闭环诊断与修复,显著提升修复效率和合理性,解决求解器交互和运营合理性两大难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21604 2026-02-26 cs.DB 67%

Towards Autonomous Graph Data Analytics with Analytics-Augmented Generation

迈向具有分析增强生成的自主图数据分析

Qiange Wang, Chaoyi Chen, Jingqi Gao, Zihan Wang, Yanfeng Zhang, Ge Yu

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出分析增强生成(AAG)范式,通过知识驱动的任务规划和算法中心的LLM-分析交互,实现端到端的图分析流水线,将自然语言意图转化为自动执行和可解释结果。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21231 2026-02-26 cs.LG cs.AI cs.CL 67%

ACAR: Adaptive Complexity Routing for Multi-Model Ensembles with Auditable Decision Traces

ACAR:适应复杂度的多模型集合路由

Ramchand Kumaresan

机构 * Ramchand Kumaresan(独立研究者)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ACAR是一种用于多模型集合的可审计路由框架,通过自一致性方差实现任务路由,提升准确率并避免过度融合,同时揭示归因计算的挑战。

Comments 12 pages, 9 figures. Measurement framework for adaptive multi-model routing with auditable execution traces

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21997 2026-02-26 cs.SE cs.AI cs.LG 62%

Enhancing LLM-Based Test Generation by Eliminating Covered Code

通过消除已覆盖代码增强基于LLM的测试生成

WeiZhe Xu, Mengyu Liu, Fanxin Kong

机构 * University of Notre Dame(诺丁汉大学) Washington State University(华盛顿州立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于LLM的单元测试生成方法,通过上下文检索和迭代测试生成与代码消除,提升复杂方法的测试覆盖率。

Comments 9 pages, 4 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10953 2026-02-26 cs.CL cs.AI 62%

Search or Accelerate: Confidence-Switched Position Beam Search for Diffusion Language Models

搜索或加速:基于置信度切换的位置束搜索用于扩散语言模型

Mingyu Cao, Alvaro H. C. Correia, Christos Louizos, Shiwei Liu, Lu Yin

机构 * University of Surrey(塞拉利昂大学) Qualcomm AI Research. Qualcomm AI Research is an initiative of Qualcomm Technologies, Inc.(高通人工智能研究) ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SOAR通过置信度切换机制优化扩散语言模型的解码过程,提高生成质量并保持推理效率。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18060 2026-02-26 cs.LG cs.AI cs.RO 62%

SPACeR: Self-Play Anchoring with Centralized Reference Models

SPACeR:基于集中参考模型的自我对战锚定

Wei-Jer Chang, Akshay Rangesh, Kevin Joseph, Matthew Strong, Masayoshi Tomizuka, Yihan Hu, Wei Zhan

机构 * Applied Intuition University of California, Berkeley(加州大学伯克利分校) New York University(纽约大学) Stanford University(斯坦福大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 SPACeR通过集中参考模型指导自我对战,实现高效、可扩展的自动驾驶策略生成。

Comments Accepted at ICLR 2026. Project page: https://spacer-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20292 2026-02-26 cs.SE cs.AI 57%

Quantifying the Expectation-Realisation Gap for Agentic AI Systems

量化代理AI系统的期望-现实差距

Sebastian Lobentanzer

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文量化了代理AI系统在实际应用中与预期之间的差距,揭示了工作流整合、验证负担和测量不匹配等因素的影响,并提出需考虑人类监督成本的规划框架。

Comments 10 pages, no figures; added glossary

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21633 2026-02-26 cs.RO cs.AI cs.CV 57%

Self-Correcting VLA: Online Action Refinement via Sparse World Imagination

自校正视觉-语言-动作模型:通过稀疏世界想象实现在线动作细化

Chenyv Liu, Wentao Tan, Lei Zhu, Fengling Li, Jingjing Li, Guoli Yang, Heng Tao Shen

机构 * Tongji University(同济大学) University of Technology Sydney(技术悉尼大学) University of Electronic Science(电子科学大学) Advanced Institute of Big Data(大数据高级研究所)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 SC-VLA通过稀疏世界想象实现自校正,提升机器人操作任务的效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21588 2026-02-26 cs.LG cs.CE 57%

ABM-UDE: Developing Surrogates for Epidemic Agent-Based Models via Scientific Machine Learning

ABM-UDE:通过科学机器学习开发用于流行病代理模型的替代方案

Sharv Murgai, Utkarsh Utkarsh, Kyle C. Nguyen, Alan Edelman, Erin C. S. Acquesta, Christopher Vincent Rackauckas

机构 * Monta Vista High School(蒙塔维斯塔高中) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Sandia National Laboratories(桑塔纳国家实验室)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 ABM-UDE通过科学机器学习开发流行病代理模型的替代方案,利用UDEs学习接触率参数化,提升预测精度与可靠性,实现快速、可解释的流行病模拟。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14537 2026-02-26 cs.HC cs.AI 57%

ClearFairy: Capturing Creative Workflows through Decision Structuring, In-Situ Questioning, and Rationale Inference

ClearFairy:通过决策结构化、现场提问和推理推断捕捉创意工作流

Kihoon Son, DaEun Choi, Tae Soo Kim, Young-Ho Kim, Sangdoo Yun, Juho Kim

机构 * School of Computing, KAIST(韩国科学技术院计算机科学系) NAVER AI Lab(NAVER人工智能实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 ClearFairy通过结构化决策、现场提问和推理推断,提升UI设计中决策推理的完整性和可追溯性,显著提高强解释比例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21512 2026-02-26 cs.NE 50%

Assessing an evolutionary search engine for small language models, prompts, and evaluation metrics

评估一种用于小型语言模型、提示和评估指标的进化搜索引擎

Cláudio Lúcio do Val Lopes, Lucca Machado

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出一种双目标进化搜索引擎,用于优化小型语言模型、提示和评估指标之间的性能与效率平衡。

Comments 14 pages, 1 figure, 1 table

Journal ref Intelligent Systems. BRACIS 2025. Lecture Notes in Computer Science

详情

展开后加载摘要…

URL PDF HTML 收藏