arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11120 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11120 篇

2507.16874 2026-02-24 cs.MA cs.AI cs.RO 57%

Budget Allocation Policies for Real-Time Multi-Agent Path Finding

实时多智能体路径寻找中的预算分配策略

Raz Beck, Roni Stern

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种实时多智能体路径寻找中的预算分配策略,通过智能分配规划预算提升求解效率。

Comments 11 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18773 2026-02-24 cs.AI 57%

LAMMI-Pathology: A Tool-Centric Bottom-Up LVLM-Agent Framework for Molecularly Informed Medical Intelligence in Pathology

LAMMI-Pathology: 一种以工具为中心的自下而上LVLM-智能体框架用于分子信息引导的病理学智能

Haoyang Su, Shaoting Zhang, Xiaosong Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 LAMMI-Pathology提出了一种以工具为中心的自下而上智能体框架,通过分子信息引导的病理学智能提升病理图像分析的证据驱动能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07730 2026-02-24 cs.LG cs.RO 57%

Multistep Quasimetric Learning for Scalable Goal-conditioned Reinforcement Learning

多步准度量学习用于可扩展的目标导向强化学习

Bill Chunyuan Zheng, Vivek Myers, Benjamin Eysenbach, Sergey Levine

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出了一种基于多步准度量学习的离线目标导向强化学习方法,通过多步蒙特卡洛回报提升长视野任务的性能,并在现实世界机器人操作中实现了多步拼接。

Journal ref ICLR (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17734 2026-02-23 cs.SE cs.AI 57%

Five Fatal Assumptions: Why T-Shirt Sizing Systematically Fails for AI Projects

五项致命假设:为何T恤 sizing 系统性地失败于AI项目

Raja Soundaramourty, Ozkan Kilic, Ramu Chenchaiah

机构 * Cisco Systems, Inc.(思科系统公司)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文指出T恤 sizing在AI项目中失效的五项致命假设,并提出Checkpoint Sizing作为更人性化的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06500 2026-02-23 cs.AI cs.CY 57%

The AI Pyramid A Conceptual Framework for Workforce Capability in the Age of AI

人工智能金字塔:人工智能时代人力能力的概念框架

Alok Khatri, Bishesh Khanal

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出人工智能金字塔框架,旨在构建人类在AI时代的能力体系,强调能力形成应作为基础设施,通过问题导向学习和动态技能本体提升AI劳动力的适应性与竞争力。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10134 2026-02-23 cs.AI 57%

FRSICL: LLM-Enabled In-Context Learning Flight Resource Allocation for Fresh Data Collection in UAV-Assisted Wildfire Monitoring

FRSICL: 基于大语言模型的上下文学习飞行资源分配用于无人机辅助 wildfire 监测中的新鲜数据采集

Yousef Emami, Hao Zhou, Miguel Gutierrez Gaitan, Kai Li, Luis Almeida

机构 * Real-Time and Embedded Computing Systems Research Centre (CISTER)(实时嵌入式计算系统研究中心) Carnegie Mellon University(卡内基梅隆大学) Pontificia Universidad Católica de Chile(天主教智利大学) Instituto de Telecomunicações(电信研究院) Faculdade de Engenharia, Universidade do Porto(工程学院,葡萄牙里斯本大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的上下文学习飞行资源分配方法,用于无人机辅助森林火灾监测中的实时数据采集优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17345 2026-02-20 cs.CR cs.AI 57%

What Breaks Embodied AI Security:LLM Vulnerabilities, CPS Flaws,or Something Else?

使具身AI安全破裂的因素:大语言模型漏洞、CPS缺陷还是其他东西?

Boyang Ma, Hechuan Guo, Peizhuo Lv, Minghui Xu, Xuelong Dai, YeChao Zhang, Yijun Yang, Yue Zhang

机构 * Shandong University(山东大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了具身AI安全问题的根源,指出系统级不匹配而非孤立模型缺陷或传统CPS攻击是主要因素,并提出了四个核心见解以解释其安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17096 2026-02-20 cs.AI 57%

Agentic Wireless Communication for 6G: Intent-Aware and Continuously Evolving Physical-Layer Intelligence

面向6G的代理无线通信:意图感知与持续演化的物理层智能

Zhaoyang Li, Xingzhi Jin, Junyu Pan, Qianqian Yang, Zhiguo Shi

机构 * College of Information Science and Electronic Engineering, Zhejiang University(信息科学与电子工程学院,浙江大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于LLM的代理AI用于6G物理层,通过意图感知和持续演进实现自主通信决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00307 2026-02-20 cs.AI cs.DB cs.MA 57%

Autonomous Data Processing using Meta-Agents

使用元代理的自主数据处理

Udayan Khurana

机构 * IBM T.J. Watson Research Center(IBM T.J. Watson 研究中心)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 ADP-MA通过元代理实现自主数据处理,动态构建和优化数据管道,提升适应性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00167 2026-02-20 cs.AI cs.CR cs.RO 57%

Drones that Think on their Feet: Sudden Landing Decisions with Embodied AI

能自主决策的无人机:基于具身AI的突发着陆决策

Diego Ortiz Barbosa, Mohit Agrawal, Yash Malegaonkar, Luis Burbano, Axel Andersson, György Dán, Henrik Sandberg, Alvaro A. Cardenas

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究利用具身AI实现无人机在突发情况下的自主决策与安全着陆,展示了新的适应性恢复管道,提升了自主空中系统的安全性和韧性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15721 2026-02-18 cs.RO cs.AI 57%

Lifelong Scalable Multi-Agent Realistic Testbed and A Comprehensive Study on Design Choices in Lifelong AGV Fleet Management Systems

持续可扩展的多智能体真实测试床及对持续AGV车队管理系统设计选择的全面研究

Jingtian Yan, Yulun Zhang, Zhenting Liu, Han Zhang, He Jiang, Jingkai Chen, Stephen F. Smith, Jiaoyang Li

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出LSMART,一个开源模拟器,用于评估持续AGV车队管理系统的设计选择,并通过实验结果提供设计指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15072 2026-02-18 cs.CV cs.AI 57%

GRAFNet: Multiscale Retinal Processing via Guided Cortical Attention Feedback for Enhancing Medical Image Polyp Segmentation

GRAFNet:通过引导性皮层注意反馈进行多尺度视网膜处理以增强医学图像息肉分割

Abdul Joseph Fofanah, Lian Wen, Alpha Alimamy Kamara, Zhongyi Zhang, David Chen, Albert Patrick Sankoh

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 GRAFNet通过引导性皮层注意反馈模块提升医学图像息肉分割的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15039 2026-02-18 hep-ex cs.AI 57%

GRACE: an Agentic AI for Particle Physics Experiment Design and Simulation

GRACE:一个用于粒子物理实验设计和模拟的智能体

Justin Hill, Hong Joo Ryoo

机构 * Data Science Institute, Columbia Engineering(数据科学研究院,哥伦比亚工程学院) Department of Physics and Astronomy, Johns Hopkins University(物理与天文学系,约翰霍普金斯大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 GRACE是一个用于粒子物理实验设计和模拟的智能体,通过自主探索设计修改提升物理性能,引入了新的基准测试和约束搜索方法。

Comments Both authors contributed equally. 43 pages, 12 figures, 6 tables, data can be found in https://github.com/just5034/GRACE_whitepaper_data

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13209 2026-02-18 q-fin.GN cs.AI 57%

LemonadeBench: Evaluating the Economic Intuition of Large Language Models in Simple Markets

LemonadeBench:评估大语言模型在简单市场中的经济直觉

Aidan Vyas

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 LemonadeBench通过模拟柠檬摊业务评估大语言模型的经济直觉、长期规划和不确定性下的决策能力,揭示模型在局部优化上的表现与全局优化的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21654 2026-02-18 cs.AI 57%

ScholarGym: Benchmarking Large Language Model Capabilities in the Information-Gathering Stage of Deep Research

ScholarGym:在深度研究的信息收集阶段评估大语言模型能力

Hao Shen, Hang Yang, Zhouhong Gu, Weili Han

机构 * Fudan University(复旦大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 ScholarGym通过分解深度研究信息收集阶段,评估大语言模型在查询规划、工具调用和相关性评估中的能力差异,揭示开源与专有模型性能差距的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14721 2026-02-17 cs.AI 57%

WebWorld: A Large-Scale World Model for Web Agent Training

WebWorld: 一个大规模的世界模型用于网络代理训练

Zikai Xiao, Jianhong Tu, Chuhang Zou, Yuxin Zuo, Zhi Li, Peng Wang, Bowen Yu, Fei Huang, Junyang Lin, Zuozhu Liu

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 WebWorld是一个大规模开放网络模拟器,通过大规模训练实现网络代理的有效训练,展示了在多个领域中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14606 2026-02-17 cs.MA cs.AI cs.CE 57%

Towards Selection as Power: Bounding Decision Authority in Autonomous Agents

迈向选择作为权力:自主代理中决策权威的边界

Jose Manuel de la Chica Rodriguez, Juan Manuel Vera Díaz

机构 * AI Lab, Grupo Santander Madrid, Spain(AI实验室,西班牙 Grupo Santander 马德里)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种治理架构,通过机械机制限制自主代理的选择权,以防止确定性结果并提升可审计性,重新定义治理为受限制的因果权力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14225 2026-02-17 cs.AI 57%

Text Before Vision: Staged Knowledge Injection Matters for Agentic RLVR in Ultra-High-Resolution Remote Sensing Understanding

文本优先于视觉:针对超高清遥感理解的代理强化学习在超高清遥感理解中的知识注入至关重要

Fengxiang Wang, Mingshuo Chen, Yueying Li, Yajie Yang, Yuhao Zhou, Di Wang, Yifan Zhang, Haoyu Wang, Haiyan Zhao, Hongda Sun, Long Lan, Jun Song, Yulin Wang, Jing Zhang, Wenlong Zhang, Bo Du

机构 * National University of Defense Technology, China(国防科技大学) Beijing University of Posts and Telecommunications, China(北京邮电大学) University of the Chinese Academy of Sciences, China(中国科学院大学) Sichuan University, China(四川大学) Wuhan University, China(武汉大学) Chinese Academy of Science, China(中国科学院) Tsinghua University, China(清华大学) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室) Renmin University of China, China(中国人民大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出分阶段知识注入方法,利用文本引导提升超高清遥感理解的视觉推理能力,实现XLRS-Bench上的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13802 2026-02-17 cs.LG 57%

Cast-R1: Learning Tool-Augmented Sequential Decision Policies for Time Series Forecasting

Cast-R1:学习工具增强的序列决策策略用于时间序列预测

Xiaoyu Tao, Mingyue Cheng, Chuang Jiang, Tian Gao, Huanjian Zhang, Yaguo Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 Cast-R1通过工具增强的代理工作流程,学习序列决策策略以提升时间序列预测的准确性与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05354 2026-02-17 cs.AI 57%

PATHWAYS: Evaluating Investigation and Context Discovery in AI Web Agents

PATHWAYS:评估人工智能网络代理中的调查与上下文发现

Shifat E. Arman, Syed Nazmus Sakib, Tapodhir Karmakar Taton, Nafiul Haque, Shahrear Bin Amin

机构 * Robotics and Mechatronics Engineering, University of Dhaka, Dhaka, Bangladesh(机器人与机电工程系,达卡大学,达卡,孟加拉国)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 PATHWAYS评估了人工智能网络代理在多步骤任务中发现和利用隐藏上下文的能力,揭示了当前架构在适应性调查和判断覆盖方面的不足。

Comments 35 pages, 13 figures

Journal ref Under Review in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22391 2026-02-17 cs.CV cs.AI 57%

Top-Down Semantic Refinement for Image Captioning

自上而下语义细化用于图像描述生成

Jusheng Zhang, Kaitong Cai, Jing Yang, Jian Wang, Chengpei Tang, Keze Wang

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 自上而下语义细化通过高效MCTS算法提升图像描述生成的性能与质量

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16730 2026-02-17 cs.CR cs.AI 57%

RapidPen: Fully Automated IP-to-Shell Penetration Testing with LLM-based Agents

RapidPen: 基于大语言模型的完全自动化IP到Shell渗透测试框架

Sho Nakatani

机构 * SecDevLab Inc(SecDevLab公司)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 RapidPen基于大语言模型实现完全自动化IP到Shell渗透测试,通过任务规划与反馈循环高效发现并利用漏洞,降低安全测试成本与门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11047 2026-02-17 cs.RO cs.AI 57%

Enhancing Supermarket Robot Interaction: A Multi-Level LLM Conversational Interface for Handling Diverse Customer Intents

增强超市机器人交互:一种多层级LLM对话接口用于处理多样化客户意图

Chandran Nandkumar, Luka Peternel

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出多层级LLM接口提升超市机器人处理多样化客户意图的效率与性能。

Journal ref Frontiers in Robotics and AI, Volume 12, 1576348, April 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13568 2026-02-17 cs.AI 57%

Who Do LLMs Trust? Human Experts Matter More Than Other LLMs

LLMs信任谁?人类专家比其他LLMs更重要

Anooshka Bajaj, Zoran Tiganj

机构 * Department of Computer Science, Indiana University Bloomington(计算机科学系,印第安纳大学布卢明顿分校) Department of Psychological and Brain Science, Indiana University Bloomington(心理学与脑科学系,印第安纳大学布卢明顿分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究LLMs在面对人类专家与其他LLMs反馈时的可信度影响,发现LLMs更倾向于信任人类专家的反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13312 2026-02-17 cs.MA cs.AI 57%

PeroMAS: A Multi-agent System of Perovskite Material Discovery

PeroMAS:钙钛矿材料发现的多智能体系统

Yishu Wang, Wei Liu, Yifan Li, Shengxiang Xu, Xujie Yuan, Ran Li, Yuyu Luo, Jia Zhu, Shimin Di, Min-Ling Zhang, Guixiang Li

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院) School of Materials Science and Engineering, Southeast University, Nanjing, China(东南大学材料科学与工程学院) School of Artificial Intelligence, Sun Yat-Sen University, Zhuhai, China(中山大学人工智能学院) Information Hub, Hong Kong University of Science and Technology (Guangzhou), Guangzhou, China(香港科技大学(广州)信息中心) School of Computer Science and Engineering, Zhejiang Normal University, Jinhua, China(浙江师范大学计算机科学与工程学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 PeroMAS通过多智能体系统实现钙钛矿材料的多目标优化发现,提升材料发现效率并验证其在现实中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13273 2026-02-17 cs.DB cs.AI cs.DC 57%

MergePipe: A Budget-Aware Parameter Management System for Scalable LLM Merging

MergePipe: 一种面向可扩展大语言模型融合的预算感知参数管理系统

Yuanyi Wang, Yanggan Gu, Zihao Wang, Kunxi Li, Yifan Yang, Zhaoyi Yan, Congkai Xie, Jianmin Wu, Hongxia Yang

机构 * Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 MergePipe通过预算感知的参数管理实现高效的大语言模型融合,减少I/O并提升整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01848 2026-02-17 cs.AI cs.MA 57%

ROMA: Recursive Open Meta-Agent Framework for Long-Horizon Multi-Agent Systems

ROMA:递归开放元代理框架用于长周期多代理系统

Salaheddin Alzu'bi, Baran Nama, Arda Kaz, Anushri Eswaran, Weiyuan Chen, Sarvesh Khetan, Rishab Bala, Tu Vu, Sewoong Oh

机构 * Sentient Virginia Tech(弗吉尼亚理工大学) UC Berkeley(加州大学伯克利分校) UC San Diego(加州大学圣地亚哥分校) University of Maryland(马里兰大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 ROMA通过递归任务分解和结构化聚合,实现长周期多代理系统的高效推理和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12520 2026-02-16 cs.LG cs.MA 57%

Multi-Agent Model-Based Reinforcement Learning with Joint State-Action Learned Embeddings

基于联合状态-动作学习嵌入的多智能体模型驱动强化学习

Zhizun Wang, David Meger

机构 * McGill University(麦吉尔大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出了一种基于联合状态-动作学习嵌入的多智能体模型驱动强化学习框架,通过统一表示学习与想象式回放,提升智能体在动态环境中协调能力与长期规划效率。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12500 2026-02-16 cs.SE cs.AI cs.CR 57%

Favia: Forensic Agent for Vulnerability-fix Identification and Analysis

Favia:漏洞修复识别与分析的取证代理

André Storhaug, Jiamou Sun, Jingyue Li

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 Favia通过结合可扩展的候选排名与深入语义推理,有效识别漏洞修复,优于传统和LLM基方法。

Comments 44 pages, 12 figures, 5 tables, 3 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16348 2026-02-16 cs.CL 57%

Embodied Agents Meet Personalization: Investigating Challenges and Solutions Through the Lens of Memory Utilization

具身智能体与个性化:通过记忆利用的视角探讨挑战与解决方案

Taeyoon Kwon, Dongwook Choi, Hyojun Kim, Sunghwan Kim, Seungjun Moon, Beong-woo Kwak, Kuan-Hao Huang, Jinyoung Yeo

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Department of Computer Science and Engineering, Texas A&M University(计算机科学与工程系,德克萨斯大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文提出MEMENTO框架,通过分析记忆利用中的挑战,设计了基于层次知识图谱的用户档案记忆模块,提升智能体在个性化任务中的表现。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏