arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11076 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11076 篇

2608.14312 2026-08-17 cs.CL 新提交 70%

Envs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL

Envs-FORGE:面向智能体强化学习的前沿优化、奖励驱动的环境合成方法

Xiaojun Wu, Cehao Yang, Honghao Liu, Xueyuan Lin, Zhichao Shi, Hao Zhou, Xuhui Jiang, Chengjin Xu, Jia Li, Jian Guo

机构 * IDEA Research(IDEA研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DataArcTech Ltd.(DataArcTech有限公司)

专题命中 规划推理 :planning(abstract);verifier(abstract);分类 cs.CL

AI总结 Envs-FORGE是面向智能体RL的奖励驱动环境合成方法,通过MILP选动作生成训练环境,在多模型及数据集上显著提升Pass@1等指标。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11753 2026-08-17 cs.CL 版本更新 70%

Agentic Aggregation for Parallel Scaling of Long-Horizon Agentic Tasks

代理聚合用于长周期代理任务的并行扩展

Yoonsang Lee, Howard Yen, Xi Ye, Danqi Chen

机构 * Princeton Language and Intelligence, Princeton University(普林斯顿大学语言与智能实验室)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出AggAgent,通过将并行轨迹视为环境,有效解决长周期代理任务中轨迹信息聚合问题,提升性能并降低开销。

Comments COLM 2026. Code is available at https://github.com/princeton-pli/AggAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13374 2026-08-13 cs.AI 版本更新 70%

Behavior and Representation in Open-Weight Large Language Models for Combinatorial Optimization: From Feature Extraction to Algorithm Selection

大语言模型在组合优化中的行为与表示:从特征提取到算法选择

Francesca Da Ros, Luca Di Gaspero, Kevin Roitero

机构 * University of Udine(乌迪大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本研究探讨了大语言模型在组合优化中的内部表示能力,通过直接查询和探测分析,评估其提取特征和预测最佳求解器的效果。

Comments Accepted for publication in Computers & Operations Research. Code and data are available on Zenodo: https://doi.org/10.5281/zenodo.21891840

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10714 2026-08-12 cs.NI cs.AI cs.DC cs.ET cs.MA 新提交 70%

Conversational Orchestration for Organic 6G

面向有机6G的对话式编排

Masoud Shokrnezhad, Tarik Taleb

专题命中 规划推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 针对有机6G跨域编排的开销与可部署性问题,提出基于LLM驱动域代理的轻量级去中心化对话式编排框架,仿真验证其控制开销可控且决策质量稳健。

Comments 7 pages, 6 figures. Accepted for publication in IEEE Network Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10530 2026-08-12 cs.CR cs.AI 新提交 70%

On Understanding, Identifying, and Mitigating Vulnerabilities in Agentic Large Language Models

关于智能体大语言模型漏洞的理解、识别与缓解

Md Jafrin Hossain, Mohammad Arif Hossain, Nirwan Ansari

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本研究针对智能体大语言模型安全开展系统文献综述,提出四层漏洞分类法,发现攻击研究多于防御研究、感知层漏洞研究占比偏高等现状,识别7个开放问题及架构耦合的核心不安全根源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24850 2026-08-12 cs.IR cs.LG 版本更新 70%

SearchArt: Training Long-Horizon Search Agent with Scalable Synthetic and Verified Task

SearchArt:使用可扩展的合成和经过验证的任务训练长视野搜索代理

Lang Mei, Xiaohan Yu, Chong Chen, Liyan Liu, Xiangnan Chen, Jinchao Ma, Chao Feng, Li Huang, Siyu Mo, Sichen Kang, Yunkun Xu, Zhihan Yang, Zhujun Xue, Jingren Zhang, Qing He, Yingdi Huang, Hao Jiang, Ziao Ma, Zewei Pan, Minhao Sun, Zhuo Tao, Jinzhao Xiao, Gangtao Xin, Huanyao Zhang, Wenjian Zhang, Jiangshan Zhang, Guojie Zhu, Fangzhou Zou, Jiaxin Mao, Wentao Zhang

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 针对训练长视野搜索代理的挑战,SearchArt提出通过验证驱动任务合成及多阶段训练管道的框架,构建大规模数据集并验证数据可靠性,经此训练的代理在多基准测试中表现出色,参数少却成绩优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07223 2026-08-11 cs.AI 版本更新 70%

Reflex First, Reflect Later: Latency-Aware Embodied LLM Agents for Dynamic Response

先反射,后反思:面向动态响应的延迟感知具身大语言模型智能体

Yangqing Zheng, Shunqi Mao, Dingxin Zhang, Weidong Cai

机构 * School of Computer Science, The University of Sydney(计算机科学学院,悉尼大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 该研究针对动态环境中具身LLM智能体的推理延迟问题,提出RRARA智能体及相关评估指标,通过时间转换机制与预规划器实现决策质量与响应能力的平衡。

Comments Accepted by the CVPR 2025 Embodied AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07148 2026-08-10 cs.AI 新提交 70%

A MARL Centered Reference Architecture for Large Language Model Augmentation in Smart Manufacturing

面向智能制造中大型语言模型增强的多智能体强化学习(MARL)中心参考架构

Fouad Bahrpeyma, Dirk Reichelt

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文针对智能制造自适应控制的耦合需求,提出以MARL为中心的三层参考架构,探讨LLM在MARL中的附着点,明确传统MARL与LLM组件的适配场景,为相关研究提供结构化框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06699 2026-08-10 cs.AI cs.CV 新提交 70%

AgentPatch: Coarse-to-Fine Weak-Task Repair for Merging Agentic Multimodal Large Language Models

AgentPatch:用于合并智能体多模态大语言模型的由粗到细弱任务修复

Zibo Shao, Baochen Xiong, Chengdong Xu, Linhui Xiao, Kaichen Li, Haoran Gong, Yan Li, Yaguang Song, Xiaoshan Yang

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 针对智能体多模态大语言模型合并时的弱任务退化与关键行为遗忘问题,提出无需训练的AgentPatch框架,通过由粗到细修复实现能力平衡,提升合并模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06474 2026-08-10 cs.AI 新提交 70%

WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader

WebGrader:利用自演化程序化评分器训练用于网页开发的大语言模型

Boshui Chen, Huiping Liu, Shaolei Zhang

专题命中 规划推理 :planning(abstract);verifier(abstract);分类 cs.AI

AI总结 本研究提出自演化程序化评分器WebGrader,通过分离测试规划等环节生成准确奖励,训练8B策略在WebGen-Bench、WG-core-250数据集上的功能成功率及得分优于多款大语言模型。

Comments 17 pages, 3 figures. Supplementary material is included in the main PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05792 2026-08-07 cs.AI 新提交 70%

When Agentic AI Meets Integrated Sensing and Communication

当智能体AI遇上集成感知与通信

Kai Li, Conggai Li, Sarah Ali Siddiqui, Syed Sohail Ahmed, Xin Yuan, Shenghong Li, Wei Ni

机构 * University of Luxembourg(卢森堡大学) CSIRO(联邦科学与工业研究组织) Qassim University(卡西姆大学) Edith Cowan University(伊迪丝·考恩大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本综述提出智能体AI与集成感知通信结合的AISAC范式,构建六阶段闭环框架与五成熟度等级,梳理相关领域进展,分析交叉需求,发现现有系统智能体成熟度不足,并指出多方面开放挑战。

Comments 35 pages, 132 references, 10 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05171 2026-08-07 cs.CY cs.AI 新提交 70%

Beyond Information Retrieval: Generative AI as an Epistemic Arbiter to Enhance Collaborative Problem-Solving

超越信息检索:生成式AI作为认知仲裁者以增强协作问题解决

Jiaxin Zou, Xiaoming Zhai, Chunlei Gao

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本研究通过201名五年级学生的六周准实验,探究生成式AI对协作问题解决的影响,发现其会改变学生行为模式,可作为认知仲裁者促进建设性分歧解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06227 2026-08-07 cs.NI cs.AI cs.IT cs.SY eess.SY math.IT 新提交 70%

From Passive Mirrors to Active Agents: Holonic Digital Twins for Physical AI over Networks

从被动镜像到主动智能体:面向网络物理AI的 holonic 数字孪生

Christo Kurisummoottil Thomas, Omar Hashash, Walid Saad

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文针对当前AI嵌入物理系统失效、无线网络架构无法支持实时物理AI协调的问题,提出HDT-Nets框架,通过holonic数字孪生实现实时物理AI推理,为网络物理AI提供新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22256 2026-08-07 cs.SE cs.AI 版本更新 70%

Agentic Software Issue Resolution with Large Language Models: A Survey

基于大语言模型的代理软件问题解决:综述

Zhonghao Jiang, David Lo, Zhongxin Liu

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡管理大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文综述了基于大语言模型的代理软件问题解决的最新研究,探讨了其方法、挑战及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04071 2026-08-06 cs.AI 新提交 70%

Monte Carlo Tree Search for Table-to-Multimodal Report Generation

面向表格到多模态报告生成的蒙特卡洛树搜索

Teng Lin, Zhiyang Zhang, Yuyu Luo, Nan Tang

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 针对表格到多模态报告生成的现有方法缺陷,本文提出基于MCTS的MCTS-Report框架,通过分解原子动作与多维奖励函数优化,在自建的MMRBench基准上取得优于基线的77.9总体得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03589 2026-08-06 cs.DB cs.LG 版本更新 70%

stratum: A System Infrastructure for Massive Agent-Centric ML Workloads

stratum: 一种支持大规模基于代理的机器学习工作负载的系统基础设施

Arnab Phani, Elias Strauss, Sebastian Schelter

机构 * BIFOLD & TU Berlin(BIFOLD与柏林技术大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 stratum是一种支持大规模基于代理的机器学习工作负载的系统基础设施,通过解耦流水线执行与规划推理,提升大规模代理流水线搜索效率。

Comments Accepted at PVLDB 2026 (Vol. 19, No. 11). Artifact available on GitHub

Journal ref Proc. VLDB Endow. 19(11): 3799-3806, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02595 2026-08-04 cs.LG 新提交 70%

onepot-Bench 0: towards lab-aware in silico chemistry benchmarks

onepot-Bench 0:面向实验室实际场景的计算机化学基准测试

Brandon Wang, Andrei S. Tyrin, Daniil A. Boiko

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本研究推出专有基准测试onepot-Bench 0,通过三个互补评估衡量语言模型在湿实验室合成化学场景下的基础能力、可靠性等,弥补现有评估的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02454 2026-08-04 cs.AI cs.FL cs.LO 新提交 70%

Infinite Trace Objectives with Finite Trace Techniques: Translating LTL to LTLf+

采用有限迹技术的无限迹目标:将LTL转换为LTLf+

Christoph Weinhuber, Maximilian Prokop, Giuseppe De Giacomo, Moshe Y. Vardi

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本研究提出首个从LTL到LTLf+的线性转换方法,将LTL归一化为Manna-Pnueli层次的反应片段,保留LTLf+的优势且无渐近代价,可将LTLf+技术应用于更多AI问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01456 2026-08-04 cs.CV cs.CL 新提交 70%

Long-Horizon Embodied Decision-Making via Multimodal Memory Compression

基于多模态记忆压缩的长视野具身决策

Bingxuan Li, Rui Yang, Cheng Qian, Jiateng Liu, Jeonghwan Kim, Zhenhailong Wang, Manling Li, Tong Zhang, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northwestern University(西北大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 该研究提出DunphyBench基准用于评估长视野具身决策,发现当前智能体与人类表现存在差距,设计了MeMento记忆压缩器,使VLM驱动智能体准确率提升7.18%且内存使用降低85.38%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00962 2026-08-04 cs.AI 新提交 70%

PMMC: Prospective Multimodal Memory Compilation for Long-Term LVLM Agents

PMMC:面向长期LVLM智能体的前瞻性多模态记忆编译

Jingyu Sun, Yan Lin, Yuyang Xue, Yifan Wang, Zhengtao Yao, Rui Qian, Zefeng Xu, Jiachen Li, Xianyang Liu, Jiancheng Pan, Jingyuan Sun, Syed Murtuza Baker, Hongpeng Zhou

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 针对现有LVLM智能体记忆系统的缺陷,提出PMMC框架,将部分记忆推理移至整合阶段,构建结构化问题库,提升答案质量与证据召回率,降低查询成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23590 2026-08-04 cs.AI 版本更新 70%

Co-ReAct: Rubrics as Step-Level Collaborators for ReAct Agents

Co-ReAct:作为ReAct智能体逐步协作者的评分准则

Jiazheng Kang, Bowen Zhang, Zixin Song, Jiangwang Chen, Xiao Yang, Da Zhu, Guanjun Jiang

机构 * Qwen Applications Business Group of Alibaba(阿里巴巴文勤应用业务组) Tsinghua University(清华大学)

专题命中 规划推理 :reasoning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 提出Co-ReAct框架,通过训练专用评分准则生成器,在推理时逐步指导ReAct智能体的行动选择,显著提升搜索密集型多步推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05110 2026-08-04 cs.CY cs.AI 版本更新 70%

ApplE: A Modular Ontology of Applied Ethics and Event Context for Ethical Decision Modeling

ApplE:用于伦理决策建模的应用伦理与事件上下文模块化本体

Aisha Aijaz, Raghava Mutharaju, Manohar Kumar

专题命中 规划推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 该研究提出模块化应用伦理本体ApplE,采用改进SAMOD构建,结合伦理理论与事件上下文,经医疗用例验证,遵循FAIR原则,可用于伦理AI系统等的建模资源。

Comments Accepted at ER2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28629 2026-08-03 cs.AI 新提交 70%

OpenClaw and Ollama in Agentic AI: Toward Fully Autonomous and Scalable AI Agent Systems

智能体AI中的OpenClaw与Ollama:迈向完全自主且可扩展的AI智能体系统

Konstantinos I. Roumeliotis, Ranjan Sapkota

机构 * University of the Peloponnese(伯罗奔尼撒大学) Cornell University(康奈尔大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 该研究提出智能体AI的分层架构,分析OpenClaw与Ollama组成的全栈系统,验证系统集成可提升智能体能力,指出相关挑战并提供路线图,所有资源公开以支持研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27599 2026-07-31 cs.AI cs.RO 新提交 70%

World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models

世界动作规划器:基于动作条件世界模型的通用决策方法

Xiangcheng Zhang, Yilun Du

机构 * Harvard University(哈佛大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本研究提出World Action Planner机器人规划系统,结合VLMs与多任务位姿图像条件世界模型,可迭代优化动作规划,在组合任务、新布局等场景中泛化性能优于VLAs、WAMs等端到端策略模型。

Comments Project page at worldactionplanner.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01427 2026-07-31 cs.AI 版本更新 70%

A Tale of LLMs and Induced Small Proxies: Scalable Small Language Models for Knowledge Mining

小型语言模型代理实现高效高质量的知识挖掘

Sipeng Zhang, Longfei Yun, Zilong Wang, Letian Peng, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Carneigie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出Falconer框架,结合大语言模型的代理推理与轻量级代理模型,通过规划与标注实现可扩展的知识挖掘,在保持指令遵循精度的同时降低90%推理成本并加速20倍以上。

Comments Code available: https://github.com/LongfeiYun17/falconer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24260 2026-07-28 cs.LG 新提交 70%

KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems

KAP:弥合大语言模型系统中知识选择与运行时消耗的差距

Shuo Wang, Fang Xi, Wenyuan Huang, Qing Wang, Junming Su

机构 * QiYuanLab(启元实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 研究大语言模型系统中知识选择与运行时消耗的差距,提出知识访问规划(KAP)范式,通过建立通用中间表示编译知识信号控制KV访问,以GraphSpec实例化,改变长上下文生成扩展轨迹,提升运行时消耗效率。

Comments 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23678 2026-07-28 cs.AI 新提交 70%

Focus Is All You Need: Adaptive Goal-aware Attention Orchestration for Multi-Agent Graph Systems

你所需要的只是专注:多智能体图系统的自适应目标感知注意力编排

Mingzhou Fan, Siyuan Xu, Mingxuan Yuan

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究多智能体图系统中注意力分配问题,提出自适应目标感知注意力编排框架AGAO,结合目标、拓扑、资源感知注意力,将静态图转变为自适应系统,经实验验证其能提高任务有效性并减少计算等消耗,确立注意力工程方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23045 2026-07-28 cs.AI cs.RO 新提交 70%

Stress-testing large language model agents in a robotic chemistry laboratory

在机器人化学实验室中对大型语言模型智能体进行压力测试

Lulu Guo, Yingkai Sun, Xiaobo Li, Luyao Ge, Ziming Wang, Haitao Zheng, Jingyu Li, Huijuan Zhang, Bingxu Chen, Daobin Liu, Yuebo Liu, Jie Li, Xiaohui Li, Linjiang Chen, Yi Luo, Jun Jiang

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究以机器人化学实验室为测试平台,使科学智能可衡量,通过4608次试验发现工作流程执行率低、长期规划有挑战,反馈促使局部调整,提供了部署评估及改进诊断框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22954 2026-07-28 cs.CL stat.AP 新提交 70%

Toward Automated Detection of Documentation Inconsistencies in Electronic Health Records

迈向电子健康记录中文档不一致性的自动检测

Jian Lu, Panyu Chen, Miriam Treggiari, Robert Blessing, Danyang Zhuo, Chunhua Weng, William W. Stead, Anru R. Zhang

机构 * Duke University(杜克大学) Columbia University Medical Center(哥伦比亚大学医学中心) Vanderbilt University Medical Center(范德堡大学医学中心)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 研究旨在检测电子健康记录中文档不一致性,采用两阶段LLM管道对3000份出院小结进行分析,发现多种类型不一致及反复出现的失败模式,建立了方法基础和概念框架以指导后续大规模分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18080 2026-07-28 cs.CV cs.AI 版本更新 70%

Sparse Evidence Can Suffice: Agentic Evidence Seeking for Multimodal Video Misinformation Detection

稀疏证据就足够了:用于多模态视频错误信息检测的智能证据搜索

Haochen Zhao, Yongxiu Xu, Xinkui Lin, Dong Xie, Jiarui Lu, Yuqi Qian, Yubin Wang, Hongbo Xu, Gaopeng Gou

专题命中 规划推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 研究多模态视频错误信息检测,提出SIEVE框架,通过智能体探索多模态证据构建证据包,由验证器判断真实性。智能体经特殊训练,实验表明该框架性能优于基线,能提供可检查证据线索,提升检测透明度与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏