arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11047 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11047 篇

2604.10169 2026-06-03 cs.AI cs.LG 73%

MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction

MAVEN-T:用于实时多智能体轨迹预测的强化异构蒸馏

Wenchang Duan, Zhenguo Gao, Jinguo Xian, Yi Shi

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) Bio-X Institutes, Key Laboratory for the Genetics of Developmental and Neuropsychiatric Disorders, Shanghai Jiao Tong University(上海交通大学Bio-X研究院、发育与神经精神疾病遗传学重点实验室) Shanghai Key Laboratory of Psychotic Disorders, Brain Science and Technology Research Center, Shanghai Jiao Tong University(上海精神疾病重点实验室、脑科学与技术研究中心,上海交通大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 提出MAVEN-T框架,通过高容量教师模型和紧凑学生模型的异构蒸馏,结合强化学习优化,实现实时多智能体轨迹预测,在多个数据集上达到高精度与低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03109 2026-05-29 cs.LG cs.AI stat.AP stat.ML 73%

E-valuator: Reliable Agent Verifiers with Sequential Hypothesis Testing

E-valuator: 基于序贯假设检验的可靠智能体验证器

Shuvom Sadhuka, Drew Prinster, Clara Fannjiang, Gabriele Scalia, Bonnie Berger, Aviv Regev, Hanchen Wang

机构 * Genentech(基因泰克) MIT(麻省理工学院) Johns Hopkins(约翰霍普金斯大学) Stanford(斯坦福大学)

专题命中 规划推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出E-valuator方法,将任意黑盒验证器分数转化为具有可控虚警率的决策规则,通过序贯假设检验实现对智能体轨迹的在线监控,提升统计功效并节省令牌。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10567 2026-05-28 cs.CL cs.AI 73%

Early Decisions Matter: Proximity Bias and Initial Trajectory Shaping in Non-Autoregressive Diffusion Language Models

早期决策至关重要:非自回归扩散语言模型中的邻近偏差与初始轨迹塑造

Jiyeon Kim, Sungik Choi, Yongrae Jo, Moontae Lee, Minjoon Seo

机构 * LG AI Research(LG人工智能研究)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过分析非自回归扩散语言模型的推理动态,发现其存在邻近偏差导致的错误传播问题,并提出一种轻量级规划器和序列结束温度退火方法来引导早期令牌选择,从而显著提升推理与规划任务的性能。

Comments ICML 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13853 2026-05-27 cs.CL cs.AI 73%

APEX-Searcher: Refining Credit Assignment with Subgoaling for Agentic Retrieval-Augmented Generation

APEX-Searcher: 通过子目标细化信用分配以增强智能体检索增强生成

Kun Chen, Qingchao Kong, Zhao Feifei, Wenji Mao

机构 * University of Chinese Academy of Sciences(中国科学院大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) Wenge Technology Co., Ltd(Wenger科技有限公司)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 针对复杂多跳问答中检索路径模糊和端到端强化学习奖励稀疏的问题,提出APEX-Searcher,通过分离规划与执行的信用分配(规划用RL优化、执行用SFT学习),在多个基准上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03695 2026-05-26 cs.MA cs.AI cs.CL 73%

Agent Primitives: Reusable Latent Building Blocks for Multi-Agent Systems

Agent Primitives: 面向多智能体系统的可复用潜在构建模块

Haibo Jin, Peng Kuang, Ye Yu, Xiaopeng Yuan, Haohan Wang

机构 * School of Information Sciences, University of Illinois at Urbana-Champaign, IL, USA(伊利诺伊大学厄巴纳-香槟分校信息科学学院) Siebel School of Computing and Data Science, University of Illinois at Urbana-Champaign, IL, USA(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院)

专题命中 规划推理 :planning(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出Agent Primitives,一组可复用的潜在构建模块,通过KV缓存内部通信和自动组合,提升多智能体系统的鲁棒性、效率和跨任务复用性。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25141 2026-05-26 cs.CL cs.AI 73%

LLM Agent Based Renewable Energy Forecasting Using Edge and IoT Data A Review of Solar Wind Weather and Grid Aware Decision Support

基于LLM Agent的利用边缘和物联网数据的可再生能源预测:太阳能、风能、天气和电网感知决策支持综述

Pavan Manjunath, Thomas Pruefer

机构 * Independent Researcher(独立研究员)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了如何利用大语言模型代理整合异构传感器流、天气API数据、历史发电记录和电网约束,形成统一的决策支持工作流,以增强可再生能源预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24266 2026-05-26 cs.CL cs.AI 73%

An Interactive Paradigm for Deep Research

深度研究的交互式范式

Lin Ai, Victor S. Bursztyn, Xiang Chen, Julia Hirschberg, Saayan Mitra

机构 * Adobe Research(Adobe研究院) Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 提出SteER框架,通过可解释的中间过程控制、成本效益决策和实时用户模型,在深度研究中实现用户对齐,性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26383 2026-05-25 cs.CL cs.AI 73%

Efficient and Transferable Agentic Knowledge Graph RAG via Reinforcement Learning

基于强化学习的高效可迁移智能知识图谱检索增强生成

Junhong Lin, Shicheng Liu, Jinyeop Song, Song Wang, Julian Shun, Yada Zhu

机构 * MIT CSAIL(麻省理工学院CSAIL) University of Virginia(弗吉尼亚大学) IBM Research(IBM研究院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 提出KG-R1框架,通过强化学习将单个智能体与知识图谱交互,统一检索、推理和生成过程,在KGQA基准上以更少生成token提升准确率,并展现跨图谱的零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18747 2026-05-19 cs.CL cs.AI 73%

Code as Agent Harness

代码作为代理工具

Xuying Ning, Katherine Tieu, Dongqi Fu, Tianxin Wei, Zihao Li, Yuanchen Bei, Jiaru Zou, Mengting Ai, Zhining Liu, Ting-Wei Li, Lingjie Chen, Yanjun Zhao, Ke Yang, Bingxuan Li, Cheng Qian, Gaotang Li, Xiao Lin, Zhichen Zeng, Ruizhong Qiu, Sirui Chen, Yifan Sun, Xiyuan Yang, Ruida Wang, Rui Pan, Chenyuan Yang, Dylan Zhang, Liri Fang, Zikun Cui, Yang Cao, Pan Chen, Dorothy Sun, Ren Chen, Mahesh Srinivasan, Nipun Mathur, Yinglong Xia, Hong Li, Hong Yan, Pan Lu, Lingming Zhang, Tong Zhang, Hanghang Tong, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta Stanford University(斯坦福大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了代码在代理系统中的作用,提出了一种统一的视角,将代码视为代理基础设施的基础,并讨论了代理工具接口、机制以及扩展到多代理系统的挑战。

Comments GitHub: https://github.com/YennNing/Awesome-Code-as-Agent-Harness-Papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20857 2026-05-19 cs.CL cs.AI 73%

Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory

Evo-Memory:通过自演化记忆基准测试LLM代理的测试时间学习

Tianxin Wei, Noveen Sachdeva, Benjamin Coleman, Zhankui He, Yuanchen Bei, Xuying Ning, Mengting Ai, Yunzhe Li, Jingrui He, Ed H. Chi, Chi Wang, Shuo Chen, Fernando Pereira, Wang-Cheng Kang, Derek Zhiyuan Cheng

机构 * Google DeepMind(谷歌DeepMind) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Evo-Memory,一个用于评估LLM代理自演化记忆能力的综合流基准和框架,通过构建序列任务流数据集,要求LLM在每次交互后搜索、适应和演化记忆,并在10个多样化的多轮目标导向和单轮推理与问答数据集上评估了超过十种代表性的记忆模块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14126 2026-05-15 cs.LG cs.AI 73%

Reinforcement Learning for Tool-Calling Agents in Fast Healthcare Interoperability Resources (FHIR)

用于快速医疗互操作资源(FHIR)的强化学习工具调用代理

Marius S. Knorr, Robert Müller, Jan P. Bremer, Nils Schweingruber

机构 * IDM gGmbH, University Medical Center Hamburg-Eppendorf, Hamburg, Germany(IDM公司,汉堡埃彭多夫大学医疗中心,德国汉堡)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在FHIR中通过强化学习提升多轮推理性能,采用自定义环境和工具训练模型,提升回答准确性至77%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10820 2026-05-12 cs.AI cs.LG 73%

MaD Physics: Evaluating information seeking under constraints in physical environments

MaD Physics:在物理环境中评估受约束的信息获取

Moksh Jain, Mehdi Bennani, Johannes Bausch, Yuri Chervonyi, Bogdan Georgiev, Simon Osindero, Nenad Tomašev

机构 * Mila – Quebec AI Institute, Université de Montréal(Mila-魁北克人工智能研究所,蒙特利尔大学) Google DeepMind(谷歌DeepMind)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 MaD Physics通过三个基于不同物理定律的环境,评估智能体在资源受限条件下进行测量和推理的能力,揭示了现有模型在科学推理和约束规划方面的不足。

Comments 64 pages, 10 figures. Project page: https://mad-physics.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19788 2026-05-11 cs.AI cs.LG 73%

Benchmarking World-Model Learning with Environment-Level Queries

用环境级查询评估世界模型学习

Archana Warrier, Dat Nguyen, Michelangelo Naim, Moksh Jain, Yichao Liang, Karen Schroeder, Cambridge Yang, Joshua B. Tenenbaum, Sebastian Vollmer, Kevin Ellis, Zenna Tavares

机构 * Basis Research Institute DFKI GmbH Harvard University Universit\'e de Montr\'eal \& Mila - Quebec AI Institute University of Cambridge Massachusetts Institute of Technology Cornell University

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出WorldTest协议,通过环境级查询评估智能体是否学习到支持多种环境属性的模型,通过AutumnBench验证人类在网格世界环境中的表现优于前沿模型。

Comments 34 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00557 2026-05-04 cs.CL cs.AI 73%

Structure Liberates: How Constrained Sensemaking Produces More Novel Research Output

结构解放:如何受约束的意象生成产生更多创新性研究输出

James Mooney, Zae Myung Kim, Young-Jun Lee, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SCISENSE框架,通过结构化认知阶段提升研究输出的创新性,展示目标导向的意象生成在轨迹质量与下游任务表现上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06361 2026-05-04 cs.LG cs.AI 73%

Beyond Prompt-Induced Lies: Investigating LLM Deception on Benign Prompts

超越提示诱导的谎言:调查LLM在良性提示上的自我欺骗

Zhaomin Wu, Mingzhe Du, See-Kiong Ng, Bingsheng He

机构 * Institute of Data Science National University of Singapore(数据科学研究所,新加坡国立大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究LLM在良性提示下的自我欺骗行为,提出基于Contact Searching Questions的框架,通过两个统计指标量化欺骗可能性,发现任务难度增加时欺骗倾向上升,模型容量增加并不总能减少欺骗。

Comments ICLR 2026 (Oral)

Journal ref International Conference on Learning Representations (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27840 2026-05-01 cs.LG cs.AI 73%

CastFlow: Learning Role-Specialized Agentic Workflows for Time Series Forecasting

CastFlow:学习用于时间序列预测的角色专用代理工作流

Bokai Pan, Mingyue Cheng, Zhiding Liu, Shuo Yu, Xiaoyu Tao, Yuchong Wu, Qi Liu, Defu Lian, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 CastFlow通过动态代理框架实现多视角时间模式提取和多轮上下文特征获取,提升时间序列预测的准确性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27167 2026-05-01 cs.GT cs.AI cs.LG 73%

What Suppresses Nash Equilibrium Play in Large Language Models? Mechanistic Evidence and Causal Control

在大型语言模型中什么抑制了纳什均衡行为?机制证据和因果控制

Paraskevas V. Lekeas, Giorgos Stamatopoulos

机构 * DreamWorks Animation(梦工厂动画) University of Crete(希腊克里特大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 研究通过实验揭示大型语言模型在战略决策中抑制纳什均衡的行为机制,发现模型在早期层面对对手历史编码精确,但纳什行动编码较弱,且通过后期层的亲社会覆盖抑制纳什行为。

Comments 11 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25482 2026-04-29 cs.CL cs.AI 73%

From World-Gen to Quest-Line: A Dependency-Driven Prompt Pipeline for Coherent RPG Generation

从World-Gen到Quest-Line:一种依赖驱动的提示管道用于连贯的RPG生成

Dominik Borawski, Marta Szulc, Robert Chudy, Małgorzata Giedrowicz, Piotr Mironowicz

机构 * Gdańsk University of Technology(格但斯克技术大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种依赖驱动的提示管道,通过结构化中间表示建模叙事依赖,以生成连贯的RPG内容。该方法通过分阶段生成世界构建、NPC创建、玩家角色创建、战役级任务规划和任务扩展,减少叙事漂移并支持可扩展的叙事元素生成。

Comments 13 pages, 1 figure, 5 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19756 2026-04-23 cs.LG cs.AI 73%

WorkflowGen:an adaptive workflow generation mechanism driven by trajectory experience

WorkflowGen:一种基于轨迹经验的自适应工作流生成机制

Ruocan Wei, Shufeng Wang, Ziwei Shi

机构 * China Telecom Cloud(中国电信云)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出WorkflowGen,一种基于轨迹经验的自适应工作流生成机制,通过捕捉完整轨迹提取可重用知识,减少token消耗,提升效率和成功率。

Comments 16 pages,3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07791 2026-04-21 cs.AI cs.LG 73%

SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents

SEARL:自进化智能体中策略与工具图记忆的联合优化

Xinshun Feng, Xinhao Song, Lijun Li, Gongshen Liu, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 SEARL通过构建结构化经验记忆实现策略与工具图记忆的联合优化,提升智能体在知识推理和数学任务中的实用性和效率。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02547 2026-04-21 cs.AI cs.CL 73%

The Landscape of Agentic Reinforcement Learning for LLMs: A Survey

代理强化学习用于大语言模型的景观:综述

Guibin Zhang, Hejia Geng, Xiaohang Yu, Zhenfei Yin, Zaibin Zhang, Zelin Tan, Heng Zhou, Zhongzhi Li, Xiangyuan Xue, Yijiang Li, Yifan Zhou, Yang Chen, Chen Zhang, Yutao Fan, Zihu Wang, Songtao Huang, Francisco Piedrahita-Velez, Yue Liao, Hongru Wang, Mengyue Yang, Heng Ji, Jun Wang, Shuicheng Yan, Philip Torr, Lei Bai

机构 * University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Brown University(布朗大学) University College London(伦敦大学学院) University of Science and Technology of China(中国科学技术大学) Imperial College London(伦敦帝国学院) Dalian University of Technology(大连理工大学) Chinese Academy of Sciences(中国科学院) The Chinese University of Hong Kong(香港中文大学) University of Georgia(佐治亚大学) University of California, San Diego(加州大学圣地亚哥分校) University of California, Santa Barbara(加州大学圣塔芭芭拉分校) University of Bristol(布里斯托大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了代理强化学习在大语言模型中的应用,提出双分类体系,探讨其核心能力与应用领域,并强调强化学习在使能力转化为适应性行为中的关键作用。

Comments Published on Transactions on Machine Learning Research: https://openreview.net/forum?id=RY19y2RI1O

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07165 2026-04-16 cs.AI cs.LG 73%

Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization

链式推理,树状学习:多轮智能体策略优化的自我校正与嫁接

Yu Li, Sizhe Tang, Tian Lan

机构 * Department of Electrical and Computer Engineering, George Washington University(电气与计算机工程系,乔治·华盛顿大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出T-STAR框架,通过构建认知树整合轨迹,引入自我校正机制和上下文思维嫁接,提升多轮推理任务中策略优化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11201 2026-04-15 cs.CL cs.AI 73%

CocoaBench: Evaluating Unified Digital Agents in the Wild

CocoaBench:评估真实世界的统一数字代理

CocoaBench Team, Shibo Hao, Zhining Zhang, Zhiqi Liang, Tianyang Liu, Yuheng Zha, Qiyue Gao, Jixuan Chen, Zilong Wang, Zhoujun Cheng, Haoxiang Zhang, Junli Wang, Hexi Jin, Boyuan Zheng, Kun Zhou, Yu Wang, Feng Yao, Licheng Liu, Yijiang Li, Zhifei Li, Zhengtao Han, Pracha Promthaw, Tommaso Cerruti, Xiaohan Fu, Ziqiao Ma, Jingbo Shang, Lianhui Qin, Julian McAuley, Eric P. Xing, Zhengzhong Liu, Rupesh Kumar Srivastava, Zhiting Hu

机构 * CocoaBench Team(CocoaBench 团队)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 CocoaBench评估统一数字代理在多样化场景中的表现,通过人类设计的长周期任务测试其视觉、搜索和编码能力的灵活组合,发现当前代理在推理、规划和视觉理解方面仍有较大提升空间。

Comments Project page: https://cocoabench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08588 2026-04-13 cs.LG cs.AI 73%

Act or Escalate? Evaluating Escalation Behavior in Automation with Language Models

行动或升级?基于语言模型评估自动化中的升级行为

Matthew DosSantos DiSorbo, Harang Ju

机构 * Harvard Business School(哈佛商学院) Johns Hopkins Carey Business School(约翰霍普金斯大学凯瑞商学院)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了语言模型在自动化决策中如何平衡行动与升级,发现模型在成本权衡上的隐含阈值存在显著差异,且自我评估存在偏差,通过干预测试发现链式思维训练能产生稳健的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06260 2026-04-09 cs.LG cs.AI 73%

$S^3$: Stratified Scaling Search for Test-Time in Diffusion Language Models

$S^3$:分层缩放搜索用于扩散语言模型的测试时间

Ahsan Bilal, Muhammad Ahmed Mohsin, Muhammad Umer, Asad Aali, Muhammad Usman Khanzada, Muhammad Usman Rafique, Zihao He, Emily Fox, Dean F. Hougen

机构 * University of Oklahoma(俄克拉荷马大学) Stanford University(斯坦福大学) University of Göttingen(哥廷根大学) Zoox Meta

专题命中 规划推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出$S^3$方法,通过在去噪过程中重新分配计算资源提升生成质量,实验证明其在数学推理任务中表现最佳。

Comments Submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06177 2026-04-09 cs.IR cs.AI cs.CL 73%

WebExpert: domain-aware web agents with critic-guided expert experience for high-precision search

WebExpert: 基于领域感知的网页代理:通过批评者引导的专家经验实现高精度搜索

Yuelin Hu, Zhengxue Cheng, Ronghua Wu, Qunshan Gu, Hongwei Hu, Wei Liu, Qiao Liang, Li Song

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 WebExpert通过领域感知的网页代理,结合批评者引导的专家经验,提升搜索精度,其核心方法包括句子级经验检索、结构化轻量级领域诱导及偏好优化规划,有效提升了答案准确率。

Comments accepted by icassp2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10512 2026-04-09 cs.AI cs.LG cs.NE 73%

Resource-constrained Amazons chess decision framework integrating large language models and graph attention

资源受限的亚马逊国际象棋决策框架整合大语言模型和图注意力

Tianhao Qian, Zhuoxuan Li, Jinde Cao, Xinli Shi, Leszek Rutkowski

机构 * School of Mathematics, Southeast University(东南大学数学学院) Systems Research Institute of the Polish Academy of Sciences(波兰科学院系统研究所) Institute of Computer Science, AGH University of Krakow(AGH科技大学计算机科学研究所) SAN University(SAN大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种轻量级混合框架,结合图注意力学习和大语言模型生成能力,提升亚马逊国际象棋决策准确性,实验显示在资源受限条件下实现显著性能提升。

Comments 20 pages, 15 figures. Supported by the National Key Research and Development Project of China (No. 2020YFA0714300), NSFC (No. 61833005, 12061088), the Open Project of Key Laboratory of Transport Industry of Comprehensive Transportation Theory (Nanjing Modern Multimodal Transportation Laboratory) (MTF2023004), and the China Postdoctoral Science Foundation (2024T170129, GZC20240261)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18258 2026-04-09 cs.MA cs.AI cs.LG 73%

Hybrid Agentic AI and Multi-Agent Systems in Smart Manufacturing

智能制造中混合代理AI与多代理系统

Mojtaba A. Farahani, Md Irfan Khan, Thorsten Wuest

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种混合代理AI与多代理框架,用于预测性维护,结合LLM代理的战略协调与规则代理的高效任务处理,通过分层架构实现动态模型适应与可解释决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07663 2026-04-08 cs.DB cs.AI cs.LG 73%

Cortex AISQL: A Production SQL Engine for Unstructured Data

Cortex AISQL:面向非结构化数据的生产级SQL引擎

Paweł Liskowski, Benjamin Han, Paritosh Aggarwal, Bowei Chen, Boxin Jiang, Nitish Jindal, Zihan Li, Aaron Lin, Kyle Schmaus, Jay Tayade, Weicheng Zhao, Anupam Datta, Nathan Wiegand, Dimitris Tsirogiannis

机构 * Snowflake Inc.(雪花公司)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 Cortex AISQL通过AI-aware优化、自适应模型级联和语义连接重写技术,解决大规模语义操作效率问题,提升非结构化数据查询性能。

Comments Published in SIGMOD Companion '26 (Industry Track), Bengaluru, India, May 31-June 5, 2026. ACM DOI: 10.1145/3788853.3803093. This version is the published ACM Version of Record under the Creative Commons Attribution 4.0 International (CC BY 4.0) license

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26433 2026-04-07 cs.LG cs.AI 73%

ACT: Agentic Classification Tree

ACT:代理分类树

Vincent Grari, Tim Arni, Thibault Laugel, Sylvain Lamprier, James Zou, Marcin Detyniecki

机构 * AXA AI Research(AXA人工智能研究) Stanford University(斯坦福大学) EPFL, Lausanne, Switzerland(瑞士洛桑联邦理工学院) Polish Academy of Sciences, IBS PAN, Warsaw, Poland(波兰科学院计算机科学研究所)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 ACT通过将决策树扩展到非结构化输入,利用自然语言问题和LLM反馈提升透明度和可解释性,实验证明其在文本基准上优于基于提示的方法。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏