arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 493 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 493 篇

2602.09012 2026-06-23 cs.LG cs.AI cs.CL 版本更新 75%

Next-Gen CAPTCHAs: Leveraging the Cognitive Gap for Scalable and Diverse GUI-Agent Defense

下一代验证码:利用认知差距实现可扩展且多样化的GUI智能体防御

Jiacheng Liu, Yaxin Luo, Jiacheng Cui, Xinyi Shang, Xiaohan Zhao, Zhiqiang Shen

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) MetaAgentX University College London(伦敦大学学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Next-Gen CAPTCHAs框架,通过利用人机在交互感知、记忆、决策和行动上的认知差距,设计动态任务以区分生物用户与AI智能体,实现可扩展的防御。

Comments Project page at https://greenoso.github.io/NextGen-CAPTCHAs_webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18421 2026-06-16 cs.CL cs.AI cs.LG 版本更新 75%

EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective

EvoMemBench: 从自演化视角评估智能体记忆

Yuyao Wang, Zhongjian Zhang, Mo Chi, Kaichi Yu, Yuhan Li, Miao Peng, Bing Tong, Chen Zhang, Yan Zhou, Jia Li

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Createlink Technology(创-link科技) Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Institute of Technology(北京理工大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出EvoMemBench,从自演化视角评估智能体记忆,通过内存范围和内容两个维度构建统一基准,比较15种内存方法并发现当前内存系统尚未达到通用解决方案,长上下文基线仍具竞争力,内存在上下文不足或任务困难时效果显著,检索方法在知识密集型任务中表现优异,而程序和长期记忆方法在任务结构匹配时更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06002 2026-06-08 cs.CV 版本更新 75%

Global-Local Monte Carlo Tree Search in Vision-Language Models for Text-to-3D Indoor Scene Generation

面向文本到3D室内场景生成的视觉-语言模型中的全局-局部蒙特卡洛树搜索

Mengshi Qi, Wei Deng, Xianlin Zhang, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, China(网络与交换技术国家重点实验室,北京邮电大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 提出一种全局-局部蒙特卡洛树搜索方法,通过分层场景表示和PRM引导的MCTS解决文本到3D室内场景生成中的错误传播问题,并构建新基准数据集3DTindo-bench。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02411 2026-08-11 cs.AI cs.IR cs.LG cs.MA 版本更新 74%

FitText: Evolving Agent Tool Ecologies via Memetic Retrieval

FitText: 通过模因检索演化智能体工具生态

Kyle Zheng, Han Zhang, Renliang Sun, Chenchen Ye, Wei Wang

机构 * UCLA(加州大学洛杉矶分校)

专题命中 规划推理 :reasoning(abstract,comments);planning(abstract);分类 cs.AI、cs.LG

AI总结 针对用户任务描述与工具文档间的语义鸿沟,提出FitText框架,将检索嵌入推理循环,通过自然语言伪工具描述迭代优化和模因进化选择,显著提升工具检索性能。

Comments 30 pages, including appendices. Accepted at COLM 2026 (main conference) and the COLM 2026 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11809 2026-07-28 cs.AI 版本更新 74%

Multi-agent DRL-based Lane Change Decision Model for Cooperative Platooning in Mixed Traffic

基于多智能体深度强化学习的车道变换决策模型:用于混合交通中协同规划

Zeyu Mu, Shangtong Zhang, B. Brian Park

机构 * University of Virginia(弗吉尼亚大学) Link Lab(链接实验室) Department of Systems and Information Engineering(系统与信息工程系) Department of Computer Science(计算机科学系)

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 本文提出基于多智能体深度强化学习的车道变换决策模型,通过整合CNN-QMIX框架提升CAVs在混合交通中的协同编队效率,实验显示其在提升协同编队率方面表现优异。

Comments Under review at IEEE Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30837 2026-06-16 cs.CR cs.LG 版本更新 74%

Send a SCOUT First: Pre-hoc Reasoning for Adaptive Detector Allocation in Prompt-Injection Defense

先派侦察兵:提示注入防御中自适应检测器分配的预推理方法

Shuhao Zhang, Jiarui Li, Qi Cao, Ruiyi Zhang, Pengtao Xie

机构 * UC San Diego(加州大学圣迭戈分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划推理 :reasoning(title);分类 cs.LG

AI总结 针对提示注入检测器异构且不可靠的问题,提出SCOUT框架,通过预测每个检测器对每个样本的可靠性和延迟,动态分配检测器,实现安全性与效率的权衡。

Comments We propose SCOUT, a detector allocation framework that predicts each detector's accuracy and latency on a given input before running it, letting operators control the safety-utility trade-off with a single threshold and route to an LLM judge only when needed

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02748 2026-06-08 cs.NI cs.LG 版本更新 74%

Agentic World Modeling for 6G: Near-Real-Time Generative State-Space Reasoning

面向6G的智能体世界建模:近实时生成式状态空间推理

Farhad Rezazadeh, Amir Ashtari Gargari, Hatim Chergui, Sandra Lagen, Merouane Debbah, Houbing Song, Lingjia Liu

机构 * BrainOmega and the Technical University of Catalonia (UPC)(BrainOmega 和 哈佛大学(UPC)) Centre Tecnologic de Telecomunicacions de Catalunya (CTTC/CERCA)(巴塞罗那电信技术中心(CTTC/CERCA)) i2CAT Foundation(i2CAT 基金会) Khalifa University of Science and Technology(科技 Khalifa 大学) University of Maryland, Baltimore County (UMBC)(马里兰大学巴尔的摩分校(UMBC)) Virginia Tech(弗吉尼亚理工学院)

专题命中 规划推理 :reasoning(title);分类 cs.LG

AI总结 提出基于世界建模的智能体框架WM-MS3M,通过生成式状态空间实现6G网络近实时反事实推理与资源分配,在O-RAN数据上降低预测误差并加速推理。

Comments 13 Pages, 3 Figures, 4 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03502 2026-08-20 cs.AI cs.LG cs.MA 版本更新 73%

Hybrid LLM-Augmented Reinforcement Learning Agents for Complex Sequential Decision Tasks

用于复杂序列决策任务的混合大语言模型增强强化学习智能体

Christophe D. Hounwanou, John Emeka Eze, Yaé Ulrich Gaba

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出混合LLM增强RL智能体,融合LLM规划与RL动作优化,经实验验证其在序列决策任务上优于仅RL、仅LLM的基线方法,为构建更强自主系统提供了新方向。

Comments This submission is withdrawn because the uploaded manuscript does not accurately reflect the intended structure or results. Several components referenced in the text are incomplete or not represented in the PDF, and the current version may mislead readers. The work is therefore withdrawn to maintain clarity of the record

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28166 2026-08-14 cs.CL cs.AI 版本更新 73%

Commit Locally, Exit Globally: Coordinating Adaptive Sampling and Early Exit in Diffusion Language Models

提交时机与位置:扩散语言模型的候选感知解码

Chia-Ming Lee, Shao-Kai Liu, Ming-Ching Chang, Xin Li, Yu-Lun Liu, Chih-Chung Hsu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) University at Albany, SUNY(纽约州立大学奥尔巴尼分校)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对扩散语言模型解码过早终止问题,提出无训练的候选感知提前退出框架LATCH,结合CVC与BWEC,在零样本11项任务上,以准确率损失极小的代价实现多倍解码速度提升。

Comments Code is available at https://github.com/ming053l/C4-dLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22651 2026-08-14 cs.LG cs.AI cs.CE cs.MA 版本更新 73%

Automated Design Optimization via Strategic Search with Large Language Models

通过大语言模型的战略搜索实现自动化设计优化

Anthony Carreon, Vansh Sharma, Venkat Raman

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出AUTO框架,利用大语言模型的战略搜索实现GPU代码优化,提升搜索效率并降低成本。

Comments 16 pages, 4 tables, 8 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28566 2026-08-06 cs.AI cs.LG 版本更新 73%

Tree of Thoughts as a Classical Heuristic Search Problem: Formal Foundations and Design Patterns

思维树作为经典启发式搜索问题:形式化基础与设计模式

Guni Sharon

机构 * Guni Sharon

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过经典启发式搜索术语统一分类法,将基于LLM的推理映射到搜索组件,并识别出系统搜索和前瞻性策略两种设计模式。

Comments Extended version of the SoCS 2026 paper. Includes appendices omitted from the proceedings version

Journal ref Proceedings of the Nineteenth International Symposium on Combinatorial Search (SoCS 2026), AAAI Press, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06716 2026-08-04 cs.AI cs.CL cs.CR 版本更新 73%

SIEVE: Selective Integrity Verification and Escalation for Defending LLM Agents against Indirect Prompt Injection

认知控制架构(CCA):一种用于鲁棒对齐AI代理的生命周期监督框架

Zhibo Liang, Tianze Hu, Zaiye Chen, Mingjie Tang

机构 * Sichuan University(四川大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出认知控制架构(CCA),通过全生命周期认知监督框架,有效应对复杂IPI攻击,实现安全、功能与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11912 2026-07-28 cs.LG cs.AI 版本更新 73%

How Transformers Learn to Plan via Multi-Token Prediction

Transformer 如何通过多令牌预测学习规划

Jianhao Huang, Zhanpeng Zhou, Renqiu Xia, Baharan Mirzasoleiman, Weijie Su, Wei Huang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Shanghai Jiao Tong University(上海交通大学) University of Pennsylvania(宾夕法尼亚大学) RIKEN Center for Advanced Intelligence Project(日本理化学研究院先进智能项目中心) The Institute of Statistical Mathematics(统计数学研究所)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究多令牌预测如何促进推理,特别是规划,通过实验和理论分析展示其优于单令牌预测的性能及背后的机制。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16727 2026-07-15 cs.AI cs.LG 版本更新 73%

Mobility-Aware Cache Framework for Scalable LLM-Based Human Mobility Simulation

面向可扩展性的LLM基人类移动模拟移动感知缓存框架

Hua Yan, Heng Tan, Yingxue Zhang, Yu Yang

机构 * Lehigh University(莱维大学) State University of New York at Binghamton(纽约州立大学布法罗分校)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 MobCache通过移动感知缓存框架提升大规模LLM基人类移动模拟的效率和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11324 2026-07-14 cs.RO cs.AI cs.LG 版本更新 73%

Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models

Embodied-R1.5:通过具身基础模型演化物理智能

Yifu Yuan, Yaoting Huang, Xianze Yao, Yutong Li, Shuoheng Zhang, Linqi Han, Pengyi Li, Jiangeng Sun, Wenting Jia, Zhao Zhang, Yuhao Liu, Ruihao Liao, Yucheng Hu, Qiyu Wu, Yuxiao Li, Zibin Dong, Fei Ni, Yan Zheng, Shuyang Gu, Yi Ma, Hongyao Tang, Han Hu, Jianye Hao

机构 * Tianjin University(天津大学) Tencent Hunyuan(腾讯混元)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 提出统一具身基础模型Embodied-R1.5,通过自动化数据管道和多任务平衡强化学习,在8B参数下实现24项基准中16项最优,并支持微调为VLA模型。

Comments Embodied R1.5 technical report. Project page: https://embodied-r.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07468 2026-07-07 cs.LG cs.CL cs.MA 版本更新 73%

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

通过在线自我博弈强化学习追踪移动目标以实现更安全的语言模型

Mickel Liu, Liwei Jiang, Yancheng Liang, Simon Shaolei Du, Yejin Choi, Tim Althoff, Natasha Jaques

专题命中 规划推理 :chain-of-thought(abstract);planning(abstract);分类 cs.CL、cs.LG

AI总结 研究传统大语言模型安全对齐问题,引入Self-RedTeam算法,通过在线自我博弈多智能体强化学习持续共同进化攻防策略,有理论安全保障,实证效果好,推动从被动修补到主动协同进化转变。

Comments ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19775 2026-07-03 cs.AI cs.CL cs.ET cs.MA cs.RO 版本更新 73%

From Actions to Understanding: Conformal Interpretability of Temporal Concepts in LLM Agents

从行为到理解:LLM代理中时间概念的符合可解释性

Trilok Padhi, Ramneet Kaur, Krishiv Agarwal, Adam D. Cobb, Daniel Elenius, Manoj Acharya, Colin Samplawski, Alexander M. Berenbeim, Nathaniel D. Bastian, Susmit Jha, Ugur Kursuncu, Anirban Roy

机构 * Georgia State University(佐治亚州立大学) Computer Science Lab, SRI(SRI计算机科学实验室) Army Cyber Institute(陆军网络学院) United States Military Academy(美国军事学院) University of Florida(佛罗里达大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过符合视角解释LLM代理时间概念演变的框架,结合逐步奖励建模与符合预测,识别时间概念的潜在方向,实验表明这些概念可线性分离,为LLM代理提供可靠故障检测和干预方法。

Comments Accepted at the Mechanistic Interpretability Workshop, 43rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06288 2026-07-03 cs.AI cs.LG 版本更新 73%

BuilderBench: The Building Blocks of Intelligent Agents

BuilderBench:智能体的构建模块

Raj Ghugare, Roger Creus Castanyer, Catherine Ji, Kathryn Wantlin, Jin Schofield, Karthik Narasimhan, Benjamin Eysenbach

机构 * Princeton University(普林斯顿大学) Mila – Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 提出BuilderBench基准,通过开放式探索训练智能体构建结构,实验表明现有前沿语言模型和强化学习算法无法解决任何非平凡任务。

Comments Blogpost: https://rajghugare19.github.io/builderbench and Code: https://github.com/rajghugare19/builderbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01101 2026-06-16 cs.AI cs.CL cs.SD eess.AS 版本更新 73%

Virtual Speech Therapist: A Clinician-in-the-Loop AI Speech Therapy Agent for Personalized and Supervised Therapy

虚拟言语治疗师:一种临床医生参与的AI言语治疗代理,用于个性化和监督式治疗

Shakeel Sheikh, Patrick Marmaroli, MD Sahidullah, Slim Ouni, Fabrice Hirsch, Goncalo Leal, Bjorn W Schuller

机构 * The Kashmir Hub for Artficial Intelligence(喀布尔人工智能中心) Microsoft / Vocametrix(微软 / Vocametrix) IAI, TCG CREST(IAI,TCG CREST) Université de Lorraine, CNRS, Inria, LORIA(洛林大学,CNRS,Inria,LORIA) Laboratoire Praxiling, UMR5267, CNRS et Université Paul-Valéry Montpellier 3(Praxiling实验室,UMR5267,CNRS及蒙彼利埃Paul-Valéry大学) Speechcare iStutter, Portuguese Catholic University(Speechcare iStutter,葡萄牙天主教大学) CHI – Chair of Health Informatics, TUM University Hospital(健康信息学系,TUM大学医院) GLAM – Group on Language, Audio, & Music, Imperial College London(语言、音频与音乐小组,伦敦帝国理工学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 提出虚拟言语治疗师(VST)平台,集成深度学习口吃分类与多智能体大语言模型推理,自动生成个性化治疗方案,并通过临床医生反馈优化,实验证明其高质量推荐。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01637 2026-06-09 cs.CL cs.AI 版本更新 73%

Easier to Mislead Than to Correct: Harmful and Beneficial Revision in LLM Conformity

误导比纠正更容易:LLM 从众中的有害与有益修正

Jiaming Qu, Lucheng Fu, Yibo Hu

机构 * Amazon(亚马逊) Georgia Institute of Technology(佐治亚理工学院) Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 通过控制实验,研究大语言模型在多智能体系统中面对同伴答案时的从众行为,发现同伴一致意见更容易误导原本正确的模型,而权威标签使模型更倾向于选择被认可的答案,且通用推理干预无法可靠地减少有害修正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22354 2026-06-23 cs.RO 版本更新 71%

LLM-Based Generalizable Hierarchical Task Planning and Execution for Heterogeneous Robot Teams with Event-Driven Replanning

基于LLM的异构机器人团队通用分层任务规划与执行及事件驱动重规划

Suraj Borate, Bhavish Rai B, Vipul Pardeshi, Madhu Vadali

机构 * Department of Mechanical Engineering, IIT Gandhinagar(印度加尔各直辖区理工学院机械工程系) Sahyadri College of Engineering and Management(萨哈亚德里工程与管理学院) Vishwakarma Institute of Information Technology(维什瓦克arma信息技术学院)

专题命中 规划推理 :planning(title)

AI总结 提出CoMuRoS架构,结合集中式规划与分布式执行,通过LLM解释自然语言目标、分配子任务,并支持事件驱动重规划,在硬件实验中实现自主恢复和协调运输。

Comments full version of this short paper is accepted at Frontiers in Robotics and AI Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12854 2026-08-20 cs.RO cs.AI cs.CV 版本更新 70%

BrainWAM: Action-Space Coordination of Semantic Priors and Predictive Dynamics for Autonomous Driving

BrainWAM:面向自动驾驶的语义先验与预测动力学的动作空间协调框架

Bing Zhan, Shuyao Shang, Shuo Lu, Yuan Xu, Zhao Wang, Yida Wang, Xueyang Zhang, Kun Zhan, Jiahao Gu

机构 * Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) Li Auto Inc.(理想汽车)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 该研究针对自动驾驶中语义与预测动力学的规划需求,提出BrainWAM框架,通过结构化动作空间协调及异步整流流推理,在NAVSIM数据集上实现最优性能,优于仅VLA或仅WAM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17006 2026-08-18 cs.AI 版本更新 70%

Budget-Aware Tool Use Enables Effective Agent Scaling

预算感知的工具使用实现有效的代理扩展

Tengxiao Liu, Zifeng Wang, Jin Miao, I-Hung Hsu, Jun Yan, Jiefeng Chen, Rujun Han, Fangyuan Xu, Yanfei Chen, Ke Jiang, Samira Daruki, Yi Liang, William Yang Wang, Tomas Pfister, Chen-Yu Lee

机构 * Google Cloud AI Research(谷歌云人工智能研究) Google DeepMind(谷歌DeepMind) New York University(纽约大学) UC Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本研究提出BATS框架,通过预算感知机制提升工具增强代理的扩展效率,实现更优的成本-性能平衡。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11753 2026-08-17 cs.CL 版本更新 70%

Agentic Aggregation for Parallel Scaling of Long-Horizon Agentic Tasks

代理聚合用于长周期代理任务的并行扩展

Yoonsang Lee, Howard Yen, Xi Ye, Danqi Chen

机构 * Princeton Language and Intelligence, Princeton University(普林斯顿大学语言与智能实验室)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出AggAgent,通过将并行轨迹视为环境,有效解决长周期代理任务中轨迹信息聚合问题,提升性能并降低开销。

Comments COLM 2026. Code is available at https://github.com/princeton-pli/AggAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13374 2026-08-13 cs.AI 版本更新 70%

Behavior and Representation in Open-Weight Large Language Models for Combinatorial Optimization: From Feature Extraction to Algorithm Selection

大语言模型在组合优化中的行为与表示:从特征提取到算法选择

Francesca Da Ros, Luca Di Gaspero, Kevin Roitero

机构 * University of Udine(乌迪大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本研究探讨了大语言模型在组合优化中的内部表示能力,通过直接查询和探测分析,评估其提取特征和预测最佳求解器的效果。

Comments Accepted for publication in Computers & Operations Research. Code and data are available on Zenodo: https://doi.org/10.5281/zenodo.21891840

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24850 2026-08-12 cs.IR cs.LG 版本更新 70%

SearchArt: Training Long-Horizon Search Agent with Scalable Synthetic and Verified Task

SearchArt:使用可扩展的合成和经过验证的任务训练长视野搜索代理

Lang Mei, Xiaohan Yu, Chong Chen, Liyan Liu, Xiangnan Chen, Jinchao Ma, Chao Feng, Li Huang, Siyu Mo, Sichen Kang, Yunkun Xu, Zhihan Yang, Zhujun Xue, Jingren Zhang, Qing He, Yingdi Huang, Hao Jiang, Ziao Ma, Zewei Pan, Minhao Sun, Zhuo Tao, Jinzhao Xiao, Gangtao Xin, Huanyao Zhang, Wenjian Zhang, Jiangshan Zhang, Guojie Zhu, Fangzhou Zou, Jiaxin Mao, Wentao Zhang

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 针对训练长视野搜索代理的挑战,SearchArt提出通过验证驱动任务合成及多阶段训练管道的框架,构建大规模数据集并验证数据可靠性,经此训练的代理在多基准测试中表现出色,参数少却成绩优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07223 2026-08-11 cs.AI 版本更新 70%

Reflex First, Reflect Later: Latency-Aware Embodied LLM Agents for Dynamic Response

先反射,后反思:面向动态响应的延迟感知具身大语言模型智能体

Yangqing Zheng, Shunqi Mao, Dingxin Zhang, Weidong Cai

机构 * School of Computer Science, The University of Sydney(计算机科学学院,悉尼大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 该研究针对动态环境中具身LLM智能体的推理延迟问题,提出RRARA智能体及相关评估指标,通过时间转换机制与预规划器实现决策质量与响应能力的平衡。

Comments Accepted by the CVPR 2025 Embodied AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22256 2026-08-07 cs.SE cs.AI 版本更新 70%

Agentic Software Issue Resolution with Large Language Models: A Survey

基于大语言模型的代理软件问题解决:综述

Zhonghao Jiang, David Lo, Zhongxin Liu

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡管理大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文综述了基于大语言模型的代理软件问题解决的最新研究,探讨了其方法、挑战及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03589 2026-08-06 cs.DB cs.LG 版本更新 70%

stratum: A System Infrastructure for Massive Agent-Centric ML Workloads

stratum: 一种支持大规模基于代理的机器学习工作负载的系统基础设施

Arnab Phani, Elias Strauss, Sebastian Schelter

机构 * BIFOLD & TU Berlin(BIFOLD与柏林技术大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 stratum是一种支持大规模基于代理的机器学习工作负载的系统基础设施,通过解耦流水线执行与规划推理,提升大规模代理流水线搜索效率。

Comments Accepted at PVLDB 2026 (Vol. 19, No. 11). Artifact available on GitHub

Journal ref Proc. VLDB Endow. 19(11): 3799-3806, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23590 2026-08-04 cs.AI 版本更新 70%

Co-ReAct: Rubrics as Step-Level Collaborators for ReAct Agents

Co-ReAct:作为ReAct智能体逐步协作者的评分准则

Jiazheng Kang, Bowen Zhang, Zixin Song, Jiangwang Chen, Xiao Yang, Da Zhu, Guanjun Jiang

机构 * Qwen Applications Business Group of Alibaba(阿里巴巴文勤应用业务组) Tsinghua University(清华大学)

专题命中 规划推理 :reasoning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 提出Co-ReAct框架,通过训练专用评分准则生成器,在推理时逐步指导ReAct智能体的行动选择,显著提升搜索密集型多步推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏