arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-09-01 至 2026-09-01 共收录 481 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 115 篇

2608.04420 2026-09-01 cs.RO 版本更新 82%

SCOPE: Field-of-View-Aware Path Planning in Unknown Space via Safety-Volume Certification

SCOPE:通过安全体积认证在未知三维环境中感知视场的路径规划

Junbin Yuan, Muqing Cao, Yunwoo Lee, Brady Moon, Sebastian Scherer

机构 * Carnegie Mellon University(卡内基梅隆大学) Brigham Young University(杨百翰大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 SCOPE是一种在未知3D环境中规划路径的框架,通过安全体积认证实现视场感知,可到达所有目标、减少任务时间,真实机器人演示验证其有效性。

Comments Project website: https://yuanjunbin.github.io/scope-planner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14602 2026-09-01 cs.CL cs.AI cs.LG 版本更新 82%

PA3: Policy-Aware Agent Alignment through Chain-of-Thought

PA3: 通过链式推理实现政策感知的智能体对齐

Shubhashis Roy Dipta, Daniel Bis, Kun Zhou, Lichao Wang, Benjamin Z. Yao, Chenlei Guo, Ruhi Sarikaya

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) Amazon Alexa AI(亚马逊Alexa AI)

专题命中 规划决策 :agent(title);tool-use(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出一种多阶段对齐方法,通过链式推理让模型在推理时回忆并应用相关业务政策,无需在上下文中包含完整政策,同时引入PolicyRecall奖励和hallucination惩罚,提升性能并减少字数。

Comments Accepted to EMNLP 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14252 2026-09-01 cs.RO cs.AI cs.CL 版本更新 82%

MEMORA: Embodied Action Memory from Egocentric Videos for Reasoning and Planning

MEMORA:基于自我中心视频的具身动作记忆用于推理与规划

Zihao Yu, Xiu Yuan, Chongjie Zhang

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL

AI总结 研究针对长期机器人规划中对具身经验记忆的需求,提出MEMORA方法,通过形成-巩固-检索生命周期及四种类型存储实现具身动作记忆,经实验评估取得良好结果,能为机器人规划提供记忆上下文。

Comments 50 pages. v1: Oral presentation at the Robotics: Science and Systems 2026 Workshop on Foundation Models for Robot Planning (FM4RoboPlan). v2: Accepted to the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23491 2026-09-01 cs.CV cs.CL 版本更新 81%

PlanCraft: Sketch, Refine, and Furnish for Architect-Inspired Progressive 3D Residential Scene Generation

PlanCraft:用于受建筑师启发的渐进式3D住宅场景生成的草图绘制、细化和布置

Pengyu Zeng, Yuqin Dai, Jun Yin, Ziyang Han, Ng Cheuk Hei, Jing Zhong, Chaoyang Shi, ZhanXiang Jin, Maowei Jiang, Shuai Lu

专题命中 规划决策 :agent(summary_cn,abstract);分类 cs.CL

AI总结 研究针对自动住宅平面图生成中忽视的设计渐进性及二维平面图重要性问题,提出PlanCraft,通过SketchPlan提供训练信号,PlanCraft-Diff细化草图,PlanCraft-Agent布置场景,实验显示其在FID及空间合理性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29434 2026-09-01 cs.LG cs.AI cs.CV 新提交 81%

Does Latent Planning Survive Point Clouds? Action-Conditioned JEPA World Models for Geometric Observations

潜在规划在点云场景中是否可行?面向几何观测的动作条件JEPA世界模型

Fabio F. Oberweger, Michael Schwingshackl

机构 * AIT Austrian Institute of Technology(奥地利技术研究所) Assistive & Autonomous Systems(辅助与自主系统)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究将JEPA模型扩展至点云场景,验证了三种JEPA设计可在点云规划中有效工作,其中动作敏感型模型表现最优,还实现了无需目标观测的3D目标接口构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31077 2026-09-01 cs.AI 新提交 79%

Reconciling Process Supervision with Outcome-Based Credit in Agentic Policy Optimization

协调过程监督与智能体策略优化中基于结果的信用分配

Jingxiao Yang, Wangjie Gan, Yingxuan Zhuang, Wenqi Zhang, Jintao Chen, Xuhong Zhang

机构 * Zhejiang University(浙江大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 针对智能体策略优化中监督与信用分配的差距,提出 TASPO 方法,通过聚合特权信息的动作级似然变化分配结果信用,在三个基准上较 GRPO 提升 10.6% 且泛化性更好。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30250 2026-09-01 cs.AI 新提交 79%

Generating Workflow DAGs from Natural Language with Non-Reasoning LLMs

用非推理型大语言模型从自然语言生成工作流有向无环图(DAG)

Anand Iyer, Bhanu Khetharpal, Srinivas Upadhya, Ramkumar Rajagopal

机构 * Microsoft(微软公司)

专题命中 规划决策 :workflow(title,abstract);分类 cs.AI

AI总结 本文针对企业联络中心自然语言路由转工作流DAG问题,用神经符号分解结合确定性编译器,提升非推理LLM生成质量,在GPT-5.3-chat上与推理模型质量统计等价。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29880 2026-09-01 cs.AI cs.MM 新提交 79%

Perceive to Hypothesize, Verify to Ground: An Agentic Reasoning Framework for Open-World Geo-Localization

感知以假设,验证以落地:面向开放世界地理定位的智能体推理框架

Yutian Jiang, Ruijie Li, Sisuo Lyu, Xixuan Hao, Qingxiang Liu, Yongzi Yu, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 本研究针对开放世界地理定位的感知幻觉与上下文漂移问题,提出双层智能体框架GeoPAVE,并引入含完整推理轨迹的新型数据集PAVED,以提升地理定位的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29622 2026-09-01 cs.MA cs.AI 新提交 79%

AgenticRag-R1: Agentic Reinforcement Learning with Stack Memory for Multi-Step Reasoning, Retrieval and Memorizing

AgenticRag-R1:用于多步推理、检索与记忆的带栈式记忆的智能体强化学习

Xinke Jiang, Yue Fang, Zhibang Yang, Jiaran Gao, Zhixin Zhang, Tao Feng, Rihong Qiu, Wentao Zhang, Hongxin Ding, Ruizhe Zhang, Yongxin Xu, Yuheng Huang, Xu Chu, Junfeng Zhao, Yasha Wang

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 针对现有智能体RAG方法的奖励分配弱、偏向短程推理等问题,提出AgenticRag-R1框架,通过记忆栈等实现长程学习,在多类基准上性能优于强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19842 2026-09-01 cs.AI 版本更新 79%

SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning

SAPO:用于智能体强化学习的单回滚自回归策略优化

Dayang Liang, Lang Feng, Bo An, Yunlong Liu

机构 * Xiamen University(厦门大学) Nanyang Technological University(南洋理工大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 本研究针对智能体强化学习现有方法的三大局限,提出SAPO框架,其共享策略与价值函数的自回归主干,结合广义优势估计器,在ALFWorld、WebShop任务上性能优于PPO和GRPO,内存与计算效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18682 2026-09-01 cs.AI 版本更新 79%

RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training

RTPO:用于稳定智能体强化学习训练的反向回合策略优化

Yugu Li, Zehong Cao, Jianglin Qiao, Siyi Hu

机构 * Adelaide University(阿德莱德大学) The University of Sydney(悉尼大学) Curtin University(科廷大学) School of CSIT(计算机科学与信息技术学院) ACFR(澳大利亚空间研究中心) School of EECMS(电子工程、计算机与数学科学学院)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 针对多回合智能体RL训练不稳定问题,提出RTPO方法,通过反向回合策略优化消除上下文不匹配与异步漂移,实验显示其较基线提升21.50%、10.76%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06714 2026-09-01 cs.AI 版本更新 79%

The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows

优化器即智能体:跨提示、程序与机器学习工作流的推理驱动搜索

Junbo Li, Boyi Liu, Canwen Xu, Yite Wang, Yuxiong He, Zhangyang Wang, Qiang Liu, Zhewei Yao

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Snowflake(思诺飞克公司)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 该研究提出ReASearch统一框架,让智能体自主优化提示、程序与ML工作流,在14项任务中优于专用系统,部分发现超人类最佳结果的方案。

Journal ref COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01113 2026-09-01 cs.CL 版本更新 79%

CARE: Privacy-Compliant Agentic Reasoning with Evidence Discordance

CARE:具有证据不一致性的隐私合规代理推理

Haochen Liu, Weien Li, Rui Song, Zeyu Li, Chun Jason Xue, Xiao-Yang Liu, Sam Nallaperuma-Herzberg, Xue Liu, Ye Yuan

机构 * University of Cambridge(剑桥大学) McGill University(麦吉尔大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Columbia University(哥伦比亚大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 规划决策 :agentic(title,abstract);分类 cs.CL

AI总结 针对医疗领域中症状与体征矛盾的问题,CARE框架通过多阶段隐私合规的代理推理,在不访问敏感数据的情况下提升冲突证据处理能力。

Comments Accepted as a Findings paper at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31082 2026-09-01 cs.AI cs.CL cs.DB 新提交 79%

Token-Efficient Data Reasoning Agents via Adaptive Structuring of Unstructured Data

通过非结构化数据的自适应结构化实现 token 高效的数据推理智能体

Milad Rezaei Hajidehi, Qitong Wang, Stratos Idreos

机构 * Harvard University(哈佛大学)

专题命中 规划决策 :agentic(abstract,abstract_cn);agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出智能体数据拆解方法,通过自适应推测性结构化非结构化数据,降低 LLM 智能体推理成本,在 FanOutQA 基准上实现 53% 的成本削减且保持准确率,为智能体推理数据基础设施提供了初步方案。

Comments 7 Pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28704 2026-09-01 cs.AI cs.LG 新提交 79%

ORDDAR: Observation-Driven Reasoning for Distortion-Resilient Decision, Action, and Cognitive Recovery

ORDDAR:面向抗失真决策、行动与认知恢复的观测驱动推理

Deblina Kar, Anant Nawalgaria, Shyamal Kumar Das Mandal

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡拉格普尔分校) Google Research(谷歌研究院)

专题命中 规划决策 :AI agent(abstract);tool use(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出ORDDAR推理框架,通过局部认知状态转换检测、失真定位与针对性修复,提升了多类推理任务的质量、恢复能力与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08747 2026-09-01 cs.CL cs.AI 版本更新 79%

To Retrieve or To Think? Cross-Boundary Context Evolution for Multi-hop Complex Reasoning

是检索还是思考?一种情境演化的代理方法

Rubing Chen, Jian Wang, Wenjie Li, Xiao-Yong Wei, Qing Li

机构 * Department of Computing, The Hong Kong Polytechnic University(计算系,香港理工大学)

专题命中 规划决策 :agentic(summary_cn,abstract_cn);分类 cs.AI、cs.CL

AI总结 本文提出Agentic Context Evolution (ACE)方法,通过代理动态决策在检索与推理间切换,提升知识密集型任务的生成效率与准确性。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29949 2026-09-01 eess.SY cs.SY 新提交 78%

Integrated Transmission and Distribution Expansion Planning Considering Customer Actions and Distributed Energy Resources

考虑用户行为与分布式能源资源的输配电协同扩展规划

Abhinav Ayri, Haotian Yao, Mostafa Farrokhabadi, Hamidreza Zareipour

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出多步骤框架,将协同规划、成本分配与零售商模型结合,在36节点系统验证,纳入用户决策可降低输配电系统总成本、减少输电侧发电依赖,支撑更实际的规划。

Comments 5 pages, 5 figures 5 equations, accepted for presentation at the CIGRE Energy conference happening on September 21 to September 24 in Calgary, Alberta, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29770 2026-09-01 cs.RO 新提交 78%

Sampling-based Certified Planning with Graphs of Convex Sets

基于凸集图的采样式可保证规划

Peng Xie, Amr Alanwar

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 该研究针对凸集图规划器的无碰撞验证缺陷,构建了可自验证的采样式规划器,在14自由度双臂任务中实现零无效答案,效率与正确性均优于参考规划器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29359 2026-09-01 eess.SY cs.SY 新提交 78%

Minimizing Grid Interconnection Capacity Requirements for AI Data Centers: A Developer-Side Planning Framework with Onsite Resources and Workload Flexibility

最小化AI数据中心的电网互连容量需求:一种结合现场资源与工作负载灵活性的开发者侧规划框架

Hassan Zahid Butt, Rida Fatima, Xingpeng Li

专题命中 规划决策 :planning(title,abstract)

AI总结 本文开发ICP-AI框架,在规定预算下最小化AI数据中心的电网互连容量,结合PV、BESS资源与灵活工作负载调度,通过实验验证其可有效减少互连容量,为项目规划提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29108 2026-09-01 cs.RO 新提交 78%

From Multi-Modal Paths to Executable Trajectories: A Trajectory Planning Framework for 4WIS Robots

从多模态路径到可执行轨迹:面向四轮独立转向(4WIS)机器人的轨迹规划框架

Runjiao Bao, Lin Zhang, Yongkang Xu, Shoukun Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Beijing Institute of Technology(北京理工大学) Shenzhen Research Institute of Nankai University(南开大学深圳研究院)

专题命中 规划决策 :planning(title,abstract)

AI总结 针对4WIS机器人现有规划方法无法充分利用其多模态能力的问题,提出结合模式增强前端搜索与模式一致后端优化的轨迹规划框架,实验验证了其综合性能与实际可执行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07264 2026-09-01 eess.AS 版本更新 78%

VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track

VISA:面向Interspeech 2026 ARC智能体赛道的视觉信息增强音频推理系统

Wenming Tu, Jian Gao, Yanru Huo, Yixuan Wang, Jing Peng, Bohan Li, Ziyang Ma, Tao Liu, Shuai Fan, Kai Yu, Xie Chen, Zilong Zheng

专题命中 规划决策 :agent(title,abstract)

AI总结 提出VISA系统,通过多模态特征提取、模型投票推理和细粒度类别感知路由,增强大音频语言模型的音频推理能力,在ARC智能体赛道取得66.23%评分和77.40%准确率。

Comments INTERSPEECH 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21188 2026-09-01 cs.RO 版本更新 78%

A Terrain-Adaptive epsilon-Constraint MPC for Uneven Terrain Kinodynamic Planning

一种适应地形的epsilon约束MPC用于不规则地形运动动力学规划

Otobong Jerome, Geesara Kalathunga, Tiago Nascimento

机构 * Laboratório de Engenharia de Sistemas e Robótica, Universidade Federal da Paraíba(系统与机器人工程实验室,帕拉伊巴联邦大学) School of Computer Science, University of Lincoln(计算机科学学院,林肯大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出了一种适应地形的epsilon约束MPC方法,用于解决车辆在不规则地形上同时优化路径效率和姿态稳定性的规划问题,通过动态调整epsilon界限来实时探索帕累托前沿,并通过半参数模型结合分析车辆动力学和稀疏高斯过程来捕捉车辆-地形动力学。

Journal ref O. Jerome, G. Kulathunga and T. Nascimento,(2026), IEEE Robotics and Automation Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23295 2026-09-01 cs.CV 版本更新 78%

Mamba-driven MRI-to-CT Synthesis for MRI-only Radiotherapy Planning

基于Mamba的MRI到CT合成用于仅MRI的放疗计划

Konstantinos Barmpounakis, Theodoros P. Vagenas, Maria Vakalopoulou, George K. Matsopoulos

机构 * School of Electrical Computer Engineering, National Technical University of Athens Archimedes, Athena Research Center CentraleSup\'elec, University of Paris-Saclay

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出基于Mamba架构的MRI到CT合成方法,以提高跨模态翻译的准确性与效率,通过3D Mamba架构捕捉复杂体积特征和长距离依赖,实现快速且精确的CT合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15872 2026-09-01 cs.CL 版本更新 77%

SciOrch: Learning to Orchestrate Expert LLMs for Solving Frontier Multimodal Scientific Reasoning Tasks

SciOrch: 学习编排专家大语言模型以解决前沿多模态科学推理任务

Jingru Guo, Xiangyuan Xue, Lian Zhang, Wanghan Xu, Siki Chen, Philip Torr, Wanli Ouyang, Lei Bai, Zhenfei Yin

机构 * Imperial College London(伦敦帝国学院) The Chinese University of Hong Kong(香港中文大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Oxford(牛津大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 规划决策 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.CL

AI总结 提出SciOrch框架,训练轻量级8B模型编排多个前沿大语言模型,通过MCTS和GRPO优化,在科学推理任务上超越最强单模型和多智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29644 2026-09-01 cs.CV cs.AI cs.CL 新提交 76%

Conducting Stylistic Analysis of Paintings through an Art-History Agent

通过艺术史智能体开展绘画的风格分析

Marc S. Walton, Astrid Harth

专题命中 规划决策 :agent(title);分类 cs.AI、cs.CL

AI总结 该研究提出一种结合视觉Transformer与大型语言模型的艺术史智能体框架,可自动化绘画风格分析,弥合AI概率分类与艺术史风格分析间的方法学鸿沟,推动计算艺术史发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29563 2026-09-01 cs.LG cs.AI cs.HC 新提交 76%

HoopMind: A Real-Time Neural Game-Tree System for Opponent-Aware Possession Planning

HoopMind:用于感知对手的控球规划的实时神经博弈树系统

Yibo Gong, Cong Guo, Jiacheng Ding

机构 * Beijing National Day School(北京十一学校) University of Memphis(孟菲斯大学)

专题命中 规划决策 :planning(title);分类 cs.AI、cs.LG

AI总结 该研究以职业篮球为案例,融合公开数据构建投篮数据集,提出基于ShotNet和深度受限期望最大化搜索的实时神经博弈树系统,实现对手感知的控球规划,相关模型性能优于基线且可在浏览器运行。

Comments 5 pages, 5 figures, 2 tables, 2 algorithms. Submitted to the IEEE ICDM 2026 Teen Research Symposium. Code and live demo: https://github.com/sujo666/hoopmind

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25723 2026-09-01 cs.LG cs.AI 版本更新 76%

It's a matter of timescale: non-linear utility in successor features and multi-objective planning and learning

这是一个时间尺度问题:后继特征与多目标规划和学习中的非线性效用

Liam P. H. Mertens, Lucas N. Alegre, Florent Delgrange, Diederik M. Roijers, Ann Nowé, Peter Vamplew

机构 * AI Lab, Vrije Universiteit Brussel(布鲁塞尔自由大学AI实验室) Institute of Informatics - Federal University of Rio Grande do Sul(南大河州联邦大学信息学研究所) Federation University Australia(澳大利亚联邦大学)

专题命中 规划决策 :planning(title);分类 cs.AI、cs.LG

AI总结 本文针对多目标强化学习及后继特征方法未考虑同一决策问题中不同时间尺度非线性效用效应的不足,通过示例论证后提出新视角,指出相关研究存在显著空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09600 2026-09-01 cs.AI cs.CL 版本更新 76%

Agora: Enhancing LLM Agent Reasoning Via Auction-Based Task Allocation

Agora:通过基于拍卖的任务分配增强大语言模型智能体推理

Kaiji Zhou, Aleš Leonardis, Yue Feng

机构 * University of Birmingham(伯明翰大学)

专题命中 规划决策 :agent(title);分类 cs.AI、cs.CL

AI总结 研究旨在增强LLM智能体推理能力,提出Agora框架,通过基于拍卖的机制动态分配任务,将推理步骤视为可交易项目让智能体依纠正能力投标,实验表明该框架在多基准测试中表现优且能实现成本-质量权衡。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04574 2026-09-01 cs.LG cs.AI 版本更新 76%

A Few Teacher Steps Go a Long Way: Cost-Efficient On-Policy Data Augmentation for Agent Post-Training

教师的少量步骤作用显著:智能体训练后基于策略的数据增强的成本效益

Junze Ye, Jiayi Cheng, Miao Lu, Michal Mankowski, Jose Blanchet, Mohsen Bayati

机构 * Stanford University(斯坦福大学) New York University(纽约大学)

专题命中 规划决策 :agent(title);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型智能体,将基于策略的数据构建视为预算分配问题,通过特定方式形式化设计空间,在多个任务中实验表明少量教师步骤在学习者诱导情境下更具成本效益。

Comments 8/28 update: added funding acknowledgements

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05922 2026-09-01 cs.AI cs.CL cs.LG 版本更新 75%

Evolving Agents in the Dark: Retrospective Harness Optimization via Self-Preference

回顾性工具优化:通过轨迹回滚上的自我偏好改进LLM智能体

Wenbo Pan, Shujie Liu, Chin-Yew Lin, Jingying Zeng, Xianfeng Tang, Xiangyang Zhou, Yan Lu, Xiaohua Jia

机构 * City University of Hong Kong(香港城市大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出一种自监督方法RHO,利用历史轨迹回滚和自偏好选择优化智能体工具集,无需真实标签,在SWE-Bench Pro上通过单轮优化将通过率从59%提升至78%。

Comments Accepted to EMNLP 2026 (Findings). Code: https://github.com/wbopan/retro-harness ; Project website: https://paper-rho.wenbo.io

详情

展开后加载摘要…

URL PDF HTML 收藏