arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1968 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 1968 篇

2607.21354 2026-07-24 cs.AI 新提交 79%

SPORD: A Simulation-Propose-then-OR-Dispose Approach for Supply Chain Planning

SPORD:一种用于供应链规划的模拟-提出-然后-优化-处置方法

Jiayin He, Yutong Pan, Sen Yang, Ningxuan Kang, Yongzhi Qi, Jianshen Zhang, Wei Qi, Zuo-Jun Max Shen

机构 * Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) College of Engineering, UC Berkeley(加州大学伯克利分校工程学院) Faculty of Business and Economics, University of Hong Kong(香港大学经管学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 针对电商供应链规划中孤立项目及面临的难题,提出模拟-提出-然后-优化-处置方法(SPORD)及NetSim平台,通过解耦实现加速模拟与操作闭环,应用后提升服务质量、降低履约率并实现碳减排,推动模拟用于主动规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21209 2026-07-24 cs.LO cs.AI 新提交 79%

Explainability Framework for Policy-Aware Autonomous Agents

策略感知自主智能体的可解释性框架

Heather Merhout, Daniela Inclezan

机构 * Miami University(迈阿密大学)

专题命中 规划决策 :autonomous agent(title);agent(abstract);分类 cs.AI

AI总结 针对策略感知自主智能体,借鉴社会科学见解,用回答集编程语言结合Python实现可解释性框架,利用违反策略的惩罚创建对比性解释,并通过调查评估框架。

Comments In Proceedings ICLP 2026, arXiv:2607.17707

Journal ref EPTCS 450, 2026, pp. 515-528

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20289 2026-07-23 cs.RO cs.AI 新提交 79%

Courteous Anticipation: Improving Long-Lived Task Planning in Persistent Shared Environments

礼貌预期:改善持久共享环境中的长期任务规划

Md Ridwan Hossain Talukder, Roshan Dhakal, Elizabeth Phillips, Gregory J. Stein

机构 * George Mason University(乔治梅森大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 研究共享持久环境中机器人任务规划问题,提出礼貌预期规划方法,基于模型规划器联合最小化即时成本与预期未来成本,经独立估计器估计,在家庭和餐厅环境实验中相比其他规划降低了任务序列总成本。

Comments 9 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19306 2026-07-22 cs.RO cs.AI cs.CV cs.SY eess.SY 新提交 79%

From Distances to Trajectories: Real-Time Signed Distance Function Mapping and Distance-Accelerated Motion Planning for UAVs

从距离到轨迹:无人机的实时带符号距离函数映射与距离加速运动规划

Jason Stanley, Zhirui Dai, Qihao Qian, Tzu-Chin Ho, Tianxing Fan, Siddharth Saha, Christopher Barngrover, Ki Myung Brian Lee, Nikolay Atanasov

机构 * UC San Diego(加州大学圣地亚哥分校) Shield AI(护盾人工智能公司)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 研究针对无人机在杂乱环境中的自主飞行,提出围绕带符号距离函数协同设计映射与规划阶段。开发OREN重建SDF,Bubble$^\star$基于距离信息规划,减少碰撞检查。集成方法在四旋翼飞行器上实时导航,提升SDF估计并快速找到长轨迹。

Comments 25 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18347 2026-07-22 cs.SE cs.CR cs.MA 新提交 79%

A Decision-Centered Reference Architecture for Trustworthy Agentic Commerce

用于可信代理商务的以决策为中心的参考架构

Dimitrios S. Sfiris

专题命中 规划决策 :agentic(title,abstract);分类 cs.SE

AI总结 研究针对代理商务问题,提出以决策为中心的与协议无关的架构,含规范信封等多种机制,通过开源实现、多场景和消融评估,支持受保护依赖项检测等多项功能,但未涵盖部分关键特性。

Comments 23 pages, 3 figures. Includes ancillary reproducibility materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17973 2026-07-21 cs.AI 新提交 79%

SAGE: Subgoal-Conditioned Action Generation for Latent World Model Planning

SAGE:用于潜在世界模型规划的子目标条件动作生成

Letian Cheng, Qi Zhang, Yisen Wang

机构 * Peking University(北京大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 研究潜在世界模型规划中提议质量受限问题,提出先验条件规划器,利用目标条件生成器预测潜在子目标,结合不同时长子目标作先验,实验证明该方法显著提升长期规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17710 2026-07-21 cs.LG 新提交 79%

Planning with Transformers: Chain of Computation and Structured Context Windows

使用Transformer进行规划:计算链与结构化上下文窗口

Ehsan Futuhi, Nathan R. Sturtevant

机构 * Department of Computing Science, University of Alberta(阿尔伯塔大学计算科学系) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 研究大语言模型解决规划问题的不足,提出计算链架构,利用结构化上下文窗口,让语言模型学习规划策略、预测世界模型并执行算术运算,在多个任务上取得高成功率,能解决复杂汉诺塔问题且减少训练数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16109 2026-07-20 cs.LG cs.DC cs.MA 新提交 79%

The Honest Quorum Problem: Epistemic Byzantine Fault Tolerance for Agentic Infrastructure

诚实仲裁问题:智能基础设施的认知拜占庭容错

Jun He, Deying Yu

专题命中 规划决策 :agentic(title,abstract);分类 cs.LG

AI总结 研究智能基础设施中因推理错误导致的诚实仲裁问题,定义认知拜占庭容错(EBFT)模型,用两个量增强传统拜占庭故障界限,推导相关仲裁阈值条件及校准方法,指出添加代理提高容错的条件。

Comments 26 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15544 2026-07-20 cs.CL 新提交 79%

EpiNarrate: Agentic Generation of Grounded Narratives from Epidemiological Scenario Projections

EpiNarrate:基于流行病学情景预测的有智能体的叙事生成

Rituparna Datta, Srini Venkatramanan, Bryan L. Lewis, Yiqi Su, Harry Hochheiser, Lucie Contamin, Parantapa Bhattacharya, Naren Ramakrishnan, Anil Vullikanti

机构 * University of Virginia(弗吉尼亚大学) Biocomplexity Institute(生物复杂性研究所) Virginia Tech(弗吉尼亚理工大学) University of Pittsburgh(匹兹堡大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.CL

AI总结 研究旨在生成公共卫生叙事,提出EpiNarrate框架,将数值推理与自然语言生成分离,通过提取情景轴、构建数据集等步骤,经实验验证该模型能生成事实依据更充分、覆盖范围更广且风格类似专家报告的叙事。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13965 2026-07-16 cs.SE cs.CR 新提交 79%

ProfMalPlus: Agent-Coordinated Detection of Malicious NPM Packages via Static-Dynamic Analysis Synergy

ProfMalPlus:通过静态-动态分析协同实现代理协调检测恶意NPM包

Yiheng Huang, Zhijia Zhao, Bihuan Chen, Susheng Wu, Zhuotong Zhou, Yiheng Cao, Kun Hu, Xin Hu, Xin Peng

专题命中 规划决策 :agent(title,abstract);分类 cs.SE

AI总结 研究针对NPM包恶意代码检测问题,提出ProfMalPlus,结合对象敏感行为图与大语言模型推理,经多步骤提取安全切片并评估,对不确定情况增强证据后再评估,最终定位恶意代码,F1分数高且发现多个未知恶意包,性能优于现有检测器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13054 2026-07-16 cs.RO cs.AI 新提交 79%

Autonomous UAV Route Planning for Coverage Maximization in Environmental Monitoring: A Systematic Literature Review

环境监测中用于最大化覆盖的无人机自主路径规划:一项系统文献综述

Sebastian Jouannet-Contreras, Carola Figueroa-Flores

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 该文献综述聚焦无人机环境监测的自主路径规划,遵循PRISMA 2020框架搜索相关研究。介绍筛选流程与初步分析结果,指出研究集中在特定方面,多依赖模拟验证,近期对强化学习等兴趣上升,凸显研究活跃但分散,需结构化综合以明确技术与差距。

Comments Accepted in CLEI 2026

Journal ref CLEI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12177 2026-07-15 cs.AI cs.CV 新提交 79%

The Emerging Paradigm of Geospatial Foundation Models: From Pre-Training to Agentic Reasoning

地理空间基础模型的新兴范式:从预训练到智能推理

Shelley Cazares

机构 * Google Public Sector(谷歌公共部门)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 研究地理空间基础模型的新兴范式,通过职责分离实现预训练与特定任务微调,探讨不同类型模型能力及实现考虑因素,提出模型适应策略分类法和框架,展望智能地理空间推理推动领域从感知到认知的发展。

Comments 18 pages, 4 figures. To appear in Lecture Notes in Computer Science (LNCS)

Journal ref Lecture Notes in Computer Science, Vol. 16446 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12122 2026-07-15 cs.LG 新提交 79%

An Agentic AI Scientific Community for Automated Neural Operator Discovery

用于自动神经算子发现的智能体人工智能科学社区

Luis Loo, Ulisses Braga-Neto

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.LG

AI总结 该研究基于人工智能科学社区提出智能体方法用于自动神经算子发现,通过虚拟实验室中三个智能体协作,共享通用词汇表,在五个问题上评估,能发现高精度低参数架构,揭示语言模型智能体对保持多样性的作用及神经算子无免费午餐定理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11358 2026-07-14 cs.CL 新提交 79%

RefineEvo: Planning-Guided Heuristic Evolution with Bidirectional Experience

RefineEvo:基于双向经验的规划引导启发式进化

Yang Wu, Junran Pan, Yifan Zhang, Ning Xu, Fanshuo Zeng, Jian Cheng

机构 * C$^2$DL, Institute of Automation, Chinese Academy of Sciences(C2DL,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing(人工智能学院,中国科学院大学,北京) University of Chinese Academy of Sciences, Nanjing(中国科学院大学,南京)

专题命中 规划决策 :planning(title,abstract);分类 cs.CL

AI总结 针对自动启发式设计中基于LLM方法的不足,提出RefineEvo框架,通过规划器和反射器,结合双向经验池动态调度进化算子,在经典组合优化基准测试中表现出色,提升了解质量和令牌效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11004 2026-07-14 cs.RO cs.AI 新提交 79%

Affordance-Based Manipulation Planning with Text Goals and Sim-to-Real Generalisation via Real-to-Sim Image Conversion

基于文本目标和通过实到模拟图像转换实现从模拟到现实泛化的基于可供性的操纵规划

Solvi Arnold, Rin Karashima, Tadashi Adachi, Takafumi Mochizuki, Kimitoshi Yamazaki

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 该研究提出基于可供性识别与动作效果预测的操纵规划系统,通过多模态目标匹配模块评估候选计划,能跟踪遮挡物体位置。还用图像转换模块辅助,分别评估模块性能并展示集成系统在模拟与硬件上的规划能力。

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10811 2026-07-14 cs.MA cs.AI 新提交 79%

Distributed Agent System: Fault-Tolerant Collaboration Among Embodied Agents

分布式智能体系统:具身智能体间的容错协作

Kai Yu, Lu Chen, Hanqi Li

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 针对人工智能工程中智能体驱动任务执行面临的可靠性挑战,提出分布式智能体系统(DAS)框架,重新定义智能体可靠性,构建两层容错架构,为工业场景中异构具身智能体可靠协作提供实用工程途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10651 2026-07-14 cs.AI 新提交 79%

Embark Now: User Demand Oriented Framework for Multi-day Urban Travel Itinerary Planning

即刻出发:面向多日城市旅行行程规划的用户需求导向框架

Rongbo Qi, Yaqi Zhang, Shijun Yan, Xuemeng Liu, Xiangrui Cai, Chunyao Song

机构 * Jiangxi Normal University(江西师范大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 针对大城市多日旅行行程规划难题,提出集成大语言模型与增强GRASP算法的框架,经实验验证其在行程质量和计算效率上显著优于现有方法,能动态满足多样用户需求。

Comments 37 pages, 16 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10649 2026-07-14 cs.RO cs.AI 新提交 79%

Coverage Path Planning: Classical Foundations, Recent Advances, and Future Directions

覆盖路径规划:经典基础、最新进展与未来方向

Zongyuan Shen, Shalabh Gupta, Shancheng Zhao, Dehua Zhou, Gao Wang, Zhongqiang Ren, Yaming Ou, Yikui Zhai, C. L. Philip Chen

机构 * College of Information Science and Technology, Jinan University(暨南大学信息科学技术学院) Department of Electrical and Computer Engineering, University of Connecticut(康涅狄格大学电气与计算机工程系) Global College, Shanghai Jiao Tong University(上海交通大学密西根学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Electronics and Information Engineering, Wuyi University(五邑大学电子与信息工程学院) School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文全面综述2015至2026年125篇覆盖路径规划(CPP)代表性作品,结合经典方法展示其演变。CPP方法分六类,总结各类规划公式、算法等,分析相关因素对问题的塑造,讨论开放挑战,提供了发展概况与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10565 2026-07-14 cs.RO cs.LG 新提交 79%

BucketKD: A Safety-Aware Bucket-Based Knowledge Distillation Framework for End-to-End Motion Planning

BucketKD:用于端到端运动规划的基于桶的安全感知知识蒸馏框架

Md Nahidul Islam, Mohd Hasan Ali, Dipankar Dasgupta, Myounggyu Won

机构 * University of Memphis(孟菲斯大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 针对端到端运动规划模型规模大难在资源受限平台部署的问题,提出BucketKD框架。该框架将关键环境变量离散化,并设计安全感知航路点注意力机制。实验表明,其在规划精度、安全性及压缩率方面表现出色,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09755 2026-07-14 cs.AI 新提交 79%

LegalFarePlan: A Label-Setting Framework for Fare-Transparent Urban Rail Route Planning under Non-Additive Fare Rules

LegalFarePlan:非加法票价规则下票价透明的城市轨道交通线路规划标签设定框架

Tanghui Li

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 研究非加法票价规则下城市轨道交通线路规划问题,提出LegalFarePlan框架,将合法进出站建模为约束条件,通过多种算法实现可解释线路规划,在半合成基准测试中取得一定票价降低成果,展示方法行为与可重复性。

Comments 6 pages, 4 tables; author preprint version, not the conference camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09092 2026-07-13 cs.CL 新提交 79%

AgentKGV: Agentic LLM-RAG Framework with Two-Stage Training for the Fact Verification of Knowledge Graphs

AgentKGV:用于知识图谱事实验证的两阶段训练的智能语言模型-检索增强生成框架

Yumin Heo, Hyeon-gu Lee, Sumin Seo, Youngjoong Ko

机构 * SungKyunKwan University(成均馆大学) NAVER(纳维)

专题命中 规划决策 :agentic(title,abstract);分类 cs.CL

AI总结 针对知识图谱事实错误验证难题,提出AgentKGV框架,集成动态路由等处理表面形式不匹配。引入两阶段训练策略,在开放域T-REx基准上,该框架提升了宏观F1,减少搜索调用次数,提高了验证准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09076 2026-07-13 cs.AI 新提交 79%

Neuro-Agentic Control: A Deep Learning-based LLM-Powered Agentic AI Framework for Controlling Security Controls

神经代理控制:一种基于深度学习的由大型语言模型驱动的用于控制安全控制的代理人工智能框架

Saroj Gopali, Bipin Chhetri, Deepika Giri, Sima Siami-Namini, Akbar Siami Namin

机构 * Texas Tech University(德克萨斯理工大学) Cumberland University(坎伯兰大学) Advanced Academic Programs Science(高级学术项目科学部) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 针对运营技术网络攻击问题,提出神经代理控制框架,结合基于LLM的规划器与预训练的TimesFM,并引入“反事实物理注入”机制,在工业数据集评估中表现优于基线,能有效保障关键基础设施中代理人工智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08233 2026-07-10 cs.AI cs.CV 新提交 79%

Playing ZendoWorld: Challenging AI Agents on Active Visual Concept Induction

玩禅道世界:在主动视觉概念归纳中挑战人工智能代理

Sophia Koehler, Antonia Wüst, Inga Ibs, Wasu Top Piriyakulkij, Wolfgang Stammer, Constantin Rothkopf, Kevin Ellis, Kristian Kersting

机构 * AIML Lab, TU Darmstadt(人工智能机器学习实验室,达姆施塔特工业大学) Hessian Center for AI (hessian.AI)(黑森州人工智能中心) Psychology of Information Processing, TU Darmstadt(信息处理心理学,达姆施塔特工业大学) Centre for Cognitive Science, TU Darmstadt(认知科学中心,达姆施塔特工业大学) Cornell University(康奈尔大学) Max Planck Institute for Informatics, SIC(马克斯·普朗克信息学研究所,SIC组) German Center for AI (DFKI)(德国人工智能研究中心)

专题命中 规划决策 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 研究构建智能系统时代理感知、假设形成及实验设计问题,提出禅道世界环境,评估多种代理方法,发现预测标签精度与恢复潜在规则无关,感知和归纳是不同瓶颈,基于视觉语言模型的代理实验无信息,还收集人类数据揭示差距及改进途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07702 2026-07-09 cs.CL 新提交 79%

From Noisy Traces to Root Causes: Structural Trajectory Analysis and Causal Extraction for Agent Optimization

从噪声轨迹到根本原因:用于智能体优化的结构轨迹分析和因果提取

Ying Chang, Jiahang Xu, Xuan Feng, Chenyuan Yang, Peng Cheng, Yuqing Yang

机构 * Microsoft Research(微软研究院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.CL

AI总结 研究针对长期智能体优化中实际执行轨迹难直接用于优化的问题,提出STRACE框架。该框架在批次和轨迹内分别进行故障模式挖掘与因果定位,去除冗余和非因果步骤,实验表明其显著优于基线,提升了智能体优化成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06757 2026-07-09 cs.AI cs.MA 新提交 79%

LLM-powered reasoning in agent-based modeling

基于代理建模中的大语言模型驱动推理

Sifat Afroj Moon, Dakotah Maguire, Adam Spannaus, Joe Tuccillo, Maksudul Alam, Sudip K. Seal, John Gounley, Heidi Hanson

机构 * ORNL(橡树岭国家实验室)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 研究针对传统基于代理建模(ABM)依赖静态先验无法适应实时变化的问题,提出利用大语言模型(LLMs)的可扩展混合代理和语言驱动的流行病(HALE)建模框架,并通过模拟COVID-19验证其可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05359 2026-07-07 cs.AI 新提交 79%

Graph Sparse Sampling: Breaking the Curse of the Horizon in Continuous MDP Planning

图稀疏采样:打破连续MDP规划中的视界诅咒

Idan Lev-Yehudi, Vadim Indelman

机构 * Technion Autonomous Systems Program (TASP), Technion – Israel Institute of Technology(以色列理工学院自主系统计划(TASP),以色列理工学院) Stephen B. Klein Faculty of Aerospace Engineering, Technion – Israel Institute of Technology(以色列理工学院斯蒂芬·B·克莱因航空航天工程学院) Faculty of Data and Decision Sciences, Technion – Israel Institute of Technology(以色列理工学院数据与决策科学学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 针对连续域不确定规划的视界指数增长难题,提出图稀疏采样算法跨决策共享采样未来,得到多项式视界依赖的性能保证,长视界下性能远超树型规划器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05029 2026-07-07 cs.CR cs.AI 新提交 79%

Your Agent's Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses

你的智能体记忆并非其自身所有:针对大语言模型智能体记忆的伪造推理攻击及防御

Neeraj Karamchandani, Piyush Nagasubramaniam, Sencun Zhu, Dinghao Wu

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 研究针对大语言模型智能体记忆伪造推理的攻击,提出FARMA攻击方法,通过规避语言伪造推理痕迹并强化,还引入SENTINEL防御管道,实验表明该防御能有效降低攻击成功率。

Comments Preprint. 10 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04854 2026-07-07 cs.AI 新提交 79%

CARL: Constraint-Aware Reinforcement Learning for Planning with LLMs

CARL:用于大语言模型规划的约束感知强化学习

Qiuyi Qi, Jinjian Zhang, Mutian Bao, Tian Liang, Guocong Li, Dongnan Liu, Wei Zhou, Jie Liu, Ming Kong, Linjian Mo, Feng Zhang, Qiang Zhu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学) College of Artificial Intelligence, Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海高等研究院人工智能学院) School of Earth Sciences, Zhejiang University(浙江大学地球科学学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 研究大语言模型生成违反任务约束计划的问题,提出约束感知强化学习框架CARL,通过比较不同输入下模型输出分布引入奖励,提升模型约束意识,实验证明其优于基线和现有模型。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04242 2026-07-07 cs.AI 新提交 79%

Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning

面向进度和可靠性的智能体强化学习组策略优化

Mingxuan Fan, Peiyang Liu

机构 * Baidu Inc.(百度公司) Peking University(北京大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 研究基于组的强化学习,针对步级优势估计对组形成方式敏感的问题,提出ProGPO方法,通过精确前缀动作比较及结合语义扩展与逆方差融合估计势,在任务中改进了基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04235 2026-07-07 cs.CL 新提交 79%

Spinning Straw into Gold: Relabeling LLM Agent Trajectories in Hindsight for Successful Demonstrations

化腐朽为神奇:事后重新标记大语言模型智能体轨迹以实现成功示范

Zichao Li, Gang Wu, Zichao Wang, Ruiyi Zhang, Wanrong Zhu, Ryan A. Rossi, Vlad I Morariu, Jihyung Kil

机构 * Mila, McGill University(米拉,麦吉尔大学) Adobe Research(Adobe研究院)

专题命中 规划决策 :agent(title,abstract);分类 cs.CL

AI总结 针对大语言模型智能体监督瓶颈,利用智能体展开中隐含的成功目标,引入事后监督学习(HSL),通过辅助大语言模型重新标记轨迹及目标并微调,提出两种技术减轻数据次优性,实验证明其优势。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏