arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 35648 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 35648 篇

2607.18806 2026-07-22 cs.AI cs.CL cs.MA 新提交 84%

AI Tour Meeting: Group Travel Planning by LLM Agents

人工智能旅游会议:基于大语言模型代理的团体旅行规划

Daisuke Kikuta

机构 * NTT, Inc.(日本电报电话公司)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 提出基于大语言模型代理的团体旅行规划框架AI Tour Meeting,通过自然语言讨论找满足约束和偏好的行程,提供相关配置接口实现灵活编排,可作模拟工具,还展示了系统验证等结果以证明其效用。

Comments The code is available at https://github.com/ntt-dkiku/ai-tour-meeting

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18589 2026-07-22 cs.LG cs.AI 新提交 84%

Planning as Emergent Behavior in Reinforcement Learning with Relational Hidden States

关系隐藏状态强化学习中作为涌现行为的规划

Armin Sommer

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究无模型强化学习中规划作为涌现行为的现象,发现神经架构的隐藏状态结构是决定因素,关系隐藏状态网络能获规划机制,恢复环境转移结构并改进策略,解释了涌现规划现象并引发相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17780 2026-07-21 cs.PL cs.AI cs.LG cs.MA 新提交 84%

ETAS: An Effect-Typed Language for Agent Systems

ETAS:一种用于智能体系统的效果类型化语言

Huiri Tan, Yikun Wang, Puyang Zhang, Shangyu Li, Jiasi Shen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究针对智能体系统设计ETAS语言,核心方法是通过规范一致性分配类型并用行为索引跟踪计算,主要贡献是为智能体执行相关推理提供编程语言基础,涵盖授权、非确定性等方面,还实现了该语言并形式化相关性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17225 2026-07-21 cs.SE cs.AI 新提交 84%

Specifying the Delegated-Autonomy Boundary: Requirements Engineering for Agentic AI

指定委托自治边界:智能体人工智能的需求工程

Chetan Arora, Andreas Vogelsang, Abbi Sharma

机构 * Faculty of IT, Monash University(莫纳什大学信息科技学院) University of Duisburg-Essen(杜伊斯堡-埃森大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 研究智能体人工智能系统带来的需求工程问题,提出机构理由记录和智能体委托策略两个互补工件,通过分级建模权限,以医院出院协调智能体和自动代码审查智能体为例阐释框架,解决委托自治边界相关需求工程问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14642 2026-07-17 cs.AI cs.SE 新提交 84%

MCPEvol-Bench: Benchmarking LLM Agent Performance Across Dynamic Evolutions of MCP Servers

MCPEvol-Bench:跨MCP服务器动态演化对大语言模型智能体性能进行基准测试

Huanxi Liu, Kun Hu, Jiaqi Liao, Qiang Wang, Pengfei Qian, YuanZhao Zhai, Dawei Feng, Bo Ding, Huaimin Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) State Key Laboratory of Complex & Critical Software Environment(复杂关键软件环境国家重点实验室) National Key Laboratory of Parallel and Distributed Computing(并行与分布式计算国家重点实验室)

专题命中 规划决策 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 研究针对MCP服务器工具接口和功能持续演化致评估有缺陷的问题,引入MCPEvol-Bench基准测试,提出11种变异算子模拟工具演化,对12个先进大语言模型测试,发现前沿模型也难适应,凸显大语言模型驱动工作流程脆弱性,确立评估标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21005 2026-07-17 cs.AI cs.CL 版本更新 84%

Building Agent Harnesses for Scientific Curation from Multimodal Sources

构建用于多模态来源科学数据提取的智能体框架

Sheng Zhang, Qin Liu, Renqian Luo, Shufang Xie, Reuben Tan, Sean Hayes, Gregory Bryman, Wendong Ge, Ruilian Zhang, Oluwaseun Egbelowo, Kelly Yee, Hoifung Poon

机构 * Microsoft Research(微软研究院) University of California, Davis(加州大学戴维斯分校) Merck & Co., Inc., Rahway, NJ, USA(默克公司(美国新泽西州拉威))

专题命中 规划决策 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 提出Beaver框架,通过任务分解、多模态证据工具和可追溯性,将科学文献中的结构化信息提取转化为可审计的工作流,在GRAS指标上比前沿智能体提升23个绝对百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09175 2026-07-13 cs.AI cs.CL 新提交 84%

Scoped Verification for Reliable Long-Horizon Agentic Context Evolution under Distribution Shift

分布转移下可靠长时代理上下文演化的范围验证

Dan C. Hsu, Luke Lu

机构 * RedMind Research(红芯研究公司) National Taiwan University(国立台湾大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 研究长时代理上下文演化在分布转移下的验证问题,提出图正则化代理上下文演化方法(GRACE),通过维护指令为类型化语义图并在局部验证更新,实验表明该方法显著提升了严格可靠性。

Comments 18 pages, 3 figs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07178 2026-07-09 cs.LG cs.AI 新提交 84%

Entropy Pacing Policy Optimization for Multi-Task Agentic Reinforcement Learning

多任务智能强化学习的熵步长策略优化

Zetian Hu, Shunyu Liu, Junjie Zhang, Yongcheng Jing, Ting-En Lin, Yongbin Li, Dacheng Tao

机构 * Generative AI Lab, College of Computing and Data Science, Nanyang Technological University(生成式人工智能实验室,南洋理工大学计算与数据科学学院) Tongyi Lab, Alibaba Group(阿里集团通义实验室)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究多任务智能强化学习中任务间探索-利用步长不匹配问题,提出熵步长策略优化(EPPO),核心是任务级动态裁剪机制,实验证明EPPO在多任务智能基准上结果优于同类方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05804 2026-07-08 cs.AI cs.CL 新提交 84%

TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training

TurnOPD:使在线策略蒸馏具有转向意识以实现高效的长期智能体训练

Yuhang Zhou, Kai Zheng, Haoling Li, Dengyun Peng, Can Xu, Jingjing Chen

机构 * Fudan University(复旦大学) Tencent Hunyuan(腾讯文言)

专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究针对在线策略蒸馏在长期智能体任务应用不足的问题,提出TurnOPD,通过自适应展开深度预算和渐进式转向归一化损失预算两个策略,在多任务实验中实现更高验证准确率,超越普通OPD,推进了准确率-时间前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05001 2026-07-08 cs.CR cs.AI cs.LG cs.MA 新提交 84%

TACTIC-KG: Toward Small Agent Teams for Cyber Threat Intelligence Knowledge Graph Construction

TACTIC-KG:面向网络威胁情报知识图谱构建的小型智能体团队

Mouhamed Amine Bouchiha, Gregory Blanc

机构 * SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris(SAMOVAR, Telecom SudParis, Institute of Paris Polytechnic)

专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究针对网络威胁情报报告构建知识图谱的问题,提出TACTIC-KG框架,将任务分解给模块化专业语言模型智能体,用轻量级模型提升性能并降低成本,实验表明优于整体式模型。

Comments 20 pages, 2 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13213 2026-07-08 cs.AI cs.HC cs.LG 版本更新 84%

Agentic AI for Commercial Insurance Underwriting with Adversarial Self-Critique

用于商业保险承保的具有对抗性自我批评的智能体人工智能

Joyjit Roy, Samaresh Kumar Singh

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究针对商业保险承保中AI可靠性问题,提出含对抗性自我批评机制的人在回路智能体系统,开发故障模式分类法。实验表明该机制降低幻觉率、提高准确率,还确保人类权威,为受监管领域安全部署AI提供模型。

Comments 9 pages, 8 figuers, 6 tables, Presented at 9th International Conference on Modern Computing, Networking and Applications (MCNA2026)

Journal ref 2026 International Conference on Modern Computing, Networking and Applications (MCNA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02588 2026-07-07 cs.CV cs.AI cs.CL 新提交 84%

Homer: Understanding Long-form Videos with Hierarchical Memory and Agentic Reasoning

荷马:通过分层记忆和智能推理理解长视频

Yixin Ji, Fanghua Ye, Juntao Li, Bo Zhao, Zexuan Qiu, Zhaopeng Tu, Liefeng Bo, Min Zhang

机构 * Soochow University(苏州大学) Tencent Hunyuan Multimodal Department(腾讯混元多模态部)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 研究长视频理解问题,提出荷马分层在线记忆探索与推理框架,其记忆反映视频多尺度结构,智能推理器按人类方式探索记忆,通过多轮检索组合答案,性能优于此前最佳方法。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02436 2026-07-03 cs.SE cs.AI 新提交 84%

Reasoning effort, not tool access, buys first-try reliability in agentic code generation: an observational study

推理努力,而非工具访问,决定了智能体代码生成的首试可靠性:一项观察性研究

Achint Mehta

机构 * TrendAI

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 本研究通过90次独立智能体运行构建同一应用,发现推理努力(从高到极高)将首试完美运行率从28%提升至89%,而测试工具虽增加成本却未改善功能得分或可靠性。

Comments 22 pages, 5 figures, 10 tables. Dataset and evaluation artifacts: https://doi.org/10.5281/zenodo.21134406

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30801 2026-07-01 cs.CL cs.CY cs.LG cs.SI 新提交 84%

Using AI Agents to Automate Black-Box Audits of Personalization Algorithms at Scale

使用AI代理自动化大规模黑盒审计个性化算法

Alessandro Morosini, Sarah H. Cen, Andrew Ilyas, Hedi Driss, Aleksander Mądry, Chara Podimata

机构 * Massachusetts Institute of Technology(麻省理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划决策 :AI agent(title,abstract);agent(abstract);分类 cs.CL、cs.LG

AI总结 提出用生成式AI代理作为行为引擎进行黑盒审计,通过固定人设和反事实扰动解耦用户属性与行为,在X平台部署1120个代理发现算法推荐放大有毒、极化内容且效果因用户意识形态而异。

Comments 43 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14027 2026-07-01 cs.CR cs.AI cs.CL cs.SY eess.SY 新提交 84%

Same-Origin Policy for Agentic Browsers

代理浏览器的同源策略

Xilong Wang, Xiaoxing Chen, Patrick Li, Dawn Song, Neil Gong

机构 * Duke University(杜克大学) Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

专题命中 规划决策 :agentic(title,abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 研究代理浏览器中同源策略的有效性,构建SOPBench评估基准,发现现有代理浏览器频繁违反SOP,并提出SOPGuard机制来强制执行SOP,同时保持效用和低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17621 2026-06-30 cs.LG cs.CL 84%

Complementary RL: Towards Efficient Experience-Driven Agent Learning

互补强化学习:迈向高效的基于经验的智能体学习

Dilxat Muhtar, Jiashun Liu, Wei Gao, Weixun Wang, Shaopan Xiong, Ju Huang, Siran Yang, Wenbo Su, Jiamang Wang, Ling Pan, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) HKUST(香港科技大学)

专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.CL、cs.LG

AI总结 本文提出互补强化学习,通过经验提取器与策略智能体的协同进化,提升经验利用效率,实验证明在单任务和多任务场景中均优于传统方法。

Comments 22 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20641 2026-06-23 cs.RO cs.AI cs.LG 新提交 84%

MAGNIFIED: RL Fine-tuning of Multimodal Large Language Models for Motion Planning

MAGNIFIED: 多模态大语言模型的强化学习微调用于运动规划

Letian Chen, Yiren Lu, Justin Fu, Yichen Xie, Runsheng Xu, Jyh-Jing Hwang, Ben Sapp, Drago Anguelov

机构 * Waymo LLC(Waymo有限责任公司)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 提出MAGNIFIED方法,通过强化学习微调多模态大语言模型,利用令牌级奖励优化规划目标,在Waymo数据集上显著降低重叠率和偏离道路率。

Journal ref ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20627 2026-06-23 cs.AI cs.LG 新提交 84%

Latent Goal Prediction from Language for Model-Based Planning

基于语言隐式目标预测的模型规划

Samuel Barbeau, Simon Roy, Giovanni Beltrame, Christian Desrosiers, Nicolas Thome

机构 * École de Technologie Supérieure, Montréal(蒙特利尔高等技术学院) International Laboratory on Learning Systems (ILLS)(国际学习系统实验室) Polytechnique Montréal(蒙特利尔综合理工学院) MILA Institut Universitaire de France (IUF)(法国大学研究院) Université Sorbonne, CNRS, ISIR(索邦大学,法国国家科学研究中心,智能系统与机器人研究所)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 提出LAGO框架,通过在同一隐空间预测语言指令的中间子目标序列和动作条件轨迹,结合软最小轨迹代价规划,实现长程鲁棒规划。

Comments 9 pages. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20520 2026-06-23 cs.CR cs.AI cs.DC cs.LG 新提交 84%

Sovereign Execution Broker: Enforcing Certificate-Bound Authority in Agentic Control Planes

主权执行代理:在智能体控制平面中强制执行证书绑定权限

Jun He, Deying Yu

专题命中 规划决策 :agentic(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 针对自主代理在生产环境中执行变更时缺乏强制权限验证的问题,提出主权执行代理(SEB),通过证书验证、状态检查和范围身份实现运行时强制权限控制,并在AWS和Kubernetes上验证了其安全性和性能。

Comments 19 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20209 2026-06-23 cs.LG cs.CL 版本更新 84%

Spark: Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic Learning

Spark: 通过动态分支进行战略性策略感知探索以实现长周期智能体学习

Jinyang Wu, Shuo Yang, Changpeng Yang, Yuhao Shen, Shuai Zhang, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 规划决策 :agentic(title);agent(abstract);planning(abstract);分类 cs.CL、cs.LG

AI总结 提出Spark框架,通过关键状态动态分支实现资源高效探索,在长周期任务中以更少样本取得更高成功率和泛化能力。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17680 2026-06-17 cs.LG cs.CL 新提交 84%

EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning

EnvRL: 在智能体强化学习中从环境动力学中学习

Zhitong Wang, Songze Li, Hao Peng, Shuzheng Si, Yi Wang, Maosong Sun, Juanzi Li

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.CL、cs.LG

AI总结 提出EnvRL框架,通过状态预测和逆动力学两个辅助目标,将环境动力学学习融入智能体强化学习,在长周期任务中显著提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11682 2026-06-16 cs.AI cs.LG 版本更新 84%

MedAI: Evaluating TxAgent's Therapeutic Agentic Reasoning in the NeurIPS CURE-Bench Competition

MedAI: 评估 TxAgent 在 NeurIPS CURE-Bench 竞赛中的治疗性智能推理

Tim Cofala, Christian Kalfar, Jingge Xiao, Johanna Schrader, Michelle Tang, Wolfgang Nejdl

机构 * L3S Research Center(L3S研究中心)

专题命中 规划决策 :agentic(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文介绍 TxAgent,一种通过迭代检索增强生成和统一生物医学工具集进行治疗决策的智能AI方法,并在CURE-Bench竞赛中评估其推理质量,通过改进工具检索策略提升性能,荣获开放科学卓越奖。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06493 2026-06-10 cs.RO cs.AI cs.LG 版本更新 84%

HANDOFF: Humanoid Agentic Task-Space Whole-Body Control via Distilled Complementary Teachers

HANDOFF: 通过蒸馏互补教师实现人形机器人任务空间全身控制

Lizhi Yang, Junheng Li, Nehar Poddar, Yiling Hou, Gio Huh, Robert Griffin, Georgia Gkioxari, Aaron Ames

机构 * California Institute of Technology(加州理工学院) The Institute for Human & Machine Cognition(人机认知研究院)

专题命中 规划决策 :agentic(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 提出HANDOFF框架,通过多教师KL蒸馏和上下文门控机制,将全身运动跟踪、行走和跌倒恢复三个专家策略融合为混合专家学生策略,实现基于紧凑显式接口的全身控制,在Unitree G1上达到先进的速度跟踪性能并扩展了操作工作空间。

Comments 22 pages, 9 figures, Project page: https://lzyang2000.github.io/HANDOFF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17547 2026-06-10 cs.AI cs.CL 84%

KLong: Training LLM Agent for Extremely Long-horizon Tasks

KLong:训练用于超长 horizon 任务的 LLM 代理

Yue Liu

专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 KLong 通过轨迹分割 SFT 和渐进式 RL 训练,解决超长 horizon 任务,实现 106B 模型在 PaperBench 上超越 Kimi K2 Thinking 11.28%。

Comments We request standard withdrawal of this submission because significant errors were discovered in the data after submission, which affect the validity of the results. We may submit a corrected version later

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03292 2026-06-09 cs.CL cs.AI cs.IR 版本更新 84%

From Conflict to Consensus: Boosting Medical Reasoning via Multi-Round Agentic RAG

从冲突到共识:通过多轮代理RAG提升医疗推理

Wenhao Wu, Zhentao Tang, Yafu Li, Shixiong Kai, Mingxuan Yuan, Zhenhong Sun, Chunlin Chen, Zhi Wang

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出MA-RAG框架,通过多轮代理循环迭代优化外部证据和内部推理历史,提升医疗复杂推理能力,实验显示在7个医疗问答基准上表现优于现有方法。

Comments 27 pages, 8 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06529 2026-06-08 cs.AI cs.LG 新提交 84%

Attack Selection in Agentic AI Control Evaluations Meaningfully Decreases Safety

智能体AI控制评估中的攻击选择显著降低安全性

Catherine Ge-Wang, Tyler Crosse, Benjamin Hadad, Joachim Schaeffer, Ram Potham, Tyler Tracy

专题命中 规划决策 :agentic(title,abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究攻击者策略性选择攻击时机对AI控制安全性的影响,通过分解攻击决策为开始和停止策略,实验表明两者均显著降低安全性,现有评估可能高估安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02994 2026-06-03 cs.AI cs.CL 84%

Inducing Reasoning Primitives from Agent Traces

从智能体轨迹中归纳推理原语

Zhihan Lei, Jiarui Yan, Joshua Momo, William W. Cohen

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划决策 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 提出推理原语归纳方法,从ReAct智能体轨迹中挖掘并聚类常见推理步骤,构建伪工具库,在多个推理任务上显著提升性能。

Comments 22 pages including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02951 2026-06-03 cs.RO cs.AI cs.CL cs.CV cs.HC 84%

SCOPE: Real-Time Natural Language Camera Agent at the Edge

SCOPE:边缘实时自然语言相机代理

Nikolaj Hindsbo, Sina Ehsani, Pragyana Mishra

机构 * Armada AI

专题命中 规划决策 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 提出SCOPE模块化代理,用于自然语言控制的PTZ相机,在边缘部署实现实时感知、规划与控制,并通过仿真和物理实验评估延迟、准确性和错误模式。

Comments 9 pages, 4 figures, 6 tables. Accepted at HRI '26 (21st ACM/IEEE International Conference on Human-Robot Interaction), Edinburgh, Scotland, March 16--19, 2026. Code: https://github.com/HindsboNikolaj/SCOPE

Journal ref Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction (HRI '26), ACM, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
1101.4003 2026-06-03 cs.AI cs.LG cs.SY eess.SY math.OC 84%

Dyna-H: a heuristic planning reinforcement learning algorithm applied to role-playing-game strategy decision systems

Dyna-H:一种应用于角色扮演游戏策略决策系统的启发式规划强化学习算法

Matilde Santos, Jose Antonio Martin H., Victoria Lopez, Guillermo Botella

机构 * Complutense University of Madrid(马德里complutense大学)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 提出Dyna-H算法,结合启发式搜索与Dyna框架,在角色扮演游戏策略决策中实现无模型在线强化学习,实验表明其性能显著优于Q-Learning和Dyna-Q。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00510 2026-06-02 cs.CL cs.AI 84%

Skill or Skip? Learning Selective Skill Invocation in Agentic Tasks via Dual-Granularity Preference Learning

技能还是跳过?通过双粒度偏好学习在智能体任务中学习选择性技能调用

Chishui Chen, Jiaye Lin, Te Sun, Junxi Wang, Yi Yang, Cong Qin, Yangen Hu, Lu Pan, Ke Zeng

机构 * Meituan(美团) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) Peking University(北京大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 提出SelSkill框架,通过双粒度偏好学习实现选择性技能调用,在ALFWorld和BFCL上显著提升任务成功率和执行精度。

Comments 18 pages, 4 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏