arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 7434 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 2137 篇

2608.07905 2026-08-11 cs.AI cs.RO 新提交 79%

GraphThink: Graph-Enhanced LLM Thinking for Long-Horizon Embodied Task Planning

GraphThink:用于长视距具身任务规划的图增强大语言模型思维

Chen Li, Sijie Cheng, Yuelin Zhang, Junxi Li, Maozhi Huang, Yang Liu, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 GraphThink框架结合任务图与场景图,通过上下文提示、迭代优化、GRPO奖励设计及事件驱动重规划,在ALFRED基准上实现最优性能,具强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08919 2026-08-11 physics.med-ph cs.AI 新提交 79%

Toward CT-Equivalent Image Quality in Low-Dose Radiotherapy Planning: Conditional Diffusion-Based CBCT-to-CT Synthesis and the Impact of CBCT Input Representation

实现与CT相当的低剂量放疗计划图像质量:基于条件扩散的CBCT到CT合成及CBCT输入表示的影响

Alzahra Altalib, Chunhui Li, Christopher Hamill Taylor, Sankar Pillai, Alessandro Perelli

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本研究开发基于条件DDPM的CBCT到CT合成框架,探究CBCT输入表示对合成性能的影响,旨在实现低剂量放疗中与CT相当的图像质量。

Comments 9 pages, 6 figures, European Conference of Radiology (ECR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07454 2026-08-10 cs.MA cs.AI 新提交 79%

Strategy-first synthesis planning for complex natural products

复杂天然产物的优先策略合成规划

Daniel Armstrong, Xuan-Vu Nguyen, Octavian Susanu, Gabriel Gibberd, Théo A. Neukomm, Taddäus Strunden, Dan Forster, Morgane Delattre, Shawn Teh, Clément Rols, John Federice, Hayden Leatherwood, M. Lavelle Barnes, Maarten R. Dobbelaere, Peter Wipf, Jon T. Njardarson, Jieping Zhu, Philippe Schwaller

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) National Centre of Competence in Research (NCCR) Catalysis(国家催化研究能力中心) Ghent University(根特大学) University of Arizona(亚利桑那大学) University of Pittsburgh(匹兹堡大学)

专题命中 规划决策 :planning(title);agentic(abstract);分类 cs.AI

AI总结 基于大语言模型的智能体框架SynthEx,可规划出传统算法无法实现的复杂天然产物合成路线,其关键步骤获化学家认可,相关路线数据库SynthAtlas已开放。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07214 2026-08-10 cs.DB cs.AI cs.SY eess.SY 新提交 79%

Toward a Causal Data Management Ecosystem for Decision Making and Agentic AI

面向决策与智能体AI的因果数据管理生态系统

Dazhuo Qiu, Yingli Zhou, Amedeo Pachera, Angela Bonifati, Andrea Mauri

机构 * Lyon 1 University(里昂第一大学) CNRS(法国国家科学研究中心) Liris(里昂信息学研究实验室) IUF(法国大学研究院)

专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文针对AI生态系统决策混杂问题,提出构建共享可查询的因果世界系统(CWS),为面向决策与智能体AI的因果数据管理生态系统提供支持。

Comments Accepted at ACM AI Leadership Summit 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07118 2026-08-10 cs.AI 新提交 79%

How Much, Then Where: Credit-Conserving Action-to-Token Allocation for Multi-Turn Agent Reinforcement Learning

那么多少,然后在哪里:多轮智能体强化学习中保留信用的动作到令牌分配

Lichao Ma, Yang Sun, Shuaitao Zhao, Yangyi Fang, Cong Qin, Xiaoliang Fu, Yuhang Tian, Yuchen Wei, Junbo Zhu, Yang Wei, Lu Pan, Jiaye Lin

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 本文提出FACTOR算法,通过分离动作级与令牌级信用分配,在多轮智能体强化学习的ALFWorld等环境中实现性能提升,且超参数可跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06714 2026-08-10 cs.AI 新提交 79%

The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows

优化器即智能体:跨提示、程序与机器学习工作流的推理驱动搜索

Junbo Li, Boyi Liu, Canwen Xu, Yite Wang, Yuxiong He, Zhangyang Wang, Qiang Liu, Zhewei Yao

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Snowflake(思诺飞克公司)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 该研究提出ReASearch统一框架,让智能体自主优化提示、程序与ML工作流,在14项任务中优于专用系统,部分发现超人类最佳结果的方案。

Journal ref COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06668 2026-08-10 cs.AI 新提交 79%

Vehicle routing problem using deep reinforcement learning - A case study about truck planning in the industry

基于深度强化学习的车辆路径问题——工业中卡车规划的案例研究

Siliang Lu, Dan Hu, Lili Wu

机构 * Bosch Center for Artificial Intelligence(博世人工智能中心) School of Electronic Information and Electrical Engineering(电子信息与电气工程学院) School of Computer Science, Macau University of Science and Technology(澳门科技大学计算机学院)

专题命中 规划决策 :planning(title);agent(abstract);分类 cs.AI

AI总结 本文以工业卡车规划为案例,针对三个物流场景,提出基于深度强化学习的车辆路径优化方法,其优化后路径总成本较基线降低10%以上,还提出可将该算法推广至更多VRP变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06663 2026-08-10 cs.CL 新提交 79%

The Horizon Gap: Planning, Memory, Execution, Training, and Evaluation for Long-Horizon LLM Agents

视界差距:长视界大语言模型智能体的规划、记忆、执行、训练与评估

Mingguang Chen, Licheng Wang, Bo Qu

机构 * DeepGrounding(深地研究机构) AlphaAvatar(阿尔法 Avatar 公司)

专题命中 规划决策 :planning(title,abstract);分类 cs.CL

AI总结 本文提出长视界大语言模型智能体存在的视界差距,调研1547篇相关论文,厘清长视界等属性,分析领域应对措施并提出开放测量问题。

Comments 39 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07398 2026-08-10 math.OC cs.HC cs.LG 新提交 79%

Uncovering expert objectives in production planning via inverse optimization: An industrial case study

通过逆优化揭示生产规划中的专家目标:一项工业案例研究

Shivi Dixit, Rishabh Gupta, Adam Kelloway, John Wassick, Qi Zhang

机构 * University of Minnesota(明尼苏达大学) The Dow Chemical Company(陶氏化学公司) Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 本研究提出数据驱动的逆优化框架,推断工业生产规划中专家决策隐含的目标函数,应用于陶氏化学案例证实该方法可将隐性专业知识转化为可解释的决策支持模型。

Journal ref Chemical Engineering Research and Design, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05521 2026-08-07 cs.SE 新提交 79%

Reasoning from Traces: Divergence-Guided Agentic Repair of WebAssembly Discrepancies

从痕迹中推理:分歧引导的智能体修复WebAssembly差异

Liyan Huang, Kaicheng Wang, Weihang Wang

专题命中 规划决策 :agentic(title,abstract);分类 cs.SE

AI总结 本文提出WasmMend系统,通过差分痕迹分析定位Wasm与原生执行的分歧函数,引导LLM智能体生成补丁,在真实C/C++项目上修复率达70.0%,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05332 2026-08-07 cs.DC cs.AI 新提交 79%

Hierarchical Server Architecture for Agentic Science

面向智能体科学的分层服务器架构

Vanessa Sochat, Daniel Milroy

机构 * Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 针对智能体科学的资源调度需求,提出分层动态架构及软件,借助秘书智能体在云、边缘和HPC系统中发现资源,经模拟验证其协商准确率达87.71%,选择成本与传统策略相当,可支持Genesis Mission。

Comments 10 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05225 2026-08-07 cs.AI 新提交 79%

Project2Task: Graph-Guided Project-Level Planning for Autonomous Research

Project2Task:面向自主研究的图引导项目级规划

Huirui Xu, Runtao Xu, Shuo Ren, Jiajun Zhang

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 该研究提出Project2Task图引导项目级规划层,可将研究项目转化为感知依赖的边界任务,在基准测试中其任务组合质量优于基线,与AutoResearchClaw整合后提升了下游任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04265 2026-08-06 cs.MA cs.AI cs.SY eess.SY 新提交 79%

Strategic Evaluation of Planning Strategies for LLM Agents in Cyber-Physical Systems

网络物理系统中大语言模型智能体规划策略的战略评估

J. de Curtò, I. de Zarzà

机构 * BARCELONA Supercomputing Center(巴塞罗那超级计算中心) LUXEMBOURG Institute of Science and Technology(卢森堡科学技术学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本研究针对网络物理系统,构建含40个异构产消者的智能电网基准,评估4种LLM规划架构,发现架构影响结果,应用截止可行性可显著降低遗憾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04066 2026-08-06 cs.AI 新提交 79%

The LLM Proposes, the Executive Disposes: A Self-Verifying Agent Instrument that Dissociates Commitment Drift from Binding Drift in Long-Horizon Agents

大模型提出方案,执行体处理:一种自验证智能体工具,可将长程智能体中的承诺漂移与绑定漂移分离

Mohsen Arjmandi

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 本研究提出一种自验证智能体工具,可分离长程智能体的承诺漂移与绑定漂移,通过实验揭示消融承诺机制会提升目标放弃率,且贡献了可量化漂移分解的智能体验证方法论。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03086 2026-08-05 eess.IV cs.LG 新提交 79%

Automatic Patient-Specific Microwave Ablation Planning Accelerated by a Physics-Guided Deep Learning Model

基于物理引导深度学习模型加速的患者特异性微波消融自动规划

Seonaeng Cho, Minjee Seo, Minju Seol, Juil Park, Joon Ho Kwon, Kyungho Yoon

机构 * Yonsei University(延世大学) Innovative & Intelligent Computational Science Institute (IN2CSI)(创新与智能计算科学研究所(IN2CSI))

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 该研究提出结合神经消融预测模型与遗传算法的数字孪生框架,可快速实现患者特异性微波消融自动规划,提升消融效率、减少器官损伤且规划速度快约420倍

Comments Accepted at the Digital Twin for Healthcare (DT4H 2026) workshop at MICCAI 2026; 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02407 2026-08-04 cs.CR cs.AI 新提交 79%

Antares: Foundation Models for Agentic Vulnerability Localization

Antares:用于智能体漏洞定位的基础模型

Supriti Vijay, Aman Priyanshu, Didier Chapoteau, Arthur Goldblatt, Jianliang He, Kimia Majd, Fraser Burch, Baturay Saglam, Takahiro Matsumoto, Zhuoran Yang, Amin Karbasi

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 该研究提出基于IBM Granite的Antares系列紧凑语言模型,经两阶段训练用于智能体漏洞定位,其30亿参数版本性能接近GPT-5.5且远超更大模型,推理高效低成本。

Comments 57 pages, 12 figures, technical report for antares

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02276 2026-08-04 cs.AI 新提交 79%

Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories

Harness-R1:从智能体失败轨迹中学习编辑可执行运行时管控程序

Shuai Shao, Kangning Zhang, Qingyao Li, Shijian Wang, Hao Wang, Wenxiang Jiao, Yuan Lu, Yi Guo, Weiwen Liu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司) Southeast University(东南大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 Harness-R1是首个基于智能体失败轨迹学习编辑可执行运行时管控程序的方法,经WebShop等基准测试,可提升Qwen3.5-9B智能体成功率,为管控程序与智能体协同进化提供了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00882 2026-08-04 cs.AI cs.CR cs.LO cs.PL 新提交 79%

Assuming You Knew: Fixing an Epistemic Semantics for Flow Policies Using Agentic AI

假设你已知:使用智能体AI修复流策略的认知语义

David A. Naumann

机构 * Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 该研究针对流策略认知语义框架的缺陷,借助智能体AI编码助手在Rocq中完成修正形式化的机器验证,形成了可比较不同策略规范风格并支持实施的通用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00881 2026-08-04 cs.LG 新提交 79%

AOSpec: Action and Observation Co-Speculation for Low-Latency Agent Serving

AOSpec:用于低延迟智能体服务的动作与观测协同推测

Hao Mark Chen, Jinnan Guo, Wayne Luk, Hongxiang Fan

专题命中 规划决策 :agent(title,abstract);分类 cs.LG

AI总结 AOSpec是一种动作与观测协同推测的无损框架,通过EVD和JASV技术降低智能体服务延迟,在Terminal-Bench上较基线实现显著延迟缩减,且观测模型可跨基准迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00320 2026-08-04 cs.LG cs.MA cs.SY eess.SY 新提交 79%

Neural operator learning for collision-aware trajectory planning of spacecraft swarms

面向航天器集群碰撞感知轨迹规划的神经算子学习

Sidhdharth D. Sikka, Suyi Gao, Zehui Lu, Rongjie Lai, Shaoshuai Mou

机构 * Purdue University(普渡大学) Manifold Research Group(流形研究组)

专题命中 规划决策 :planning(title);agent(abstract);分类 cs.LG

AI总结 该研究提出排列等变神经算子,结合自监督物理目标与对抗威胁训练,实现航天器集群轨迹规划,可零样本泛化到大规模集群,精度接近最优控制求解器,性能优于无碎片感知基线。

Comments 27 pages, 6 figures, 6 tables. Submitted to Nature Machine Intelligence. Video abstract included as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00003 2026-08-04 cs.AI 新提交 79%

AutoFOAM: The Self-Refining Autonomous OpenFOAM Agent

AutoFOAM:自优化自主OpenFOAM智能体

Arun Govind Neelan, A Seshaditya

机构 * SimuNetics Onnes Cryogenics Quasi AI

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 AutoFOAM是基于Qwen-coder 2.5-14B微调的自主LLM智能体,通过7阶段迭代循环及三种抗退化机制,可基于自然语言指令完成OpenFOAM模拟,助力CFD工作流程普及与快速原型开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28990 2026-08-03 cs.AI 新提交 79%

Scaling Scientific Discovery Environments for Turn-Level Agentic RL

面向回合级智能体强化学习的科学发现环境扩展

Yucheng Xu, Keyi Zhang, Yuyang Yu, Min Zhang, Shiyuan Meng, Pei Chu, Zhongying Tu

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出可扩展框架SciDisco,结合SciThèque与DiscoPO,训练出的SciDisco-14B在假设驱动的科学数据分析基准上实现了当前最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28829 2026-08-03 cs.NI cs.LG 新提交 79%

When Unlearning Fails: Reliable Data Deletion under Post-Training in Agent Networks

当遗忘失效时:智能体网络后训练下的可靠数据删除

Zihao Ding, Jun Huang, Liang Dong

机构 * South Dakota State University(南达科他州立大学) Baylor University(贝勒大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.LG

AI总结 针对自改进联邦智能体网络后训练时数据删除易出现影响回声的问题,提出MUTE方法,经实验验证其可在保障任务效用的同时降低行为泄漏且通信开销更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27443 2026-07-31 cs.AI 新提交 79%

Leveraging Trajectory Graphs for Pre-Execution Error Diagnosis in Agentic LLM Systems

利用轨迹图实现智能体大语言模型系统的预执行错误诊断

Xu Zheng, Zhuomin Chen, Chaohao Lin, Hua Wei, Haifeng Chen, Wei Cheng, Dongsheng Luo

机构 * Florida International University(佛罗里达国际大学) Arizona State University(亚利桑那州立大学) NEC Laboratories America(美国 NEC 实验室) Singapore Management University(新加坡管理大学)

专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.AI

AI总结 该研究提出Trajectory Graph Copilot框架,以Graph Debugger为核心,通过预执行错误诊断提升LLM智能体完成长周期任务的能力,在多基准测试中平均提升14.69%通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27360 2026-07-31 cs.AI 新提交 79%

SkillMentor: LLM Agent Self-Evolution via Learning Blind-Spot Diagnosis

SkillMentor:基于盲点诊断的大语言模型智能体自我进化

Xiaoyi Bao, Yuanzhen Xie, Yunzhi Tan, Jinghang Gu, Zhongqing Wang, Chu-Ren Huang, Bo Hu, Zang Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Platform and Content Group, Tencent(腾讯平台与内容事业群) Soochow University(苏州大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 本文提出SkillMentor,将盲点诊断作为独立于执行的可学习智能体能力,通过强化学习训练导师策略,在AppWorld和BFCLv3上使执行器性能平均提升44.2%,实现无需更新执行器的智能体自我进化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27287 2026-07-31 cs.AI cs.LO 新提交 79%

PIE-APT: A Unified Framework for Temporal Planning and Contradiction Hunting via Incremental Direct-Derivation Abduction

PIE-APT:基于增量直接推导溯因的时态规划与矛盾检测统一框架

Amir Hossein Sharafi, Alireza Shahbazi

机构 * Najm(纳吉姆) Tafresh University(塔夫雷什大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 该研究提出统一框架PIE-APT,含PIE-Abducer与PIE-APT模块,通过增量直接推导溯因解决动态知识图谱规划与矛盾检测问题,在OWL基准上优于经典规划器与MHS基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26604 2026-07-30 cs.CL 新提交 79%

WikiLoop: Jointly Learning to Build and Navigate Agent-Native Wikis with Downstream Feedback

WikiLoop:基于下游反馈联合学习构建与智能体原生Wiki导航

Haoliang Ming, Feifei Li, Wenhui Que

专题命中 规划决策 :agent(title,abstract);分类 cs.CL

AI总结 WikiLoop是反馈耦合框架,以Qwen3.5-9B为主干,联合学习构建与导航智能体原生Wiki,在AuthTrace等数据集上提升答案正确性,整合两种角色能力且无需特定数据集训练。

Comments 13 pages, 2 figures, 12 tables. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26588 2026-07-30 cs.AI 新提交 79%

Eco3S: Complex Socio-Economic System Simulation via Agent-Based Models

Eco3S:基于智能体模型的复杂社会经济系统仿真

Shaopeng Wei, Yufei Cheng, Wenxi Sun, Yepeng Ding, Yu Zhao, Gang Kou

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 Eco3S是面向经济研究与政策分析的社会经济系统仿真框架,通过三种关键机制解决现有LLM-based ABM的挑战,经多场景实验验证其有效性、可扩展性与通用性。

Comments 18 pages, 18 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26181 2026-07-30 cs.AI 新提交 79%

GoGoTB: Agentic RTL Verification with Specification-Grounded Coverage Closure

GoGoTB:基于规范驱动覆盖闭合的智能体式RTL验证

Xin Xin, Jincheng Lou, Junhui Li, Jinglin Yan, Panda Xiao, Di Wu, Haixiao Li, Weicong Lu, Weijian Fan, Xinyu Qu, Yuxiang Zhao, Min Yu, Zhixiong Di, Yibo Lin

机构 * Tencent(腾讯) School of Integrated Circuits, Peking University(北京大学集成电路学院) Southwest Jiaotong University(西南交通大学) Institute of Electronic Design Automation, Peking University(北京大学电子设计自动化研究所) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路高精尖创新中心)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 GoGoTB是实现端到端验证闭合的智能体式RTL验证框架,在8个RTL设计上无需人工干预,实现100%环境生成成功率及多维度高覆盖率,优于现有方法。

Comments 9 pages, 7 figures, 3 tables. Xin Xin and Jincheng Lou contributed equally to this work and share first authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25369 2026-07-29 cs.AI 新提交 79%

ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning

ODYSSE:用于个性化智能体推理的逐情节策略优化

Jiaqi Zhang, Tong Chen, Junliang Yu, Quoc Viet Hung Nguyen, Hongzhi Yin

机构 * The University of Queensland(昆士兰大学) Griffith University(格里菲斯大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 研究个性化智能体推理问题,提出基于强化微调框架ODYSSE,核心方法是逐情节GRPO,通过情节级奖励机制等解决长动作跨度等问题,经实验验证其在个性化GUI推理任务中优于其他模型,有效提升个性化智能体推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏