arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-27 至 2026-08-27 共收录 61 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 61 篇

2608.25935 2026-08-27 cs.CV cs.AI 新提交 92%

TAU-Agent: An Agentic Retrieval-Augmented Framework for Traffic Anomaly Understanding

TAU-Agent:用于交通异常理解的智能体式检索增强框架

Yuqiang Lin, Yan Shi, Sam Lockyer, Harish Tayyar Madabushi, Adrian Evans, Wenbin Li, Yinhai Wang, Nic Zhang

机构 * University of Bath(巴斯大学) University of Washington(华盛顿大学)

专题命中 规划决策 :agent(title,title_cn);agentic(title,abstract);分类 cs.AI

AI总结 针对交通异常理解需求,提出TAU-Agent智能体式检索增强框架,调度两类视觉工具获取证据,结合微调视觉语言模型推理,在AI City 2026挑战赛多赛道取得对应排名成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25399 2026-08-27 cs.AI 新提交 92%

Can your AI agent be cheaper? Investigating the effects of task specifications on token spend in agentic coding tasks

你的AI智能体能更便宜吗?探究智能体编码任务中任务规格对token消耗的影响

Jakub Smékal

机构 * Stanford University(斯坦福大学)

专题命中 规划决策 :agent(title,abstract);agentic(title,abstract);AI agent(title);tool use(abstract)

AI总结 本文以Kimi K3模型为对象,探究智能体编码任务中任务规格对token消耗的影响,发现简化任务规格会提升token消耗,拟合的预测器可较优地预测token消耗,为评估AI编码工作流成本提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24888 2026-08-27 cs.AI 新提交 89%

SIMGUIDE: Procedurally Grounded Multi-Context Representations for Personalized Agent Planning

SIMGUIDE:用于个性化智能体规划的过程式基础多上下文表示

Chirag Shah

机构 * University of Washington(华盛顿大学)

专题命中 规划决策 :agent(title,abstract);planning(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 本研究针对个性化AI智能体无法适配用户多场景优先级的问题,提出SIMGUIDE方法,构建SIMBENCH基准验证,发现过程式基础的Sims优于RAG,且表示格式是关键设计变量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26086 2026-08-27 cs.LG cs.AI 新提交 88%

TraceML: An Empirical Analysis of Human-Agent Planning in Machine Learning Development

TraceML:机器学习开发中人类-智能体规划的实证分析

Jiarui Yan, Weiwei Sun, Sijie Li, Wenhan Li, Yiming Yang

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划决策 :agent(title,abstract);planning(title,abstract);分类 cs.AI、cs.LG

AI总结 TraceML通过构建人类与智能体在Kaggle竞赛中的配对轨迹数据集,实证分析了人类与智能体在机器学习开发规划上的差异,发现智能体存在行为循环问题,提炼的人类规划提示可缩小部分差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08603 2026-08-27 cs.AI 版本更新 88%

OSCAR: Optimization-Steered Agentic Planning for Composed Image Retrieval

OSCAR:基于优化的代理规划用于组合图像检索

Teng Wang, Rong Shan, Jianghao Lin, Junjie Wu, Tianyi Xu, Jianping Zhang, Wenteng Chen, Changwang Zhang, Zhaoxiang Wang, Weinan Zhang, Jun Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 规划决策 :planning(title,abstract);agentic(title,abstract);分类 cs.AI

AI总结 OSCAR通过优化引导的代理规划框架,提升组合图像检索的性能,仅用10%训练数据即超越现有最佳方法。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21054 2026-08-27 cs.AI cs.CL 版本更新 84%

Reasoning or Rambling? Exploring the Effect of Thinking on Agent Persuasion

推理还是漫谈?探究思考过程对智能体说服能力的影响

Haodong Zhao, Jidong Li, Zhaomin Wu, Tianjie Ju, Zhuosheng Zhang, Bingsheng He, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) National University of Singapore(新加坡国立大学) Inner Mongolia Research Institute, Shanghai Jiao Tong University(上海交通大学内蒙古研究院)

专题命中 规划决策 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文对比通用LLM与LRM,发现推理对智能体说服能力存在二元性影响,还揭示其依赖表面线索的漏洞,提出提示级对抗性论点检测方法以提升鲁棒性。

Comments Accepted as EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25091 2026-08-27 cs.AI cs.CR 新提交 84%

Auto-Policy, not Auto-Skill: Compiled Agent Skills for the Physical World

自动策略,而非自动技能:面向物理世界的编译智能体技能

Zhonghao Zhan, Hamed Haddadi

机构 * Imperial College London(帝国理工学院)

专题命中 规划决策 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 本文针对恶意智能体技能造成物理伤害的问题,提出位于技能制品内部的类型化权限层Edge Skillguard,可高效拒绝借用权限请求,验证了其在多场景下的防护效果。

Comments Presented at the 1st Workshop on Agent Skills (Agent Skills '26), ACM CAIS 2026, San Jose, May 26, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25039 2026-08-27 cs.AI 新提交 83%

LifePlanner: Evaluating LLM Agents for Geo-spatial Planning with Social Media Data

LifePlanner:利用社交媒体数据评估LLM智能体的地理空间规划能力

Zhen Dong, Yuning Peng, Yutao Shi, Lei Zhong, Yongsen Mao, Yuan Liu, Haiping Wang

机构 * Wuhan University(武汉大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 规划决策 :planning(title,abstract);tool use(abstract);分类 cs.AI

AI总结 该研究推出LifePlanner基准测试,结合社交媒体数据评估LLM智能体的地理空间规划能力,发现前沿LLM在简单检索中表现好但复杂规划通过率仅40.2%,失败源于证据获取、工具使用及约束整合问题,需改进实际规划能力而非单纯扩大模型规模。

Comments 25 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24896 2026-08-27 cs.HC cs.CE 新提交 82%

Agentic World Analysis (AWA) - an alternative way to explore systems and support decision making

智能体世界分析(AWA)——一种探索系统与支持决策的替代方法

Yongchao Zeng, Alexey Voinov, Calum Brown, Tatiana Filatova, Mark Rounsevell

专题命中 规划决策 :agentic(title,abstract)

AI总结 该研究提出智能体世界分析(AWA)方法,结合模拟建模与专家征询,实现生成式智能体世界引擎(WEGA),并以荷兰氮危机为例验证其功能,生成两条未来路径供评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25329 2026-08-27 cs.AI cs.CL 新提交 81%

Learning What to Share and What to Personalize: Hierarchical Strategy Co-Evolution for Agent Memory

学习共享与个性化内容:面向智能体记忆的分层策略协同进化

Yupeng Han, Shuochen Liu, Kai Zhang, Ze Liu, Zhihong Pan, Xianquan Wang

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本研究提出HiPS框架,将智能体记忆管理解耦为全局共享基础与用户特定自适应层,通过协同进化优化策略,使记忆增强智能体的响应性能持续优于基线方法。

Comments EMNLP'2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25163 2026-08-27 cs.LG cs.AI 新提交 81%

Bayesian Flow Networks for Offline Trajectory Planning

用于离线轨迹规划的贝叶斯流网络

Ludvig Killingberg, Helge Langseth

机构 * Norwegian University of Science and Technology(挪威科技大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出基于贝叶斯流网络(BFNs)的BFN-RL框架,可在单一概率公式内建模离散与连续轨迹空间,经实验验证其能在两类状态空间生成有效轨迹,为离线轨迹规划提供通用生成基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25641 2026-08-27 cs.RO cs.AI 新提交 79%

Leveraging Inter-object Affordances for Efficient Planning in Contact-rich Tasks

利用物体间可供性实现接触密集型任务的高效规划

Pouya P. Niaz, Justus Piater, Alejandro Agostini

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 该研究针对传统TAMP方法在接触密集型任务中规划时间长、成功率低的问题,提出结合VLM与U-TAMP的方法,在模拟厨房场景中实现了更高的规划成功率与更快的规划速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25531 2026-08-27 cs.CL 新提交 79%

ClueWeaver: Reward-Guided Dual-Agent Evidence Reasoning for Compact LLMs on Literary Long Narratives

ClueWeaver:面向紧凑型大语言模型的、针对文学长篇叙事的奖励引导双智能体证据推理框架

Jihao Zhu, Zhiwei Yang, Wenxiao Zhang, Junqian Zhao, Qi You, Fangqi Wang, Zheyuan Deng, Hanzhe Yang, Yu Liu, Jin B. Hong

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) University of Aberdeen(阿伯丁大学) The University of Western Australia(西澳大学) Brown University(布朗大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.CL

AI总结 ClueWeaver是用于紧凑型本地模型的双智能体证据推理框架,可提升本地语言模型在长篇叙事问答与声明验证任务中的性能,提供可检查的证据推理轨迹。

Comments Accepted by ICONIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16287 2026-08-27 cs.LG 版本更新 79%

SCALE: State-Calibrated Latent Embeddings for JEPA Planning in the Right Geometry

SCALE:用于正确几何空间中JEPA规划的状态校准潜在嵌入

Jiaming Hu, Yan Zheng, Tian Wang

机构 * Boston University(波士顿大学) Unity Technologies(Unity科技公司)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 该研究提出SCALE正则化器,为LeWM表示校准几何属性,在多任务、多求解器和多计算预算下均提升规划性能,证明规划依赖信息对几何的塑造作用。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25830 2026-08-27 cs.RO 新提交 78%

Anytime Global Tensor Motion Planning

anytime 全局张量运动规划

Sai Coumar, An T. Le, Zachary Kingston

机构 * Purdue University(普渡大学) VinUniversity(范安大学) TU Darmstadt(达姆施塔特工业大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 该研究泛化全局张量运动规划(GTMP),提出两种 anytime 策略,证明其同伦类覆盖与概率特性,在操作任务和二维导航基准上表现良好。

Comments 8 pages, 5 figures. Code: this https URL (https://github.com/commalab/anytime_gtmp.git)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25711 2026-08-27 cs.CR 新提交 78%

Reassembling Distributed Risk: Trajectory-Conditioned Action Generation for Multi-Turn Agent Safety

重构分布式风险:面向多轮智能体安全的轨迹条件动作生成

Yanbo Dai, Zhenlan Ji, Zongjie Li, Shuai Wang

专题命中 规划决策 :agent(title,abstract)

AI总结 针对多轮分解攻击下使用工具的LLM智能体的安全风险,提出生成时防御方法ReDiR,通过轨迹级安全条件整合跨轮安全信息,将攻击成功率降至8%以下,可迁移且开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25690 2026-08-27 cs.MA cs.RO 新提交 78%

Trust-Aware Sequential Decision Making and Rollout Planning for Resilient Multi-Robot Systems

面向弹性多机器人系统的信任感知序贯决策与滚动规划

Roee M. Francos, Daniel Garces, Orhan Eren Akgün, Nathaniel D. Bastian, Stephanie Gil

专题命中 规划决策 :planning(title,abstract)

AI总结 针对多机器人系统中智能体被入侵导致规划与执行不匹配的问题,提出信任感知监测器结合分层二分匹配策略,实现对定位欺骗的检测与弹性路由,恢复滚动规划的成本优势。

Comments 20 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25376 2026-08-27 cs.ET eess.SY 新提交 78%

GPU-Accelerated Quantum Annealing-Inspired UAV Path Planning for Smart Agriculture

GPU加速的量子退火启发式无人机路径规划在智慧农业中的应用

Maho Hirahara, Aohan Li

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出GPU并行伊辛求解器框架,将智慧农业无人机路径规划问题转化为QUBO模型,仿真显示其性能优于遗传算法和模拟退火,可作为大规模智慧农业的稳健实时解决方案。

Comments 6 pages, 3 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25392 2026-08-27 cond-mat.mtrl-sci 新提交 78%

Interpretable physics-informed retrieval-augmented generation language model for end-to-end inorganic crystal synthesis planning

用于端到端无机晶体合成规划的可解释物理信息增强检索生成语言模型

Wei-Jian Jiang, Ye-Nan Sha, Hui Guo, Jie Chen, Yu-Cai Liang, Ke Zhou, Qi-Long Gao, Dong-Lin Han, Xin-Gao Gong, Wan-Jian Yin

专题命中 规划决策 :planning(title,abstract)

AI总结 本研究开发可解释PIRAG-LM模型,构建含13820种晶体的SSKB,合成方法预测准确率达91.4%,指导合成5种新化合物,为材料发现与实验搭建桥梁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21946 2026-08-27 cs.CL cs.AI cs.LG 版本更新 78%

EDGE: Experience-Distillation for Guided Exploration in Agentic Reinforcement Learning

EDGE:智能体强化学习中引导探索的经验蒸馏方法

Can Xie, Yuyi Zhou, Wen Yang, Ziyi zhang, Siyao Song, Yingzhuo Deng, Shuo Ren, Jiajun Zhang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Wuhan AI Research(武汉人工智能研究院)

专题命中 规划决策 :agentic(title);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出EDGE框架,将检索的经验内化到策略中,在ALFWorld和WebShop数据集7B规模下较GRPO提升8.3、12.5个成功率百分点,移除外部经验后仍保留96.0%支架性能。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17172 2026-08-27 cs.NE 版本更新 78%

Automating Parent Selection Configuration in Genetic Programming with Agentic AI

用智能体人工智能实现遗传编程中父代选择配置的自动化

Jose Guadalupe Hernandez, Jui-Hsuan Chang, Anil Kumar Saini, Xi Li, Jason H. Moore

专题命中 规划决策 :agentic(title,abstract)

AI总结 该研究提出智能体AI框架,结合LLM推理与RAG实现遗传编程父代选择配置自动化,经符号回归测试,5 mini--AR配置表现优于锦标赛选择,为进化系统自动化设计提供了新路径。

Comments Updated Benchmarking figure with correct statistical test results

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13403 2026-08-27 cs.RO 版本更新 78%

Min-Max Regret Task Allocation and Planning of Heterogeneous Multi-Robot System in Partially Known Environments

部分已知环境中异构多机器人系统的最小-最大遗憾任务分配与规划

Xinkai Liang, Huixuan Chan, Ying Liu, Yangxi Shi, Hao Fang

专题命中 规划决策 :planning(title,abstract)

AI总结 针对部分已知环境中异构多机器人系统任务分配难题,提出基于最小-最大遗憾优化的框架,用区域绑定原子命题捕获资源不确定性,借助扩展规划决策树及新型分支定界策略,实现近线性可扩展性,性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25723 2026-08-27 cs.LG cs.AI 新提交 76%

It's a matter of timescale: non-linear utility in successor features and multi-objective planning and learning

这是一个时间尺度问题:后继特征与多目标规划和学习中的非线性效用

Liam P.H. Mertens, Lucas N. Alegre, Florent Delgrange, Diederik M. Roijers, Ann Nowé, Peter Vamplew

机构 * AI Lab, Vrije Universiteit Brussel(布鲁塞尔自由大学AI实验室) Institute of Informatics - Federal University of Rio Grande do Sul(南大河州联邦大学信息学研究所) Federation University Australia(澳大利亚联邦大学)

专题命中 规划决策 :planning(title);分类 cs.AI、cs.LG

AI总结 本文针对多目标强化学习及后继特征方法未考虑同一决策问题中不同时间尺度非线性效用效应的不足,通过示例论证后提出新视角,指出相关研究存在显著空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18073 2026-08-27 cs.AI cs.CL cs.LG 版本更新 75%

Infer Human's Intentions Before Following Natural Language Instructions

在遵循自然语言指令前推断人类的意图

Yanming Wan, Yue Wu, Yiping Wang, Jiayuan Mao, Natasha Jaques

专题命中 规划决策 :AI agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究针对人类指令的歧义问题,提出FISER框架,通过显式推断人类意图改进协作具身任务的指令遵循,在HandMeThat基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25518 2026-08-27 cs.AI 新提交 74%

Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models

智能体游戏开发:用于扩展世界模型的可验证轨迹数据引擎

Pengfei Zhou, Hexin Wang, Zhengfeiyang Zhang, Yixing Ma, Zhenglin Wan, Kaipeng Zhang, Wangbo Zhao, Yang You

机构 * Cardinal AI Lab(卡迪纳尔人工智能实验室) University of California, Berkeley(加州大学伯克利分校) Hong Kong University of Science and Technology(香港科技大学) National University of Singapore(新加坡国立大学) HPC-AI Lab(高性能计算与人工智能实验室)

专题命中 规划决策 :agentic(title);分类 cs.AI

AI总结 本文指出扩展世界模型的传统策略效率低,提出将游戏开发作为可验证轨迹数据引擎,构建RLHEV后训练范式,为空间世界模型提供高质量奖励信号与长程轨迹数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25474 2026-08-27 cs.CR cs.SE 新提交 74%

Separating Disclosure from Authorization: Field-Tier Minimization for Agent Action Mediation

将授权与披露分离:面向智能体动作调解的字段层级最小化

Jiten Oswal, John Cadeddu

专题命中 规划决策 :agent(title);分类 cs.SE

AI总结 该研究提出智能体动作调解的字段层级最小化方法,将参数字段分为三类,实现授权与披露分离,解决事实计算方问题并分析泄露,保障账本安全与审计需求。

Comments 19 pages, 2 figures, 5 tables. Describes an implemented system in private pilot deployment

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25771 2026-08-27 cs.HC cs.LG 新提交 70%

Large Language Model Few-Shot Prompting with Dilemma Training Outperforms Human Surrogates in Predicting Patient Preferences

采用困境训练的大语言模型少样本提示在预测患者偏好方面优于人类替代者

Natasha Ureyang, Sebastian Porsdam Mann, Yuxin Liu, Zuriel Hassirim, Melanie Almonte, Wenhao Chen, Joyce Ng, Thant Nay Lin, Aung Thiha, Gerald CH Koh, Brian David Earp, Pin Sym Foong

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.LG

AI总结 该研究提出采用困境训练的P4-DT智能体,通过12组患者-替代者配对实验,其预测患者治疗选择的准确率达81.7%,优于人类替代者及相关方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25622 2026-08-27 cs.CV cs.CL 新提交 70%

Plans You Can Check: Verifier-Grounded Learning of an Open-Weight Planner for Executable Video-Editing

可核查的方案:基于验证器的可执行视频编辑开放权重规划器学习

Haoyu Wang, Cheng Feng, Liuyang Bian, Ruiyang Huang, Lei Wei, Yafei Wen, Xiaoxin Chen, Xiaoying Tang

机构 * School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院) vivo AI Lab(vivo AI实验室) University of the Chinese Academy of Sciences(中国科学院大学) Southeast University(东南大学) Peking University(北京大学) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来智能网络研究院) Guangdong Provincial Key Laboratory of Future Networks of Intelligence, CUHK-Shenzhen(香港中文大学(深圳)广东省未来智能网络重点实验室)

专题命中 规划决策 :planning(abstract);workflow(abstract);分类 cs.CL

AI总结 针对可执行视频编辑规划问题,提出基于验证器的RefineCut及RefineCut-Evo方法,训练8B开放权重规划器,在基准上取得优于前沿模型的效果,代码与基准已公开。

Comments Accepted to the Main Conference of EMNLP '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25215 2026-08-27 cs.AI cs.MA q-bio.QM 新提交 70%

Federation Is Nearly Free, Reasoning Is Not: Tradeoffs for AI Co-Scientists in Protein Characterization Workflows

联合近乎免费,推理并非如此:AI 联合科学家在蛋白质表征工作流中的权衡

Maia Kapur, Timothy Boe, Abby Jerger, Paul Rigor

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究在生产级科学智能体平台上,对比联合拓扑、PPO策略及不同LLM等,发现LLM选择对蛋白质表征预测质量影响最大,PPO策略成本低且一致性好,联合对性能影响可忽略,为科学工作流智能体部署提供了指导。

Comments 24 Pages, 4 main figures, 5 main tables, 2 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22899 2026-08-27 cs.AI 版本更新 70%

CDEG: Learning Decision-Critical Evidence for Long-Horizon Diagnostic Agents

CDEG:为长程诊断智能体学习决策关键证据

Xiwei Dai, Zijie Meng, Zhiting Fan, Yixuan Tang, Guanyu Jiang, Ziru Niu, Zuozhu Liu

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本研究提出基于图的框架CDEG,通过对比同一病例的成功与失败轨迹、受控反事实干预等学习决策关键证据,在多基准测试中使长程诊断智能体准确率最高提升11.5%。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏