arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3244 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3244 篇

2608.13122 2026-08-14 cs.DC 新提交 75%

Validation-Centric AI-Assisted GPU Porting of a 250,000+ Line Legacy Weather Simulation Code

面向验证的25万行以上遗留气象模拟代码的AI辅助GPU移植

Tetsuya Hoshino, Masaya Kato, Kazuhisa Tsuboki, Daichi Mukunoki, Takahiro Katagiri, Toshihiro Hanawa

专题命中 软件智能体 :agent(abstract);AI agent(abstract);workflow(abstract)

AI总结 本文以遗留Fortran气象模拟代码CReSS为例,提出面向验证的AI辅助GPU移植工作流,为162个内核生成经数值验证的GPU实现,获5.1倍应用级加速,还检测到5个内核的数值不一致。

Comments 11 pages, 1 figure, 3 tables. Submitted to AgenticAI4HPC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11157 2026-07-28 hep-ph astro-ph.CO physics.comp-ph 版本更新 75%

DarkAgents

DarkAgents:利用大语言模型和确定性测试代码构建理论天体粒子物理研究的协同管道

Michele Lucente, Silvia Pascoli, Filippo Sala, Matteo Zandi

专题命中 软件智能体 :agent(abstract);agentic(abstract);multi-agent(abstract)

AI总结 DarkAgents利用大语言模型和确定性测试代码构建理论天体粒子物理研究的协同管道,解决模型构建、复杂计算和假设审计等挑战,提供参数拟合、约束条件及假设审计报告。

Comments 12 pages, 2 figures, code at https://github.com/PhysicsZandi/DarkAgents

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14854 2026-07-17 astro-ph.CO 新提交 75%

CAMB v2: cosmological power spectra for high-precision surveys

CAMB v2:用于高精度巡天的宇宙学功率谱

Antony Lewis

专题命中 软件智能体 :AI agent(summary_cn,abstract)

AI总结 该研究针对即将到来的CMB和大尺度结构巡天需求,对CAMB进行重大更新,通过新处理超球贝塞尔函数等方法,为透镜化CMB和物质功率谱提供快速高精度预测,满足收敛目标,还探讨了相关约定依赖性,新算法和代码由LLMs或AI agents在人类监督下开发。

Comments 25 pages, 4 figures. Code available at https://github.com/cmbant/camb

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18542 2026-07-08 cs.CR cs.AI cs.CL cs.LG 版本更新 75%

SecureCode: A Production-Grade Multi-Turn Dataset for Training Security-Aware Code Generation Models

SecureCode:用于训练安全意识代码生成模型的生产级多轮数据集

Scott Thornton

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究针对AI编码助手生成漏洞代码问题,提出SecureCode数据集,涵盖网络应用安全和AI/ML安全领域,有特定对话结构,经质量保证,发布统一数据集、开源模型及评估框架,是首个提供相关覆盖的公共数据集。

Comments 30 pages, 12 figures, 10 tables. Dataset available at https://huggingface.co/datasets/scthornton/securecode. Code and validation tools at https://github.com/scthornton/securecode

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00131 2026-06-02 cs.SE cs.AI cs.LG cs.PL 75%

AI-PROPELLER: Warehouse-Scale Interprocedural Code Layout Optimization with AlphaEvolve

AI-PROPELLER:基于AlphaEvolve的仓库规模过程间代码布局优化

Chaitanya Mamatha Ananda, Rajiv Gupta, Mircea Trofin, Aiden Grossman, Sriraman Tallam, Xinliang David Li, Amir Yazdanbakhsh

机构 * University of California, Riverside(加州大学河滨分校) Google(谷歌) DeepMind(深度思维)

专题命中 软件智能体 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 提出AI-PROPELLER系统,利用Magellan智能工作流将Propeller的编译器启发式方法演化为细粒度过程间优化器,并通过实际硬件执行评估布局变体,首次在工业仓库规模应用中实现细粒度过程间代码布局优化,性能提升0.23%至1.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28751 2026-05-28 cs.LG cs.AI cs.CL 75%

Extrapolative Weight Averaging Reveals Correctness-Efficiency Frontiers in Code RL

外推权重平均揭示代码强化学习中的正确性-效率前沿

Kunhao Zheng, Pierre Chambon, Juliette Decugis, Jonas Gehring, Taco Cohen, Benjamin Negrevergne, Gabriel Synnaeve

机构 * Meta Superintelligence Labs - FAIR(Meta超智能实验室 - FAIR)

专题命中 软件智能体 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 通过外推权重平均,无需额外RL训练即可扩展微调检查点间的帕累托前沿,在竞争性编程中实现正确性与效率的权衡,并提升推理时性能。

Comments 54 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24755 2026-05-11 cs.SE cs.AI cs.CL 75%

SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks

SlopCodeBench:评估编码代理在长周期迭代任务中性能退化的基准测试

Gabriel Orlanski, Devjeet Roy, Alexander Yun, Changho Shin, Alex Gu, Albert Ge, Dyah Adila, Nicholas Roberts, Frederic Sala, Aws Albarghouthi

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Washington State University(华盛顿州立大学) MIT(麻省理工学院)

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出SlopCodeBench,通过36个问题和196个检查点评估编码代理在长周期迭代任务中的性能退化,发现代理代码在结构上逐渐退化并产生冗余代码,人类代码退化更慢。

Comments Code and Leaderboards are located at https://www.scbench.ai

详情
URL PDF HTML 收藏
2603.03456 2026-04-27 cs.AI cs.CL cs.SE 75%

Asymmetric Goal Drift in Coding Agents Under Value Conflict

编码代理在价值冲突下的非对称目标漂移

Magnus Saebo, Spencer Gibson, Tyler Crosse, Achyutha Menon, Eyon Jang, Diogo Cruz

机构 * Columbia University(哥伦比亚大学) Independent(独立) Georgia Tech(佐治亚理工学院) UC San Diego(加州大学圣地亚哥分校) MATS SPAR

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 研究编码代理在价值冲突中如何平衡系统提示与实际任务,发现其目标漂移受价值对齐、对抗压力和累积上下文影响,且环境压力可 override 显式约束。

Comments 5 pages, 4 figures, Published as a workshop paper in Lifelong Agents @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13107 2026-04-16 cs.SE cs.AI cs.LG 75%

Can Coding Agents Be General Agents?

编码代理可以是通用代理吗?

Maksim Ivanov, Abhijay Rana, Gokul Prabhakaran

机构 * Agentic Labs

专题命中 软件智能体 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 本文探讨编码代理能否实现端到端业务流程自动化,发现其在简单任务上表现可靠,但在复杂任务上存在瓶颈,指出领域逻辑与代码执行的衔接是通用性关键障碍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17829 2026-03-19 cs.SE cs.AI cs.CL 75%

CodeScout: An Effective Recipe for Reinforcement Learning of Code Search Agents

CodeScout: 一种有效的强化学习代码搜索代理训练方法

Lintang Sutawika, Aditya Bharat Soni, Bharath Sriraam R R, Apurva Gandhi, Taha Yassine, Sanidhya Vijayvargiya, Yuchen Li, Xuhui Zhou, Yilin Zhang, Leander Melroy Maben, Graham Neubig

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出CodeScout,通过强化学习方法训练仅使用标准Unix终端的代码搜索代理,实验证明其在多个基准测试中优于大型语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16733 2026-03-18 cs.AI cs.CL cs.SE 75%

IQuest-Coder-V1 Technical Report

IQuest-Coder-V1 技术报告

Jian Yang, Wei Zhang, Shawn Guo, Zhengmao Ye, Lin Jing, Shark Liu, Yizhi Li, Jiajun Wu, Cening Liu, X. Ma, Yuyang Song, Siwei Wu, Yuwen Li, L. Liao, T. Zheng, Ziling Huang, Zelong Huang, Che Liu, Yan Xing, Renyuan Li, Qingsong Cai, Hanxu Yan, Siyue Wang, Shikai Li, Jason Klein Liu, An Huang, Yongsheng Kang, Jinxing Zhang, Chuan Hao, Haowen Wang, Weicheng Gu, Ran Tao, Mingjie Tang, Peihao Wu, Jianzhou Wang, Xianglong Liu, Weifeng Lv, Bryan Dai

机构 * IQuest Coder Team(IQuest Coder团队)

专题命中 软件智能体 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本文介绍IQuest-Coder-V1系列模型,通过代码流多阶段训练范式提升软件逻辑动态演化能力,结合预训练、中训练和后训练阶段,实现代码智能在代理软件工程、编程竞赛和复杂工具使用中的先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16124 2026-03-18 cs.SE cs.AI cs.CL 75%

SWE-QA-Pro: A Representative Benchmark and Scalable Training Recipe for Repository-Level Code Understanding

SWE-QA-Pro:一个代表性的基准和可扩展的训练配方用于仓库级代码理解

Songcheng Cai, Zhiheng Lyu, Yuansheng Ni, Xiangchao Chen, Baichuan Zhou, Shenzhe Zhu, Yi Lu, Haozhe Wang, Chi Ruan, Benjamin Schneider, Weixu Zhang, Xiang Li, Andy Zheng, Yuyu Zhang, Ping Nie, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) University of Toronto(多伦多大学) The Hong Kong University of Science and Technology(香港科学与技术大学) McGill University & MILA(麦吉尔大学及MILA) Verdent AI, Inc.(Verdent AI公司)

专题命中 软件智能体 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出SWE-QA-Pro基准,通过多样化的长尾仓库和可执行环境构建,验证了代理工作流在代码理解任务中的优势,并提出可扩展的合成数据管道和两阶段训练方法,使小型模型在复杂行为学习中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15538 2026-03-17 quant-ph 75%

QiboAgent: a practitioner's guideline to open source assistants for Quantum Computing code development

QiboAgent:量子计算代码开发开源助手的实践指南

Lorenzo Esposito, Andrea Papaluca, Stefano Carrazza

专题命中 软件智能体 :autonomous agent(abstract);workflow(abstract);agentic(abstract)

AI总结 本文提出QiboAgent,通过轻量级开源大语言模型与定制工作流架构,提升量子计算中间件代码生成的准确性和自动化能力,实现90.2%的高精度代码生成。

Comments 13 pages, 9 figures, 1 table. Source code and deployment instructions are publicly available at https://github.com/qiboteam/qiboagent

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13023 2026-03-17 cs.SE cs.AI cs.CL 75%

daVinci-Env: Open SWE Environment Synthesis at Scale

daVinci-Env:大规模开放软件工程环境合成

Dayuan Fu, Shenyu Wu, Yunze Wu, Zerui Peng, Yaxing Huang, Jie Sun, Ji Zeng, Mohan Jiang, Lin Zhang, Yukun Li, Jiarui Hu, Liming Liu, Jinlong Hou, Pengfei Liu

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出OpenSWE,一个大规模透明的软件工程代理训练框架,包含45320个可执行Docker环境,通过多代理合成管道和质量过滤流程,实现高效学习和高质量训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23361 2026-02-03 cs.SE cs.CL cs.LG 75%

SWE-Exp: Experience-Driven Software Issue Resolution

SWE-Exp:基于经验的软件问题解决

Silin Chen, Shaoxin Lin, Yuling Shi, Heng Lian, Xiaodong Gu, Longfei Yun, Dong Chen, Lin Cao, Jiyang Liu, Nu Xia, Qianxiang Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei(华为) Xidian University(西安电子科技大学)

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.CL、cs.LG、cs.SE

AI总结 SWE-Exp通过提炼历史经验实现软件问题解决的持续学习,显著提升修复效率。

Comments Our code and data are available at https://github.com/YerbaPage/SWE-Exp

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13295 2026-01-27 cs.LG cs.AI cs.CL cs.MA cs.SI 75%

CooperBench: Why Coding Agents Cannot be Your Teammates Yet

CooperBench:为何编码代理还不能成为你的队友

Arpandeep Khatua, Hao Zhu, Peter Tran, Arya Prabhudesai, Frederic Sadrieh, Johann K. Lieberwirth, Xinkai Yu, Yicheng Fu, Michael J. Ryan, Jiaxin Pei, Diyi Yang

机构 * Stanford University(斯坦福大学) SAP Labs US(SAP美国实验室)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 CooperBench通过大规模协作编码任务测试,发现AI代理在团队协作中表现不佳,揭示了沟通障碍、承诺偏离和期望错误等关键问题,呼吁发展社交智能。

Comments https://cooperbench.com First two authors contribute equally. The 3th - 6th authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11665 2026-01-14 cs.PL cs.MA 75%

StackPilot: Autonomous Function Agents for Scalable and Environment-Free Code Execution

StackPilot: 用于可扩展和无环境代码执行的自主函数代理

Xinkui Zhao, Yifan Zhang, Zhengyi Zhou, Yueshen Xu

专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);multi-agent(abstract)

AI总结 StackPilot通过自主函数代理和栈式调度策略,实现语言无关的代码验证与执行,提升LLM生成代码的可靠性与可执行性。

Comments This method needs to be reconsidered and there is something wrong with experiment

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03178 2026-01-07 cs.CV 75%

DiffBench Meets DiffAgent: End-to-End LLM-Driven Diffusion Acceleration Code Generation

DiffBench 与 DiffAgent:端到端的 LLM 驱动扩散加速代码生成

Jiajun jiao, Haowei Zhu, Puyuan Yang, Jianghui Wang, Ji Liu, Ziqiong Liu, Dong Li, Yuejian Fang, Junhai Yong, Bin Wang, Emad Barsoum

专题命中 软件智能体 :agent(abstract);planning(abstract);workflow(abstract)

AI总结 本文提出DiffBench和DiffAgent,通过LLM驱动的闭环流程,实现端到端的扩散模型加速代码生成,显著提升生成策略的有效性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13857 2025-12-18 cs.AI cs.CL cs.LG cs.MA cs.NE 75%

EvoLattice: Persistent Internal-Population Evolution through Multi-Alternative Quality-Diversity Graph Representations for LLM-Guided Program Discovery

EvoLattice: 通过多替代质量-多样性图表示实现持久内部种群进化以指导LLM引导的程序发现

Kamer Ali Yuksel

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 EvoLattice通过多替代质量-多样性图表示实现持久内部种群进化,提升LLM引导程序发现的稳定性、表达力和改进轨迹

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02387 2025-10-13 cs.SE cs.AI cs.LG 75%

CWM: An Open-Weights LLM for Research on Code Generation with World Models

FAIR CodeGen team, Jade Copet, Quentin Carbonneaux, Gal Cohen, Jonas Gehring, Jacob Kahn, Jannik Kossen, Felix Kreuk, Emily McMilin, Michel Meyer, Yuxiang Wei, David Zhang, Kunhao Zheng, Jordi Armengol-Estapé, Pedram Bashiri, Maximilian Beck, Pierre Chambon, Abhishek Charnalia, Chris Cummins, Juliette Decugis, Zacharias V. Fisches, François Fleuret, Fabian Gloeckle, Alex Gu, Michael Hassid, Daniel Haziza, Badr Youbi Idrissi, Christian Keller, Rahul Kindi, Hugh Leather, Gallil Maimon, Aram Markosyan, Francisco Massa, Pierre-Emmanuel Mazaré, Vegard Mella, Naila Murray, Keyur Muzumdar, Peter O'Hearn, Matteo Pagliardini, Dmitrii Pedchenko, Tal Remez, Volker Seeker, Marco Selvi, Oren Sultan, Sida Wang, Luca Wehrstedt, Ori Yoran, Lingming Zhang, Taco Cohen, Yossi Adi, Gabriel Synnaeve

机构 * Meta FAIR CodeGen Team(FAIR CodeGen团队)

专题命中 软件智能体 :planning(abstract);agentic(abstract);分类 cs.AI、cs.LG、cs.SE

Comments 58 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13941 2025-09-18 cs.SE cs.AI cs.CL 75%

An Empirical Study on Failures in Automated Issue Solving

Simiao Liu, Fang Liu, Liehao Li, Xin Tan, Yinghao Zhu, Xiaoli Lian, Li Zhang

机构 * Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11237 2025-08-01 cs.AI cs.CL cs.SE 75%

Collaboration is all you need: LLM Assisted Safe Code Translation

Rabimba Karanjai, Sam Blackshear, Lei Xu, Weidong Shi

机构 * University Of Houston(休斯顿大学) Mysten Labs(Mysten实验室) Kent State University(肯特州立大学)

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02003 2025-06-30 cs.SE cs.AI cs.LG cs.PL 75%

L2MAC: Large Language Model Automatic Computer for Extensive Code Generation

Samuel Holt, Max Ruiz Luyten, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学)

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG、cs.SE

Comments Published in The Twelfth International Conference on Learning Representations (ICLR), 2024. Copyright 2023 by the author(s)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11107 2025-04-17 cs.SE cs.AI cs.CL cs.DC cs.NI 75%

ChaosEater: Fully Automating Chaos Engineering with Large Language Models

Daisuke Kikuta, Hiroki Ikeuchi, Kengo Tajiri

专题命中 软件智能体 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

Comments 114 pages (7 main), 11 figures. Project page: https://ntt-dkiku.github.io/chaos-eater

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11915 2024-10-11 cs.SE cs.AI cs.LG 75%

miniCodeProps: a Minimal Benchmark for Proving Code Properties

Evan Lohn, Sean Welleck

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08335 2024-08-19 cs.SE cs.AI cs.CL 75%

Plan with Code: Comparing approaches for robust NL to DSL generation

Nastaran Bassamzadeh, Chhaya Methani

专题命中 软件智能体 :planning(abstract);workflow(abstract);分类 cs.AI、cs.CL、cs.SE

Comments 9 pages, 1 figure, 5 tables. arXiv admin note: substantial text overlap with arXiv:2407.02742

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.07511 2021-08-05 cs.AI cs.CL cs.CV cs.IR cs.LG 75%

Ensemble of MRR and NDCG models for Visual Dialog

Idan Schwartz

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments Accepted to NAACL2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30353 2026-05-29 cs.AI astro-ph.CO cs.HC cs.SE 74%

Physics Is All You Need? A Case Study in Physicist-Supervised AI Development of Scientific Software

物理学就是一切?物理学家监督人工智能开发科学软件的案例研究

Nhat-Minh Nguyen

机构 * Kavli IPMU (WPI), UTIAS, The University of Tokyo(Kavli研究所(WPI)、UTIAS、东京大学) Center for Data-Driven Discovery(数据驱动发现中心) Institute For Interdisciplinary Research in Science(科学跨学科研究中心)

专题命中 软件智能体 :AI agent(abstract,comments);agent(abstract);分类 cs.AI、cs.SE

AI总结 通过一个物理学家监督AI编码代理开发可微扰动理论模块的案例,研究AI代理在科学软件开发中的可靠性,发现监督设计比模型能力更能决定输出可信度。

Comments 10 pages, 2 figures, 2 tables, 1 physicist and a few AI agents. Accepted by ICML 2026 AI for Science Workshop. Code and development log are available at this repo: https://github.com/MinhMPA/clax-pt

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09388 2026-04-28 cs.SE cs.AI 74%

The AI Codebase Maturity Model: From Assisted Coding to Fully Autonomous Systems

AI代码库成熟度模型:从辅助编码到完全自主系统

Andy Anderson

机构 * IBM Research — Hybrid Cloud and AI Platform(IBM混合云和人工智能平台研究院)

专题命中 软件智能体 :agent(abstract,comments);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出AI代码库成熟度模型(ACMM),通过100天经验报告和Hive系统验证,展示代码库从基础AI辅助到完全自主的六级进化框架,强调测试覆盖率和反馈机制是关键因素。

Comments 30 pages, 7 tables. v2: Extended to 6 levels. Added Level 6 (Fully Autonomous), Hive reference implementation, Beads for agent memory continuity, throughput acceleration data. Metrics updated to 100 days. Source: https://github.com/kubestellar/console and https://github.com/kubestellar/hive

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22758 2026-08-11 cs.AI 版本更新 74%

AutoRefine: Compiling Trajectories into Validated Typed Agent Artifacts

AutoRefine: 从轨迹到可重用的专业知识为连续LLM代理优化

Libin Qiu, Zhirong Gao, Junfu Chen, Yuhang Ye, Liangyu Li, Weizhi Huang, Xiaobo Xue, Wenkai Qiu, Shuo Tang

机构 * alibaba(阿里巴巴集团)

专题命中 软件智能体 :agent(title);分类 cs.AI

AI总结 AutoRefine通过提取和维护双重形式的经验模式,提升连续LLM代理的知识积累与维护效率,实现98.4%的准确率提升。

Comments 7 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏