arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15819 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15819 篇

1911.10098 2022-02-24 cs.MA cs.HC cs.LO cs.RO 79%

Culture-Based Explainable Human-Agent Deconfliction

Alex Raymond, Hatice Gunes, Amanda Prorok

专题命中 Agent评测 :agent(title,abstract);autonomous agent(journal_ref)

Comments 9 pages, 4 figures

Journal ref AAMAS 2020: Proceedings of the 19th International Conference on Autonomous Agents and MultiAgent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.02020 2021-06-11 math.OC 79%

On the design of autonomous agents from multiple data sources

Émiland Garrabé, Giovanni Russo

专题命中 Agent评测 :autonomous agent(title,comments);agent(abstract)

Comments Extended version (12 pages) of the paper 'On the design of autonomous agents from multiple data sources' from the authors

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.07280 2018-02-22 cs.MA nlin.AO 79%

Simulating the Ridesharing Economy: The Individual Agent Metro-Washington Area Ridesharing Model

Joseph A. E. Shaheen

专题命中 Agent评测 :agent(title,abstract)

Comments 28 pages. Please cite as Shaheen, J. A. E., Simulating the Ride-sharing Economy: The Individual Agent Metro-Washington Area Ride-sharing Model, Complex Adaptive Systems: Views from the Physical, Natural, and Social Sciences, 2018. forthcoming

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.02938 2017-08-11 cs.MA nlin.PS q-bio.PE 79%

A Novel Formal Agent-based Simulation Modeling Framework of an AIDS Complex Adaptive System

Amnah Siddiqa, Muaz A. Niazi

专题命中 Agent评测 :agent(title,abstract)

Comments 8 pages, 4 figures

Journal ref International Journal of Agent Technologies and Systems (IJATS), 5(3), 33-53 (2013)

详情

展开后加载摘要…

URL PDF HTML 收藏
1611.07454 2016-11-23 cs.SI cs.MA 79%

An Agent-Based Model of Message Propagation in the Facebook Electronic Social Network

Hamid Reza Nasrinpour, Marcia R. Friesen, Robert D., McLeod

专题命中 Agent评测 :agent(title,abstract)

Comments Keywords: Agent-Based Modelling, Facebook, Information Diffusion, Online Social Networks; info: 19 pages, 9 figures, 8 tables, 1 appendix, and 63 references

详情

展开后加载摘要…

URL PDF HTML 收藏
0706.1860 2011-11-09 cs.MA cs.NI 79%

FIPA-based Interoperable Agent Mobility Proposal

Jordi Cucurull, Ramon Marti, Sergi Robles, Joan Borrell, Guillermo Navarro

专题命中 Agent评测 :agent(title,abstract)

Comments 10 pages, agent migration architecture proposal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23104 2026-08-26 cs.CL cs.AI 版本更新 79%

Molecular LLM Agents: From Architectural Design to Scientific Autonomy

分子大语言模型智能体:从架构设计到科学自主性

Jiatong Li, Wengyu Zhang, Weida Wang, Yuxuan Ren, Wei Liu, Chenyang Mao, Yuqiang Li, Yatao Bian, Changmeng Zheng, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出分子LLM智能体的概念框架,从架构设计和科学自主性阶梯两方面展开,为分子领域LLM智能体的比较、设计评估及部署提供指导。

Comments 25pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11683 2026-08-13 cs.AI cs.CL 新提交 79%

FrontierFinance: A Challenging Benchmark for Measuring Frontier Intelligence of Finance Agents

FrontierFinance:用于衡量金融智能体前沿智能的具有挑战性的基准

Yuhao Zhang, O. Ozan Koyluoglu, Thejas Venkatesh, Richard Diehl Martinez, Vishank Bhatia, Arash Alidoust, Ashwin Paranjape

机构 * Samaya AI(萨马亚人工智能公司)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 该研究推出覆盖投资者全流程的FrontierFinance基准,评估发现工具框架影响智能体表现,Samaya内部系统最优,开源模型Kimi K3成本更低且接近专有模型,最难用例为筛选与发现等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09282 2026-08-11 cs.AI cs.CL 新提交 79%

ComboShoppingBench: Evaluating LLM Agents for Budget-Constrained Basket Shopping with Coupons

ComboShoppingBench:评估大型语言模型智能体在带优惠券的预算约束组合购物篮任务中的表现

Adrian Li, Kelong Mao, Yudong Guo, Heming Xia, Xinwei Yang, Lirui Luo, Jace Wong, Pu Yao, Sulong Xu, Simiu Gu

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本研究推出ComboShoppingBench组合购物基准,通过探索智能体、LLM评判者及确定性验证,发现各类LLM智能体在该基准上表现不佳,凸显其在约束感知组合购物上仍有巨大改进空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08127 2026-08-11 cs.AI cs.LO cs.SE 新提交 79%

Improving Constraint Models with LLM Agents

用大语言模型智能体改进约束模型

Florentina Voboril, Stefan Szeider

机构 * TU Wien(维也纳技术大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出一种基于LLM智能体的框架,通过迭代诊断修复改进约束模型,在9个组合优化问题的27个测试实例中多数表现优于原模型,部分问题求解速度提升超两个数量级,证明自主智能体方法可支持约束模型优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27853 2026-08-10 cs.CL cs.AI q-fin.CP 版本更新 79%

FinanceHarness: Autonomous Financial Deep Research Framework

FinanceHarness:自主金融深度研究框架

Yijia Xiao, Rujun Han, Yanfei Chen, Zifeng Wang, Ke Jiang, Zhongying CuiZhu, Vishy Tirumalashetty, Wei Wang, Burak Gokturk, Tomas Pfister, Chen-Yu Lee

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 FinanceHarness是一款端到端自动化金融深度研究的自主框架,结合自主智能体与金融专用工具,在FinanceGym基准上大幅提升了金融研究评分规则得分。

Comments FinanceHarness available at https://github.com/Yijia-Xiao/FinanceHarness

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22148 2026-08-10 cs.AI cs.CL 版本更新 79%

Ratchet: How Reliable Must an LLM Judge Be to Retire a Skill?

Ratchet:一种最小化卫生的自演化LLM代理技能库

Xing Zhang, Yanwei Cui, Guanghui Wang, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS 生成式人工智能创新中心) HSBC Holdings Plc.(汇丰控股有限公司) HSBC Technology Center, China(汇丰技术中心,中国)

专题命中 Agent评测 :agent(abstract,abstract_cn);agentic(abstract_cn);分类 cs.AI、cs.CL

AI总结 本文提出Ratchet,一种单代理循环,使冻结的LLM能够自行编写、检索、整理和淘汰其自然语言技能,通过整合四个卫生机制提升技能库的生命周期管理,从而在MBPP+ hard-100数据集上显著提升性能。

Comments Code: https://github.com/amazon-science/Self-Evolving-Agents-Ratchet

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05797 2026-08-07 cs.LG cs.CL 新提交 79%

Predicting Task Difficulty Without Rollouts

无需展开预测任务难度

Stefan Krsteski, Charlotte Meyer

机构 * Andromede AI(安卓迈德人工智能)

专题命中 Agent评测 :agent(abstract);function calling(abstract);agentic(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对17个跨多领域的智能体基准,提出无需展开的任务难度预测方法,发现token级熵是有效预测信号,可通过难度残差暴露环境缺陷,助力校准基准与构建训练课程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26512 2026-08-03 cs.AI cs.CL 交叉投稿 79%

Evidence-Ledger Adjudication for Claim-Evidence Traceability

用于主张-证据可追溯性的证据账本裁决

Gengyu Chen, Yongjie Yu, Weiling Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) Syracuse University(雪城大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出证据账本裁决的主张-证据可追溯性工作流,构建2335行盲基准实验,结果显示智能体证据账本条件的关系准确率和宏F1显著优于非智能体基线,可退回需处理的主张并为AI辅助写作提供可审计可追溯层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18754 2026-07-22 cs.AI cs.CL 新提交 79%

AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents

AgentDebugX:用于大语言模型代理中故障可观测性、归因和恢复的开源工具包

Kunlun Zhu, Xuyan Ye, Zhiguang Han, Yuchen Zhao, Bingxuan Li, Weijia Zhang, Muxin Tian, Xiangru Tang, Pan Lu, James Zou, Jiaxuan You, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Toronto(多伦多大学) Google(谷歌公司) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究大语言模型代理故障调试难题,提出开源框架AgentDebugX,其核心DeepDebug通过多轮诊断定位根源,在基准测试中表现出色,能修复更多失败任务,还通过多种方式公开工作流程并提供错误中心。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15272 2026-07-17 cs.CL cs.AI 新提交 79%

SciDiagramEdit: Learning to Edit Scientific Diagrams from Paper Revisions

SciDiagramEdit:从论文修订中学习编辑科学图表

Yasheng Sun, Zezi Zeng, Yifan Yang, Chong Luo, Wenyi Wang, Ziwei Liu, Jürgen Schmidhuber

机构 * King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) Microsoft Research(微软研究院) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究针对科学论文图表编辑自动化的挑战,提出SciDiagramEdit框架,通过从arXiv版本历史挖掘数据,采用技能进化的智能体学习,能从自然论文修订中学习,提升编辑准确性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01709 2026-07-03 cs.AI cs.LG 新提交 79%

COMFYCLAW: Self-Evolving Skill Harnesses for Image Generation Workflows

COMFYCLAW:面向图像生成工作流的自进化技能工具包

Zongxia Li, Dawei Liu, Fuxiao Liu, Yuhang Zhou, Xiyang Wu, Jingxi Chen, Jing Xie, Xiaomin Wu, Lichao Sun

机构 * University of Maryland(马里兰大学) University of Pennsylvania(宾夕法尼亚大学) Nvidia(英伟达) Lehigh University(里海大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出COMFYCLAW框架,通过类型化图编辑、区域级VLM验证器和渐进式技能库进化,提升ComfyUI工作流构建的代理可靠性和性能,在多个基准上取得最佳平均评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11354 2026-07-01 cs.AI cs.CL 版本更新 79%

ReplicatorBench: Benchmarking LLM Agents for Replicability in Social and Behavioral Sciences

ReplicatorBench:用于社会科学和行为科学中可复制性评估的LLM代理基准测试

Bang Nguyen, Dominik Soós, Qian Ma, Rochana R. Obadage, Zack Ranjan, Sai Koneru, Timothy M. Errington, Shakhlo Nematova, Sarah Rajtmajer, Jian Wu, Meng Jiang

机构 * University of Notre Dame(圣母大学) Old Dominion University(老道明大学) Pennsylvania State University(宾夕法尼亚州立大学) Independent Researcher(独立研究员) Uppsala University(乌普萨拉大学) Center for Open Science(开放科学中心)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出ReplicatorBench,一个端到端的基准测试,用于评估AI代理在可复制性研究中的能力,涵盖数据提取、实验设计与结果解释三个阶段,并开发了ReplicatorAgent框架以评估不同LLM和编程语言的性能。

Comments Accepted to KDD 2026 AI4Sciences Track, Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21710 2026-06-23 cs.CL cs.AI cs.IR 新提交 79%

PrivacyAlign: Contextual Privacy Alignment for LLM Agents

PrivacyAlign: LLM代理的上下文隐私对齐

Manveer Singh Tamber, Abhay Puri, Marc-Etienne Brunet, Perouz Taslakian, Jimmy Lin, Spandana Gella

机构 * University of Waterloo(滑铁卢大学) ServiceNow AI Research(ServiceNow AI 研究) McGill University(麦吉尔大学) Mila -- Quebec AI Institute(米拉——魁北克人工智能研究所)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出PrivacyAlign数据集,通过人类标注对齐LLM代理的隐私决策,并引入基于标注的奖励建模以提升隐私对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18805 2026-05-20 cs.IR cs.AI cs.LG 79%

RecoAtlas: From Semantic Plausibility to Set-Level Utility in LLM Recommendation Agents

RecoAtlas: 从语义合理性到集级效用在LLM推荐代理中

Imad Aouali, Flavian Vasile, Otmane Sakhi, Alexandre Gilotte, Benjamin Heymann

机构 * Criteo AI Lab(Criteo人工智能实验室)

专题命中 Agent评测 :agentic(abstract,abstract_cn);tool-use(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RecoAtlas,一个用于评估购物代理的基准和工具包,通过行为基础的度量标准来评估推荐代理的性能,揭示语义合理性并不一定代表行为基础的效用。

Comments Benchmark on LLM Recommendation Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07062 2026-05-11 cs.SE cs.AI 79%

From Assistance to Agency: Rethinking Autonomy and Control in CI/CD Pipelines

从协助到自主:重新思考CI/CD流水线中的自主性与控制

Marcus Emmanuel Barnes, Taher A. Ghaleb, Safwat Hassan

机构 * Faculty of Information University of Toronto Toronto Ontario Canada(信息学院多伦多大学多伦多安大略加拿大) Department of Computer Science Trent University Peterborough Ontario Canada(计算机科学系特伦特大学彼得伯格安大略加拿大) University of Toronto(多伦多大学) Trent University(特伦特大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文探讨CI/CD流水线中自主性与控制的重新定义,提出授权转移的设计挑战,分析当前系统在数据平面的操作限制,并提出控制平面安全与治理机制的研究方向。

Comments Accepted to the 3rd ACM International Conference on AI-Powered Software (AIware 2026), Main Track, Montreal, Canada, July 6-7, 2026. 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13418 2026-04-16 cs.CL cs.AI cs.CV 79%

MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments

MERRIN:一种多模态证据检索与推理的基准,用于噪声网络环境

Han Wang, David Wan, Hyunji Lee, Thinh Pham, Mikaela Cankosyan, Weiyuan Chen, Elias Stengel-Eskin, Tu Vu, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Virginia Tech(弗吉尼亚理工大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 MERRIN基准评估搜索增强代理在噪声网络环境中的多模态证据检索与推理能力,通过自然语言查询和多模态证据检索测试,发现现有模型在复杂任务中表现有限,需进一步提升多模态处理能力。

Comments First three authors contributed equally. Project Page: https://merrin-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04872 2026-04-07 cs.CL cs.LG 79%

Synthetic Sandbox for Training Machine Learning Engineering Agents

合成沙盒用于训练机器学习工程代理

Yuhang Zhou, Lizhu Zhang, Yifan Wu, Jiayi Liu, Xiangjun Fan, Zhuokai Zhao, Hong Yan

机构 * Meta AI

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SandMLE框架,通过生成多样化的合成机器学习工程环境,显著提升机器学习工程代理的训练效率,实现大规模在线策略学习,并在多个基准测试中取得显著性能提升。

Comments 28 pages, 9 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27176 2026-04-06 cs.AI cs.CL cs.DC 79%

Glia: A Human-Inspired AI for Automated Systems Design and Optimization

Glia:一种受人类启发的AI,用于自动化系统设计与优化

Pouya Hamadanian, Pantea Karimi, Arash Nasr-Esfahany, Kimia Noorbakhsh, Joseph Chandler, Ali ParandehGheibi, Mohammad Alizadeh, Hari Balakrishnan

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Independent Researcher(独立研究员)

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 Glia通过人类启发的多智能体工作流利用大语言模型,生成可解释的系统设计,展示了AI在复杂系统问题中创造性和可理解性的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27404 2026-03-31 cs.AI cs.CL cs.CY cs.HC cs.MA 79%

Heterogeneous Debate Engine: Identity-Grounded Cognitive Architecture for Resilient LLM-Based Ethical Tutoring

异质辩论引擎:基于身份的认知架构用于鲁棒的基于大语言模型的伦理导师

Jakub Masłowski, Jarosław A. Chudziak

机构 * Institute of Computer Science, Warsaw University of Technology(华沙理工大学计算机科学研究所)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出异质辩论引擎,结合身份导向检索增强生成与启发式理论思维,解决多代理系统在伦理教学中保持精确回答的挑战。

Comments 15 pages, 3 figures, 4 tables. Accepted at ACIIDS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18447 2026-03-20 cs.DB cs.AI cs.CL cs.CV cs.IR 79%

SODIUM: From Open Web Data to Queryable Databases

SODIUM:从开放网络数据到可查询数据库

Chuxuan Hu, Philip Li, Maxwell Yang, Daniel Kang

机构 * UIUC(伊利诺伊大学香槟分校)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 研究针对需要整合多源网络数据的分析问题,提出SODIUM任务,通过系统化构建潜在数据库支持查询。开发SODIUM-Agent系统,采用ATP-BFS算法实现深度网络探索与结构化信息提取,准确率达91.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16397 2026-03-18 cs.CL cs.AI 79%

Fanar 2.0: Arabic Generative AI Stack

Fanar 2.0:阿拉伯生成AI堆栈

FANAR TEAM, Ummar Abbas, Mohammad Shahmeer Ahmad, Minhaj Ahmad, Abdulaziz Al-Homaid, Anas Al-Nuaimi, Enes Altinisik, Ehsaneddin Asgari, Sanjay Chawla, Shammur Chowdhury, Fahim Dalvi, Kareem Darwish, Nadir Durrani, Mohamed Elfeky, Ahmed Elmagarmid, Mohamed Eltabakh, Asim Ersoy, Masoomali Fatehkia, Mohammed Qusay Hashim, Majd Hawasly, Mohamed Hefeeda, Mus'ab Husaini, Keivin Isufaj, Soon-Gyo Jung, Houssam Lachemat, Ji Kim Lucas, Abubakr Mohamed, Tasnim Mohiuddin, Basel Mousi, Hamdy Mubarak, Ahmad Musleh, Mourad Ouzzani, Amin Sadeghi, Husrev Taha Sencar, Mohammed Shinoy, Omar Sinan, Yifan Zhang

机构 * Qatar Computing Research Institute (QCRI)(卡塔尔计算研究 institute) Hamad Bin Khalifa University(哈马德·本·卡西姆大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 Fanar 2.0在资源受限条件下实现卓越性能,通过数据质量优先、持续预训练和模型融合,提升阿拉伯语知识、语言、方言及英语能力,同时引入多项新功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02345 2026-03-04 cs.SE cs.AI cs.MA 79%

RIVA: Leveraging LLM Agents for Reliable Configuration Drift Detection

RIVA: 利用LLM代理进行可靠的配置漂移检测

Sami Abuzakuk, Lucas Crijns, Anne-Marie Kermarrec, Rafael Pires, Martijn de Vos

机构 * EPFL(瑞士洛桑联邦理工学院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 RIVA通过多代理系统和交叉验证技术,提高在工具响应错误时的IaC验证可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16179 2026-03-03 cs.AI cs.LG 79%

EnterpriseBench Corecraft: Training Generalizable Agents on High-Fidelity RL Environments

EnterpriseBench Corecraft: 在高保真RL环境中训练通用智能体

Sushant Mehta, Logan Ritchie, Suhaas Garre, Ian Niebres, Nick Heiner, Edwin Chen

机构 * Surge AI

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 在高保真RL环境中训练智能体,通过CoreCraft环境验证其在多步骤领域任务中的泛化能力,提升任务通过率并转移至多个基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17641 2026-02-20 cs.LG cs.AI 79%

FAMOSE: A ReAct Approach to Automated Feature Discovery

FAMOSE:一种用于自动化特征发现的ReAct方法

Keith Burghardt, Jienan Liu, Sadman Sakib, Yuning Hao, Bo Li

机构 * Amazon.com, Inc.(亚马逊公司)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 FAMOSE通过ReAct方法实现自动化特征发现,显著提升分类和回归任务的性能,展示了AI代理在创新解决方案中的有效性。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏