arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 10492 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 10492 篇

2605.11844 2026-05-15 cs.SE 79%

The Death Spiral of Open Source Projects: A Post-Mortem Analysis of Pull Request Workflow Dynamics

开源项目的死亡螺旋:对拉取请求工作流动态的回顾分析

Mohit Kaushik, Kuljit Kaur Chahal

专题命中 工作流自动化 :workflow(title,abstract);分类 cs.SE

AI总结 本文通过分析1736个非活跃GitHub仓库和130万个人驱动的拉取请求,揭示了拉取请求工作流中摩擦、审查周期延长和负面惩罚等微观动态对开源项目生存的影响,发现项目寿命由内在价值和生态系统动态决定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12443 2026-05-13 eess.SY astro-ph.IM cs.MS cs.SE cs.SY 79%

Basilisk and Docker for Reproducible GN&C Simulation: A Workflow Reference

Basilisk和Docker用于可重复的GN&C模拟:一个工作流参考

Anubhav Gupta

专题命中 工作流自动化 :workflow(title,abstract);分类 cs.SE

AI总结 本文提出基于Docker的Basilisk工作流,提供可重复和可移植的GN&C模拟环境,涵盖从轨道动力学到姿态动力学的复杂模拟场景。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11221 2026-05-13 q-bio.QM cs.LG 79%

Beyond Manual Curation: Augmenting Targeted Protein Degradation Databases via Agentic Literature Extraction Workflows

超越手动整理:通过代理文献提取流程增强靶向蛋白降解数据库

Yaochen Rao, Farzaneh Jalalypour, N. M. Anoop Krishnan, Rocío Mercado

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Chalmers University of Technology(楚姆勒斯技术大学) University of Gothenburg(哥德堡大学) Yardi School of Artificial Intelligence(Yardi人工智能学院) Indian Institute of Technology Delhi(德里印度理工学院)

专题命中 工作流自动化 :agentic(title);workflow(abstract);分类 cs.LG

AI总结 本文提出一种基于代理的LLM工作流,通过三角比较提升靶向蛋白降解数据库的提取效率,实现了数据库的自动化扩展与验证,提高了数据质量和应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08520 2026-05-12 cs.LG cs.DC 79%

FlashEvolve: Accelerating Agent Self-Evolution with Asynchronous Stage Orchestration

FlashEvolve:通过异步阶段协调加速智能体自我进化

Zhengding Hu, Mingge Lu, Zhen Wang, Jixuan Ruan, Chang Chen, Zaifeng Pan, Yue Guan, Ruiyi Wang, Zhongkai Yu, Chao Zhang, Yufei Ding

机构 * University of California, San Diego(加州大学圣地亚哥分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 工作流自动化 :agent(title);workflow(abstract);分类 cs.LG

AI总结 本文提出FlashEvolve框架,通过异步工作流和队列降低智能体自我进化的时间成本,提升吞吐量和token效率,在GEPA任务中实现3.5倍和4.9倍的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08480 2026-05-12 cs.AI 79%

AI-Care: A Conversational Agentic System for Task Coordination in Alzheimer's Disease Care

AI-Care:一种用于阿尔茨海默病护理的任务协调对话代理系统

Preyash Yadav, Michelle Cohn, Priyanka Koppolu, Hritvik Agarwal, Amey Gohil, Tejas Patil, Sasha Pimento, Alyssa Weakley

机构 * Department of Computer Science(计算机科学系) Department of Linguistics(语言学系) Department of Neurology(神经病学系) University of California, Davis(加州大学戴维斯分校)

专题命中 工作流自动化 :agentic(title,abstract);分类 cs.AI

AI总结 AI-Care通过自然语言交互降低阿尔茨海默病患者使用数字工具的认知负担,通过语音优先聊天机器人实现日程提醒和待办事项管理,采用状态化 orchestration 方法确保安全性和准确性。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08445 2026-05-12 cs.AI 79%

Measuring What Matters: Benchmarking Generative, Multimodal, and Agentic AI in Healthcare

衡量重要性:在医疗保健中基准测试生成、多模态和代理AI

Prasanna Desikan, Harshit Rajgarhia, Shivali Dalmia, Ananya Mantravadi

机构 * Centific AI Research(Centific人工智能研究)

专题命中 工作流自动化 :agentic(title);workflow(abstract);分类 cs.AI

AI总结 本文探讨了在医疗保健中评估生成、多模态和代理AI的基准测试方法,强调了现有基准测试在可靠性、安全性和临床相关性方面的不足,提出需要系统性的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00425 2026-05-11 cs.AI 79%

AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning

AEM:多轮代理强化学习中的自适应熵调节

Haotian Zhao, Songlin Zhou, Yuxin Zhang, Stephen S. -T. Yau, Wenyu Zhang, Lun Tian, Tianshu Zhu, Yifeng Huang, Yucheng Zeng, Jingnan Gu, Daxiang Dong, Jianmin Wu

机构 * Baidu(百度) Tsinghua University(清华大学) Fudan University(复旦大学)

专题命中 工作流自动化 :agentic(title,abstract);分类 cs.AI

AI总结 AEM通过自适应调节熵动态,改进多轮代理强化学习中的探索与利用平衡,无需监督即可提升性能。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01390 2026-05-08 cs.HC cs.AI 79%

Toward Scalable Audio Description Quality Control: A Workflow for Evaluating Human and VLM Raters

迈向可扩展的音频描述质量控制:评估人类和VLM评分者的流程

Lana Do, Gio Jung, Juvenal Francisco Barajas, Andrew Taylor Scott, Shasta Ihorn, Alexander Mario Blum, Vassilis Athitsos, Ilmi Yoon

机构 * Northeastern University(东北大学) San Francisco State University(旧金山州立大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 工作流自动化 :workflow(title,abstract);分类 cs.AI

AI总结 本文提出了一种评估人类和VLM评分者音频描述质量的流程,利用项目反应理论评估其与专家标准的匹配程度,发现VLM在大规模评估中可与人类评分者相当,但其推理可靠性较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23758 2026-04-30 cs.LG cond-mat.mtrl-sci 79%

Agentic Fusion of Large Atomic and Language Models to Accelerate Superconductors Discovery

代理融合大规模原子和语言模型以加速超导体发现

Mingze Li, Yu Rong, Songyou Li, Lihong Wang, Jiacheng Cen, Liming Wu, Anyi Li, Zongzhao Li, Qiuliang Liu, Rui Jiao, Tian Bian, Pengju Wang, Hao Sun, Jianfeng Zhang, Ji-Rong Wen, Deli Zhao, Shifeng Jin, Tingyang Xu, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院) DAMO Academy, Alibaba Group, Hangzhou, China(阿里巴巴集团达摩院,杭州,中国) Hupan Lab, Hangzhou, China(虎扑实验室,杭州,中国) Institution of Physics, University of the Chinese Academy of Sciences, Beijing, China(中国科学院物理研究所,北京,中国) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系,北京,中国)

专题命中 工作流自动化 :agentic(title,abstract);分类 cs.LG

AI总结 本文提出ElementsClaw框架,结合大规模原子模型与语言模型,通过自主协作加速超导体发现,筛选240万晶体识别6.8万高置信度候选,发现四个新实验验证超导体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26311 2026-04-30 cs.AI 79%

DreamProver: Evolving Transferable Lemma Libraries via a Wake-Sleep Theorem-Proving Agent

DreamProver:通过唤醒-睡眠定理证明代理演化可转移的引理库

Youyuan Zhang, Jialiang Sun, Hangrui Bi, Chuqin Geng, Wenjie Ma, Zhaoyu Li, Xujie Si

机构 * University of Toronto(多伦多大学) UC Berkeley(伯克利大学)

专题命中 工作流自动化 :agent(title);agentic(abstract);分类 cs.AI

AI总结 DreamProver通过唤醒-睡眠程序归纳范式发现可重用的引理,解决传统方法在适应性和通用性上的不足,通过迭代两阶段过程演化出高效的可转移引理库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23483 2026-04-28 cs.AI 79%

Agentic Adversarial Rewriting Exposes Architectural Vulnerabilities in Black-Box NLP Pipelines

代理对抗重写揭示了黑盒NLP流水线中的架构漏洞

Mazal Bethany, Kim-Kwang Raymond Choo, Nishant Vishwamitra, Peyman Najafirad

机构 * Department of Information Systems and Cybersecurity, University of Texas at San Antonio(信息系统与网络安全系,德克萨斯大学圣安东尼奥分校)

专题命中 工作流自动化 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出一种双代理逃逸框架,通过语义扰动空间在无梯度反馈和严格查询预算下测试NLP流水线的鲁棒性,发现架构选择影响攻击面,并通过模式指导防御降低逃逸率。

Comments Submitted to IEEE TRANSACTIONS ON INFORMATION FORENSICS AND SECURITY

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15319 2026-04-23 cs.HC cs.AI 79%

Explainable Iterative Data Visualisation Refinement via an LLM Agent

通过LLM代理的可解释迭代数据可视化细化

Burak Susam, Tingting Mu

机构 * Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系)

专题命中 工作流自动化 :agent(title);agentic(abstract);分类 cs.AI

AI总结 本文提出利用LLM代理的自动化方法,通过结合定量评估与人类洞察,实现高维数据可视化优化,生成高质量可视化结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18228 2026-04-21 cs.SE 79%

Towards an Agentic LLM-based Approach to Requirement Formalization from Unstructured Specifications

迈向基于代理的LLM方法:从非结构化规范中提取需求形式化

Alberto Tagliaferro, Bruno Guindani, Livia Lestingi, Matteo Rossi

专题命中 工作流自动化 :agentic(title,abstract);分类 cs.SE

AI总结 本文提出基于代理的方法,从非结构化规范中自动生成符合验证要求的形式化属性,通过提取、过滤和翻译三个模块,实现语义对齐,实验表明其在三个场景中准确率达77.8%。

Comments Accepted at the AIPV 2026 workshop (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17677 2026-04-21 cs.AI 79%

Semantic Entanglement in Vector-Based Retrieval: A Formal Framework and Context-Conditioned Disentanglement Pipeline for Agentic RAG Systems

向量检索中的语义纠缠:一种形式框架和上下文条件下的解缠管道用于智能RAG系统

Nick Loghmani

机构 * Salesforce School of Information Studies, Syracuse University(苏利文大学信息研究学院)

专题命中 工作流自动化 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出了一种形式框架和上下文条件解缠管道,用于解决向量检索中因多主题文档交织导致的语义纠缠问题,通过改进文档结构提升检索精度。

Comments 34 pages, 5 Figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17347 2026-04-21 cs.AI 79%

Formal Foundations of Agentic Business Process Management

代理业务流程管理的正式基础

Giuseppe De Giacomo, Timotheus Kampik, Lukas Kirchdorfer, Marco Montali, Christoph Weinhuber

机构 * University of Oxford, UK(牛津大学,英国) SAP, Germany(德国SAP公司) Umeå University, Sweden(乌梅拉大学,瑞典) University of Mannheim, Germany(曼海姆大学,德国) Free University of Bozen-Bolzano, Italy(博兹纳自由大学,意大利)

专题命中 工作流自动化 :agentic(title,abstract);分类 cs.AI

AI总结 本文探讨了代理业务流程管理系统的数学基础,分析了四个核心问题,提出通过显式目标约束代理决策能力,以实现流程规范的控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12498 2026-04-15 cs.DB cs.AI 79%

Lit2Vec: A Reproducible Workflow for Building a Legally Screened Chemistry Corpus from S2ORC for Downstream Retrieval and Text Mining

Lit2Vec:从S2ORC构建法律审查化学语料库的可重复工作流程

Mahmoud Amiri, Jamile Mohammad Jafari, Sara Mostafapour, Thomas Bocklitz

机构 * Leibniz Institute of Photonic Technology(莱比锡光电技术研究所) Leibniz Health Technologies(莱比锡健康技术研究所) Leibniz Centre for Photonics in Infection Research (LPI)(感染研究中的光电中心(LPI)) Friedrich Schiller University Jena(耶拿弗里德里希·施勒特尔大学)

专题命中 工作流自动化 :workflow(title,abstract);分类 cs.AI

AI总结 本文提出Lit2Vec工作流程,通过保守的元数据许可筛选构建并验证化学语料库,包含582,683篇结构化全文论文及嵌入向量,同时提供可重复的schema和验证资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07584 2026-04-10 cs.AI 79%

From Papers to Property Tables: A Priority-Based LLM Workflow for Materials Data Extraction

从论文到属性表:一种基于优先级的LLM工作流用于材料数据提取

Koushik Rameshbabu, Jing Luo, Ali Shargh, Khalid A. El-Awady, Jaafar A. El-Awady

机构 * Department of Applied Mathematics and Statistics, Johns Hopkins University(约翰霍普金斯大学应用数学与统计系) Department of Mechanical Engineering, Johns Hopkins University(约翰霍普金斯大学机械工程系)

专题命中 工作流自动化 :workflow(title,abstract);分类 cs.AI

AI总结 本文提出一种基于优先级的LLM工作流,用于从科研论文中自动提取和重建结构化材料实验数据,通过整合文本、表格、图表和物理推导信息,以合金劈裂强度为案例,实现了高精度的数据提取与验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05547 2026-04-08 cs.AI cs.GR 79%

COSMO-Agent: Tool-Augmented Agent for Closed-loop Optimization,Simulation,and Modeling Orchestration

COSMO-Agent:增强工具的代理用于闭环优化、仿真和建模协调

Liyuan Deng, Shujian Deng, Yongkang Chen, Yongkang Dai, Zhihang Zhong, Linyang Li, Xiao Sun, Yilei Shi, Huaxi Huang

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 工作流自动化 :agent(title,abstract);分类 cs.AI

AI总结 本文提出COSMO-Agent框架,通过强化学习使LLM完成闭环CAD-CAE流程,解决CAD-CAE语义鸿沟问题,提升设计效率和稳定性。

Comments 10 pages, 3 figures, preprint paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04168 2026-04-08 cs.CL cs.IR 79%

A Semi-Automated Annotation Workflow for Paediatric Histopathology Reports Using Small Language Models

一种用于儿童病理科报告的半自动化标注工作流程使用小型语言模型

Avish Vijayaraghavan, Jaskaran Singh Kawatra, Sebin Sabu, Jonny Sheldon, Will Poulett, Alex Eze, Daniel Key, John Booth, Shiren Patel, Jonny Pearson, Dan Schofield, Jonathan Hope, Pavithra Rajendran, Neil Sebire

机构 * Imperial College London(帝国理工学院) NHS England(英国国家医疗服务体系) Great Ormond Street Hospital(大奥蒙德街儿童医院) University College London(伦敦大学学院)

专题命中 工作流自动化 :workflow(title,abstract);分类 cs.CL

AI总结 本文提出一种基于小型语言模型的半自动化标注流程,用于从非结构化电子病历数据中提取结构化信息,尤其针对儿童病理科报告,通过临床监督和少量示例提升提取准确性。

Comments 36 pages, includes supplementary information

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03484 2026-04-07 cs.LG 79%

From Bits to Chips: An LLM-based Hardware-Aware Quantization Agent for Streamlined Deployment of LLMs

从比特到芯片:一种基于LLM的硬件感知量化代理,用于简化LLM的部署

Kaiyuan Deng, Hangyu Zheng, Minghai Qing, Kunxiong Zhu, Gen Li, Yang Xiao, Lan Emily Zhang, Linke Guo, Bo Hui, Yanzhi Wang, Geng Yuan, Gagan Agrawal, Wei Niu, Xiaolong Ma

机构 * The University of Arizona(亚利桑那大学) Clemson University(克莱姆森大学) University of Georgia(佐治亚大学) The University of Tulsa(塔尔萨大学) Northeastern University(东北大学) Western Digital Corporation(西部数据公司)

专题命中 工作流自动化 :agent(title,abstract);分类 cs.LG

AI总结 本文提出HAQA,一种基于LLM的自动化框架,通过高效超参数调优和硬件配置,简化LLM的量化和部署流程,提升部署质量和易用性,实验显示推理速度提升2.3倍,吞吐量和精度均有提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03828 2026-04-03 cs.AI cs.MA 79%

AssetOpsBench: Benchmarking AI Agents for Task Automation in Industrial Asset Operations and Maintenance

AssetOpsBench:工业资产运维任务自动化AI代理的基准测试

Dhaval Patel, Shuxin Lin, James Rayfield, Nianjun Zhou, Chathurangi Shyalika, Suryanarayana R Yarrabothula, Roman Vaculin, Natalia Martinez, Fearghal O'donncha, Jayant Kalagnanam

机构 * IBM University of South Carolina(南卡罗来纳大学) IBM Research(IBM研究院)

专题命中 工作流自动化 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 本文提出AssetOpsBench,一个统一框架,用于协调和评估工业4.0中的领域专用代理。该框架包含四个领域代理目录、140+人工撰写的自然语言查询数据集及模拟的CouchDB后端物联网环境,通过三个关键指标分析工具-代理与计划-执行者范式的架构权衡,并系统化发现新兴故障模式。

Comments 25 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10394 2026-04-02 cs.RO cs.LG 79%

RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI

RoboNeuron:面向具身AI的代理驱动编排中层基础设施

Weifan Guan, Qinghao Hu, Huasen Xi, Chenxiao Zhang, Aosheng Li, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) AiRiA MAICRO

专题命中 工作流自动化 :agent(title,abstract);分类 cs.LG

AI总结 本文提出RoboNeuron中层框架,解决视觉-语言-动作模型与机器人中间件间的接口不匹配问题,通过统一执行抽象实现模块化编排与后端切换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17805 2026-03-24 cs.CV cs.AI 79%

A Stitch in Time: Learning Procedural Workflow via Self-Supervised Plackett-Luce Ranking

时间之针:通过自监督学习学习过程性工作流

Chengan Che, Chao Wang, Xinyue Chen, Sophia Tsoka, Luis C. Garcia-Peraza-Herrera

机构 * Department of Informatics, King’s College London, UK(伦敦国王学院信息学系)

专题命中 工作流自动化 :workflow(title,abstract);分类 cs.AI

AI总结 本文提出PL-Stitch框架,通过自监督学习提升视频过程性表示,有效解决传统方法对序列结构的忽视问题,在手术和烹饪任务中取得显著提升。

Comments Accepted at CVPR2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17930 2026-03-24 cs.SE 79%

How Software Engineers Engage with AI: A Pragmatic Workflow

软件工程师如何与AI互动:一种务实的工作流程

Vahid Garousi, Zafar Jafarov, Aytan Mövsümova, Atif Namazov

专题命中 工作流自动化 :workflow(title,abstract);分类 cs.SE

AI总结 本文提出一种务实的工作流程和四象限决策模型,帮助软件工程师在使用AI工具时决定何时信任、完善或丢弃生成的成果,通过实证研究和观察提供结构化指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25941 2026-03-16 cs.CL 79%

RECAP: Reproducing Copyrighted Data from LLMs Training with an Agentic Pipeline

RECAP:通过代理流水线从LLM训练中重现受版权保护的数据

André V. Duarte, Xuying li, Bin Zeng, Arlindo L. Oliveira, Lei Li, Zhuo Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Instituto Superior Técnico/INESC-ID(里斯本技术大学/INESC-ID) Hydrox AI

专题命中 工作流自动化 :agentic(title,abstract);分类 cs.CL

AI总结 RECAP通过代理流水线从LLM输出中提取和验证记忆的训练数据,利用反馈循环和对抗模块提升版权文本提取效果,实验显示其在ROUGE-L评分上显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12614 2026-03-16 cs.SE cs.CR 79%

ChainFuzzer: Greybox Fuzzing for Workflow-Level Multi-Tool Vulnerabilities in LLM Agents

ChainFuzzer:针对LLM代理中工作流级多工具漏洞的灰盒模糊测试

Jiangrong Wu, Zitong Yao, Yuhong Nan, Zibin Zheng

专题命中 工作流自动化 :workflow(title);agent(abstract);分类 cs.SE

AI总结 本文提出ChainFuzzer,通过可审计证据发现和复现多工具漏洞,利用TPS合成稳定提示并结合防护机制提升漏洞触发率,验证了20个流行开源LLM代理应用中的365个可复现漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10133 2026-03-12 cs.AI 79%

Agentic Control Center for Data Product Optimization

数据产品优化的代理控制系统

Priyadarshini Tamilselvan, Gregory Bramble, Sola Shirai, Ken C. L. Wong, Faisal Chowdhury, Horst Samulowitz

专题命中 工作流自动化 :agentic(title);AI agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于AI代理的系统,通过连续优化循环自动化改进数据产品,平衡自动化与信任和监督。

Comments 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22401 2026-03-10 cs.AI cs.HC 79%

Vibe Researching as Wolf Coming: Can AI Agents with Skills Replace or Augment Social Scientists?

作为狼群的到来:AI代理能否取代或增强社会科学家?

Yongjun Zhang

机构 * Department of Sociology and Institute for Advanced Computational Science, Stony Brook University(社会学系和先进计算科学研究所,石英布鲁克大学)

专题命中 工作流自动化 :AI agent(title,abstract);分类 cs.AI

AI总结 本文探讨AI代理在社会科学研究中的潜力,提出vibe研究概念,分析其在速度、覆盖和方法论上的优势及理论原创性的局限,并提出五条负责任的研究原则。

Comments Commentary

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02586 2026-03-04 cs.AI 79%

LiveAgentBench: Comprehensive Benchmarking of Agentic Systems Across 104 Real-World Challenges

LiveAgentBench: 104个现实挑战上代理系统全面评估基准

Hao Li, Huan Wang, Jinjie Gu, Wenjie Wang, Chenyi Zhuang, Sikang Bian

机构 * Ant Group(蚂蚁集团)

专题命中 工作流自动化 :agentic(title);AI agent(abstract);分类 cs.AI

AI总结 LiveAgentBench通过104个现实挑战全面评估代理系统,采用社会感知驱动的数据生成方法,提供374个任务用于验证和测试,揭示模型实际性能并识别改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00724 2026-03-03 cs.CL 79%

RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models

RLAR:一种用于大型语言模型多任务强化学习的代理奖励系统

Andrew Zhuoer Feng, Cunxiang Wang, Bosi Wen, Yidong Wang, Yu Luo, Hongning Wang, Minlie Huang

机构 * Tsinghua Univeristy(清华大学) Peking University(北京大学)

专题命中 工作流自动化 :agentic(title);agent(abstract);分类 cs.CL

AI总结 RLAR通过动态生成奖励函数提升大型语言模型在多任务强化学习中的性能和泛化能力。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏