WINELL: Wikipedia Never-Ending Updating with LLM Agents
专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.CL
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.CL
专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI
机构 * Wright State University(怀特州立大学)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI
Comments Accepted to RSS Workshop on Scalable and Resilient Multi-Robot Systems: Decision-Making, Coordination, and Learning 2025
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, Chinese Academy of Sciences(中国科学院人工智能学院) ; Nanyang Technological University(南洋理工大学) ; Nanjing University of Posts and Telecommunications(南京邮电大学) ; University of Chinese Academy of Sciences, Nanjing(中国科学院大学(南京)) ; Nanjing Artificial Intelligence Research of IA(南京人工智能研究所) ; Peking University(北京大学) ; University of International Business and Economics(对外经济贸易大学) ; University College London(伦敦大学学院)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI
Comments 28 pages, 7 figures, 17 tables
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);workflow(abstract);分类 cs.SE
Comments 16 pages, 5 figures, conference preprint submission. Conceptual systems architecture paper on telemetry-driven prompt optimization and IDE design patterns for AI development. Builds on Opik MCP open-source architecture and Comet trace infrastructure
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI
机构 * Georgia Tech(佐治亚理工学院) ; The University of Hong Kong(香港大学) ; Stanford University(斯坦福大学)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.CL
Comments ACL 2025
专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI
Comments 12 pages
专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI
专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.CL
专题命中 Agent评测 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI
Comments 25 pages, 4 figures; v2: Added AFMR Acknowledgment
专题命中 Agent评测 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.AI
专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI
Comments Codes for the benchmark: https://github.com/lucagioacchini/auto-pen-bench Codes for the paper experiments: https://github.com/lucagioacchini/genai-pentest-paper
专题命中 Agent评测 :agent(abstract);tool use(abstract);multi-agent(abstract);分类 cs.CL
Comments Accepted to COLM 2024. This is an extended version of the paper at arXiv:2311.05965
专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI
专题命中 Agent评测 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.AI
专题命中 Agent评测 :agent(title,comments);分类 cs.AI;multi-agent(comments)
Comments To appear in Coordination, Organizations, Institutions, Norms and Ethics for Governance of Multi-Agent Systems 2024
专题命中 Agent评测 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.AI
专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.LG
专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI
Comments The first two authors share equal contributions. This paper is accepted by ICLR 2023
专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.LG
Comments AAAI Conference on Artificial Intelligence and Interactive Digital Entertainment (AIIDE'19). arXiv admin note: substantial text overlap with arXiv:1904.05759, arXiv:1812.00045
库漂移:在自我演化的LLM技能库中诊断和修复一种无声的失败模式
机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) ; HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰技术中心,中国)
专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE;agentic(comments)
AI总结 本文研究了自我演化的LLM技能库中的一种无声失败模式——库漂移,通过可重复触发实验、细粒度诊断和验证修复方法,揭示了技能积累无序导致检索退化、假阳性注入和性能停滞的问题,并提出了一种经过验证的修复方案,显著提升了技能库的性能。
Comments Accepted to the ICML 2026 Workshop on Failure Modes in Agentic AI (FAGEN@ICML 2026), Seoul, South Korea. https://github.com/amazon-science/Self-Evolving-Agents-Ratchet
AWCP:用于远程代理深度协作的工件委托协议
专题命中 Agent评测 :agent(abstract,comments);autonomous agent(abstract);agentic(abstract)
AI总结 AWCP通过工件委托协议实现远程代理的深度协作,提供开源实现以提升代理间协作的互操作性。
Comments 16 pages, 7 figure, tech report of Agent Workspace Collaboration Protocol
专题命中 Agent评测 :agent(abstract,comments);autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG
Comments Project webpage: https://agent-force.github.io/unified-alignment-for-agents.html
TH-GNN:用于检测大语言模型智能体刷单攻击的异质性时序图神经网络
机构 * JAIN (Deemed to be University)(JAIN(被认定大学)) ; Zayed University(扎耶德大学)
专题命中 Agent评测 :agent(title);分类 cs.CL、cs.LG
AI总结 本文提出TH-GNN,一种异质性时序图神经网络,联合建模时序、结构与语义信号,在5类攻击族和4个基准数据集上检测LLM智能体刷单攻击,总体平均F1值达0.870,性能优于纯文本基线模型。
以指南为神谕:眼科电话分诊智能体的零标注训练
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL
AI总结 本研究提出以指南为神谕(GAO)方法,将美国眼科学会指南转化为训练监督信号,零标注训练出GAO-Triage智能体,大幅提升眼科电话分诊的一致性与紧急案例召回率,且性能优于7个通用系统。
当故事演变时:在开放世界模拟中针对智能体架构对大语言模型故事讲述能力进行基准测试
机构 * The University of Hong Kong(香港大学) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; Beijing Institute of Mathematical Sciences and Applications (BIMSA)(北京数学科学与应用研究院)
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL
AI总结 该研究推出WSE-bench基准,评估开放世界模拟中不同智能体架构的大语言模型故事讲述的持续生成、规范一致性和有意义发展,发现三者存在竞争关系,模型规模仅提升持续生成能力。
没有任务每次都失败:为什么单次审计在智能体损伤问题上存在结构性盲区
机构 * Northeastern University(东北大学)
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG
AI总结 该研究提出AgentRelBench工具,发现单次智能体审计易遗漏损伤对,模型能力提升会减少损伤任务,部分模型存在宣称弃权却执行不可逆操作的情况,且所有发现均按预注册标准执行。
Comments 25 pages, 4 figures, 16 tables, 6 appendices. Code, task suite, released per-run verdicts, and a one-command reproduction of every reported number: https://github.com/shivenkk/agentrelbench
反思自进化智能体技能:多轮次的反馈动态
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.SE
AI总结 本研究提出受控评估框架,发现自进化智能体技能是稀疏的验证过滤搜索,收益依赖模型与基准,失败轨迹反馈对技能选择关键,测试时计算难以完全恢复其收益。