Generalized Machine Learning for Fast Calibration of Agent-Based Epidemic Models
通用机器学习用于快速校准基于代理的流行病模型
专题命中 Agent评测 :agent(title,abstract);分类 cs.LG
AI总结 本文提出DeepIMC框架,利用BiLSTM神经网络快速校准基于代理的流行病模型,提升参数估计精度并大幅降低计算时间。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
通用机器学习用于快速校准基于代理的流行病模型
专题命中 Agent评测 :agent(title,abstract);分类 cs.LG
AI总结 本文提出DeepIMC框架,利用BiLSTM神经网络快速校准基于代理的流行病模型,提升参数估计精度并大幅降低计算时间。
结构化大语言模型路由在代理专家系统中的运行时负担分配:一种全因子跨后端方法论
机构 * School of Computer Sciences, Universiti Sains Malaysia (USM)(马来西亚理科大学计算机科学学院) ; Xiamen Software Vocational & Technical College(厦门软件职业技术学院)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI
AI总结 本文探讨了结构化LLM路由在代理专家系统中的负担分配问题,提出了一种全因子跨后端方法论,通过全面评估不同后端配置下的性能,揭示了后端特定交互效应对性能的主导作用。
即兴游戏作为AI代理社交智能的基准测试:以Connections为例
机构 * Duke University(杜克大学) ; Stanford University(斯坦福大学)
专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI
AI总结 本文通过即兴词游戏Connections探讨AI代理的推理能力,提出该游戏作为测试社交智能的基准,涵盖知识检索、总结及认知状态意识等核心能力。
Comments https://wordplay-workshop.github.io/wordplay2024/pdfs/16.pdf
Journal ref https://wordplay-workshop.github.io/wordplay2024/pdfs/16.pdf
PSPA-Bench:面向智能手机GUI代理的个性化基准
机构 * Northwestern Polytechnical University(西北工业大学) ; Tsinghua University(清华大学) ; Peking University(北京大学) ; Beijing Institute of Mathematical Sciences and Applications(北京数学科学与应用研究院)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出PSPA-Bench,用于评估智能手机GUI代理的个性化能力,通过12855条个性化指令和22款移动应用,揭示现有方法在个性化场景下的不足,并提出改进方向。
Comments 28 pages
SkillTester:智能体技能的评估与安全性的基准测试
机构 * Key Laboratory of High Confidence Software Technologies, Ministry of Education, Peking University(高可信软件技术教育部重点实验室(北京大学)) ; Northwestern Polytechnical University(西北工业大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 SkillTester通过对比原则和用户友好原则,评估智能体技能的实用性和安全性,提供标准化评分和安全状态标签,旨在提升智能体技能的质量保障。
Comments Technical report, 13 pages, 2 figures, 9 tables. Project page: https://skilltester.ai. Code: https://github.com/skilltester-ai/skilltester
通过可微代理模拟实现超快交通现在预测与控制
机构 * Fujitsu Limited(富士通株式会社) ; Fujitsu Research of America(富士通美国研究院) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.LG
AI总结 本文提出一种可微代理交通模拟器,实现大规模网络的超快模型校准、交通现在预测与控制,通过可微计算技术提升效率,实现30分钟数据校准、1小时预测和728秒控制,构建完整的校准-预测-控制闭环。
代理审计:用于大语言模型代理应用的安全分析系统
机构 * University of Southern California(南加州大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出Agent Audit系统,用于检测LLM代理应用中的安全漏洞,通过数据流分析、凭证检测等方法,提高召回率并保持快速扫描速度。
迈向自演化基准:通过验证-再生产范式下的测试时间探索合成代理轨迹
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Hong Kong University of Science and Technology(香港科技大学) ; University of Michigan(密歇根大学) ; Renmin University of China(中国人民大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出TRACE框架,通过测试时间探索使代理在原有任务基础上自演化更复杂的任务,提升基准的动态性和可靠性,适应并改进了AIME-2024等推理数据集。
Comments This is a work in progress due to methodology refinement and further evaluation
DiffGraph: 一种自动化代理驱动的模型融合框架用于真实场景的文本到图像生成
机构 * Lancaster University(兰卡斯特大学) ; University of Bristol(布里斯托大学) ; Adobe Research(Adobe研究院)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 DiffGraph通过自动化整合在线专家资源,灵活融合不同模型以满足多样化的真实用户需求,提升了文本到图像生成的效能。
Comments CVPR
动作代数在代理对世界的表示中的代数
机构 * Artificial Intelligence Research Centre (CitAI), Department of Computer Science, City St George's, University of London(人工智能研究与应用中心(CitAI)、计算机科学系、圣乔治学院、伦敦大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出从代理视角提取世界变换代数的框架,通过计算方法提取简单强化学习场景中的变换代数并分类,推广SBDRL的等变条件和解缠定义到任意代数的变换属性。
基于代理的模仿动力学可以产生高效压缩的群体层面词汇
机构 * Department of Psychology, New York University(纽约大学心理学系) ; Department of Language Science, University of California, Irvine(加州大学欧文分校语言科学系) ; Department of Linguistics, University of Tübingen(图宾根大学语言学系)
专题命中 Agent评测 :agent(title,abstract);分类 cs.CL
AI总结 本文探讨了基于代理的模仿动力学如何在信号游戏中实现词汇的高效压缩,结合进化博弈论与信息瓶颈框架,揭示了词汇优化的机制。
CUBE:统一智能体基准的标准化
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出CUBE标准,通过MCP和Gym构建统一协议,实现智能体基准的标准化,减少碎片化,提升研究效率。
Comments Position paper. 10 pages. Reference implementation: https://github.com/The-AI-Alliance/cube-standard
AI代理对间接提示注入攻击的易受攻击性有多大?来自大规模公开竞赛的见解
机构 * Gray Swan AI ; OpenAI ; Meta ; Anthropic ; US CAISI(美国CAISI) ; UK AISI(英国AISI) ; Carnegie Mellon University(卡内基梅隆大学) ; Center for AI Safety(人工智能安全中心)
专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI
AI总结 本文通过大规模公开竞赛评估了AI代理在工具调用、编程和计算机使用中的双重目标,发现所有模型均易受间接提示注入攻击,攻击成功率从0.5%到8.5%不等,并揭示了指令遵循架构的根本性弱点。
Comments 38 pages, 16 figures. Newer version to cover Q1 competition results on latest models in progress. Code at https://github.com/grayswansecurity/ipi_arena_os Partial Dataset at https://huggingface.co/datasets/sureheremarv/ipi_arena_attacks
逃避式智能:从恶意软件分析中汲取的AI评估教训
机构 * Eurecom ; SAP Labs(SAP实验室) ; Depthfirst
专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI
AI总结 本文探讨了AI代理评估中因适应性行为导致的安全性误判问题,借鉴恶意软件沙盒逃避的研究,提出评估原则以应对潜在的对抗性环境。
OpenClaw中代理特权分离:一种对抗提示注入的结构性防御
机构 * TrendAI Lab(TrendAI实验室)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出通过代理隔离和JSON格式化相结合的结构化防御机制,有效阻止提示注入攻击,在OpenClaw平台上实现零攻击成功率。
混合人类-智能体社会困境在能源市场中的应用
机构 * Department of Data Science and AI, Faculty of Information Technology(数据科学与人工智能系,信息科技学院)
专题命中 Agent评测 :agent(title);autonomous agent(abstract);分类 cs.AI
AI总结 本文研究了在能源市场中人类与智能体的混合群体中合作行为的产生,通过引入智能体和实验展示协调机制,探讨部分采用对整体结果的影响及战略部署中的挑战。
Comments 20 pages, 7 figures. Submitted to Proceedings of the Royal Society A, Special Issue on "The evolution of sociality in hybrid human AI populations"
AI代理能否达成一致?
专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.LG
AI总结 研究发现,基于LLM的代理在无质押设置中难以可靠达成一致,群体规模增大和拜占庭代理的存在显著降低共识成功率,活锁问题主导了失败原因。
SAGE: 一种面向多轮智能体评估的上下文知识引导用户模拟器
专题命中 Agent评测 :agent(title,abstract);分类 cs.CL
AI总结 SAGE通过整合业务上下文知识,提出一种多轮智能体评估的用户模拟框架,生成更真实的交互并提高错误检测能力。
一款冠军级基于视觉的强化学习代理用于Gran Turismo 7中的竞争赛车
机构 * KAIST(韩国科学技术院) ; Sony AI(索尼人工智能) ; Coventry University(科文特大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 Agent评测 :agent(title,abstract);分类 cs.LG
AI总结 本文提出了一种基于视觉的自主赛车代理,通过仅使用车载传感器数据和摄像头视角,在Gran Turismo 7中实现了冠军级的赛车性能。
Comments Accepted for Publication at the IEEE Robotics and Automation Letters (RA-L) 2025
通过复杂度提升强化学习实现奥lympia级几何大语言模型代理
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Peking University(北京大学) ; ICMAT Spanish National Research Council(西班牙国家研究委员会ICMAT) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 InternGeometry通过复杂度提升强化学习实现几何问题求解,仅用13K训练示例解决44个IMO问题,超越平均金牌得主得分。
AgentSelect: 用于叙述查询到代理推荐的基准测试
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 AgentSelect是一个用于叙述查询到代理推荐的基准测试,通过统一的数据和评估基础设施,填补了代理推荐领域的研究空白,展示了基于能力匹配的代理推荐方法。
Comments under review by conference
在生态系统层面组织、协调和基准测试代理技能
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 Agent评测 :agent(title,abstract);分类 cs.CL
AI总结 本文提出AgentSkillOS框架,通过树状检索和DAG协调提升大规模技能生态系统的管理和任务解决能力。
金融交易中的大语言模型代理:综述
机构 * Columbia University(哥伦比亚大学) ; New York University(纽约大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.CL
AI总结 本文综述了利用大语言模型作为代理进行金融交易的研究,探讨了代理架构、数据输入、回测表现及面临的挑战,并展望了未来研究方向。
Journal ref International Conference on Computers in Management and Business 2026
SimAB:基于人格条件化AI代理的A/B测试模拟用于快速设计评估
机构 * ETH Zurich(苏黎世联邦理工学院) ; Adobe(Adobe公司) ; Adobe Research(Adobe研究)
专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI
AI总结 SimAB通过人格条件化AI代理模拟A/B测试,实现快速设计评估,准确率达67%,在高置信度案例中提升至83%。
Comments 18 pages
TraderBench: AI代理在对抗性资本市场中的鲁棒性如何?
机构 * Amazon.com Inc.(亚马逊公司) ; Stony Brook University(石溪大学) ; Stanford University(斯坦福大学) ; University of Oklahoma(俄克拉荷马大学) ; UC Santa Cruz(加州大学圣克鲁兹分校)
专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI
AI总结 TraderBench通过结合静态任务与对抗性交易模拟,评估AI代理在动态市场中的鲁棒性,发现现有模型在加密交易中表现稳定但缺乏真实适应性。
Comments Equal Contribution: Xiaochuang Yuan and Hui Xu contributed equally to this work. All correspondence should be directed to yxc20098@gmail.com. Submitted to Agents in the Wild Workshop, ICLR2026
Resp-Agent:一种基于代理的多模态呼吸声生成与疾病诊断系统
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 Resp-Agent是一种基于代理的多模态系统,通过主动对抗课程代理和模态编织器提升呼吸声生成与疾病诊断的鲁棒性。
Comments 24 pages, 3 figures. Published as a conference paper at ICLR 2026
Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)
Skill-Inject: 评估代理对技能文件攻击的脆弱性
机构 * Max Planck Institute for Intelligent Systems, ELLIS Institute Tübingen, Tübingen AI Center(马克斯·普朗克智能系统研究所、图宾根ELLIS研究所、图宾根人工智能中心)
专题命中 Agent评测 :agent(title,abstract);分类 cs.LG
AI总结 SkillInject通过评估代理对技能文件攻击的脆弱性,揭示了当前LLM代理在安全性和合规性方面的严重问题,指出需采用上下文感知的授权框架来提升安全性。
你确定吗?:一项关于LLM驱动代理系统中人类感知脆弱性的实证研究
机构 * Nanyang Technological University(南洋理工大学) ; KTH(皇家理工学院) ; William & Mary(威廉与玛丽学院)
专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI
AI总结 研究通过实证分析揭示人类对LLM驱动代理系统中代理介导欺骗的脆弱性,并提出基于HAT-Lab的防御策略。
DS-STAR:跨异构格式和开放性查询的多样化任务数据科学代理
机构 * Google Cloud(谷歌云) ; KAIST(韩国科学技术院)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 DS-STAR是一种专门设计用于跨异构数据格式和开放性查询的代理,能生成高质量研究报告并超越传统问答能力。
销售研究代理与销售研究基准
机构 * Microsoft(微软)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出销售研究代理和基准,通过实时CRM数据提供高质量决策洞察,并在测试中超越其他AI系统。
Comments Technical report. 2 figures. Microsoft Dynamics 365 Sales