SkillRet: A Large-Scale Benchmark for Skill Retrieval in LLM Agents
SkillRet:一种大规模技能检索基准,用于LLM代理
机构 * ThakiCloud
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出SkillRet基准,用于评估LLM代理中的技能检索。该基准包含17810个公开技能,提供63259个训练样本和4997个评估查询,通过任务特定微调显著提升了检索性能。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
SkillRet:一种大规模技能检索基准,用于LLM代理
机构 * ThakiCloud
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出SkillRet基准,用于评估LLM代理中的技能检索。该基准包含17810个公开技能,提供63259个训练样本和4997个评估查询,通过任务特定微调显著提升了检索性能。
预测汽车行业的绿色技能需求:来自在线招聘信息的证据
机构 * Institute for the Future of Education, Tecnológico de Monterrey(教育未来研究所,蒙特雷理工大学)
专题命中 Agent评测 :planning(abstract);分类 cs.LG
AI总结 本文通过分析墨西哥汽车行业的在线招聘信息,构建计算框架预测绿色技能需求,识别出274种绿色技能,并利用时间序列模型预测未来趋势,发现可再生能源、回收和氢能技术需求增长最快。
自主对抗者:在LLM时代进行红队测试
专题命中 Agent评测 :planning(abstract)
AI总结 本文探讨了语言模型代理在红队操作中的应用,通过MITRE ATT&CK框架分析其与核心进攻功能的交集,并评估LLM代理在治理和现实评估中的优缺点。研究通过两个横向移动场景对比三种操作模式,发现专家定义的行动计划任务完成率最高,但所有模式均存在频繁失败问题。
Comments Accepted at ACISP 2026
对子模和子加性估值的EFX的反例
专题命中 Agent评测 :agent(abstract)
AI总结 本文构造了三个代理人八个物品的实例,证明在单调子加性估值下,不存在满足α-EFX的分配,且提供了子模(实际上加权覆盖)估值下的相关反例,展示了对称性对EFX存在的阻碍。
通过TEE后置隔离约束自托管计算机使用代理的主机级滥用
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出基于操作的风险约束模型,通过TEE后置可信操作平面保护关键安全功能,实现对自托管计算机使用代理操作的安全限制。
具有重复意识的移位-提升Carleman线性化:结构、复杂性和比较评估
专题命中 Agent评测 :workflow(abstract)
AI总结 本文提出一种移位-提升架构以消除Carleman线性化中因状态维度和截断阶数增加而产生的重复单项式贡献,通过移动中心扩展提高高阶截断的实用性,并通过对比实验验证了该方法在双线性驱动和逻辑交互等基准测试中的收敛性与准确性。
基于生成AI的蒙特卡洛模拟用于方法评估的合成多级数据
专题命中 Agent评测 :workflow(abstract)
AI总结 本文提出一种基于生成AI的多级数据模拟框架,用于评估定量方法的预测性能和参数恢复能力,通过改进扩散模型和GANs提升数据真实性,并系统评估模拟设计的可靠性。
Comments 31 pages for the main text
非互易鸟群中涌现手性秩序的崩溃与缺陷混沌
专题命中 Agent评测 :agent(abstract)
AI总结 研究揭示非互易鸟群中手性秩序易崩溃,通过模拟与连续描述显示拓扑缺陷导致旋转手性态破坏,产生时空混沌并具有有限相关长度。
Comments 7 pages, 4 figures
MISES: 最小信息充分性以实现有效服务
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究了基于类别的协调机制,通过将声明的服务类别映射到固定资源配置来分配资源,不观察个体需求类型。研究发现,相对福利差距Delta在聚合类内分配方差epsilon的范围内有紧致的双侧界,并证明了需求衍生的类别同时最小化福利损失和误报激励。
Irminsul:基于MLA的原生位置无关缓存用于代理LLM服务
机构 * Erlangen National High Performance Computing Center(埃朗根国家高性能计算中心)
专题命中 其他Agent :agentic(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出Irminsul,一种基于MLA的原生位置无关缓存,通过内容哈希键和δ旋转规则提升代理LLM服务性能,实现高达83%的提示词恢复率和63%的预填能量节省。
代理AI是基础模型在分布外泛化中的缺失范式
机构 * Tsinghua University(清华大学)
专题命中 其他Agent :agentic(title,abstract);分类 cs.LG
AI总结 本文提出代理系统是解决基础模型分布外泛化问题的必要范式,通过四个步骤论证代理系统在结构上超越了传统模型中心范式,提出了参数覆盖上限的理论,并反驳了七项反论点。
Comments 13 pages, 2 figures
用户何时应检查?在多步骤代理AI任务中建模确认频率
专题命中 其他Agent :agentic(title);AI agent(abstract)
AI总结 本文提出了一种基于时间调度的模型,用于确定多步骤AI任务中最佳的确认点位置,通过实验发现用户更倾向于中间确认而非终点确认,从而减少任务完成时间。
Comments Accepted by Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), April 13--17, 2026, Barcelona, Spain