AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers
AgentHPOBench:用于评估LLM智能体作为序列超参数优化器的基准
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 AgentHPOBench是含30个任务的序列基准,用于评估LLM智能体的超参数优化能力,实验显示其在多领域有优化能力,但在迭代优化等方面存在局限。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
AgentHPOBench:用于评估LLM智能体作为序列超参数优化器的基准
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 AgentHPOBench是含30个任务的序列基准,用于评估LLM智能体的超参数优化能力,实验显示其在多领域有优化能力,但在迭代优化等方面存在局限。
LEMUR:基于偏好反馈的多目标强化学习对齐学习
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本研究提出LEMUR框架,通过联合学习策略与多目标奖励模型,从人类偏好反馈中学习平衡多目标的最优策略,其在基准多目标任务上性能优于基线方法。
MirrorCraft:Minecraft中隐藏规则变化下的配对评估
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 MirrorCraft是用于Minecraft隐藏规则变化下评估智能体的配对基准,实验发现规则集对隐藏规则变化的影响差异显著,未提供规则描述时ReAct表现最优,提供规则可适度提升任务表现。
手术风险分层与结局预测中缺失的内容:端到端机器学习方法的范围综述
专题命中 Agent评测 :workflow(abstract);分类 cs.LG
AI总结 本范围综述回顾190项研究,分析手术风险分层与结局预测的ML流程,发现数据、方法、评估等方面存在差距,为开发更严谨的围手术期ML工具提供参考。
Comments This work has been submitted to the IEEE JBHI for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible
用于磁共振成像多任务3D脑肿瘤分割的深度学习模型统一基准
机构 * Centro de Tecnologías de la Imagen (CTIM)(图像技术中心(CTIM)) ; Instituto Universitario de Cibernética, Empresas y Sociedad (IUCES)(网络、企业与社会大学研究所(IUCES)) ; University of Las Palmas de Gran Canaria(拉斯帕尔马斯大加那利大学)
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 本研究构建统一基准,在相同条件下对比3D U-Net等5种深度学习模型在BraTS 2023、2024数据集上的脑肿瘤分割性能,明确了不同架构的准确率与效率权衡及适用场景。
Comments 27 pages, 16 figures, 8 tables
自监督技能优化
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 该研究提出自监督技能优化(SSO)框架,仅用未标注任务实例学习可复用技能,在封闭、开放任务上优于无真实标注的提示优化器,部分场景表现接近最强的基于真实标注的技能优化器。
基于扩展ICAP框架的协作对话认知投入度测量:人类标注、上下文学习与反思型大语言模型智能体的比较
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 本研究用扩展7点ICAP框架测量协作对话认知投入度,对比人类标注、ICL及反思型LLM智能体,发现人类标注信度更高,智能体方法具潜力,需强化人类标注与LLM方法的交互。
Comments Accepted as a full paper in the CogSci 2026 proceedings
模型链:面向偏见鲁棒性大语言模型评判器的跨模型审计
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 本研究针对LLM评判器的认知偏见问题,提出跨模型审计流程CoM,发现审计器身份的关键作用,制定偏见特异性审计器选择规则,在多模型多偏见实验中取得优于基线的准确率。
Comments WIP
AlloBench:测量大语言模型智能体中的在线工具分配能力
机构 * Sea12 Technologies(Sea12科技公司) ; Yale University(耶鲁大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 研究测试大语言模型智能体在固定预算下的在线工具分配能力,通过配对基准测试发现前沿模型在抽象框架中表现近乎最优,但在脚本编写中失败,确定了各模型失败模式,还表明开源Qwen模型在抽象分配上有推广,在线工具分配是重要能力边界。
Comments 24 pages, 6 figures, 8 tables
用于过程级社会影响力评估的认知世界模型
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出认知世界模型(CogWM),通过联合预测BDI/E认知状态和用户话语,实现从终端判断到过程跟踪的社会影响力对话评估,在四个场景中达到77.6%情感准确率。
Comments 22 pages, 6 figures
面向平均场博弈与平均场控制问题的统一连续时间Q学习方法
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文针对环境模拟器无法直接获取群体分布的场景,提出解耦Iq函数,设计统一参数化Q学习算法,验证其在MFG与MFC学习任务中的有效性。
罗尔斯式公平:分配问题的一种新公平概念
专题命中 Agent评测 :agent(abstract)
AI总结 该研究提出用于不可分割对象分配的罗尔斯式公平概念,证明其分配集合与辅助市场稳定分配集合一致,主体提议的延迟接受算法可计算其主体最优元素,但无策略防卫的罗尔斯式公平规则。
UltraSAM3:一种用于通用超声图像分割的概念驱动基础模型
机构 * Dalian University of Technology Affiliated Center Hospital(大连大学附属中心医院)
专题命中 Agent评测 :agent(abstract)
AI总结 针对现有超声分割方法的任务局限或需专家视觉提示问题,提出概念驱动的UltraSAM3模型及指令引导智能体,在多基准测试中性能优于同类模型,提升了临床交互的实用性。
从有限反馈中学习不可分割物品的公平分配
专题命中 Agent评测 :agent(abstract)
AI总结 研究算法在未知估值下通过有限反馈学习公平分配不可分割物品的问题,提出基于椭球法的框架,在加性估值下多项式时间内找到EF1或PROP1分配,并在单调估值下保证多项式轮次内找到EF1分配。
Comments 42 pages, full version. Accepted to the ACM Conference on Economics and Computation (EC 2026)
高效估算多层级多组件干预措施的局部治疗效应以应对阿片类药物危机
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出一种双层元模型框架,通过两阶段序列设计高效采样,用于估算多层级干预措施的局部治疗效应,减少计算资源消耗,应用于估算巴比妥酸盐分发和纳洛酮分布对过量死亡率的影响。
Comments repository link: https://github.com/abdulrahmanfci/gpr-metamodel/