DRBENCHER: Can Your Agent Identify the Entity, Retrieve Its Properties and Do the Math?
DRBENCHER:你的智能体能识别实体、检索其属性并进行数学运算吗?
机构 * IBM Research(IBM研究院)
AI总结 DRBENCHER通过综合评估浏览与计算能力,揭示了现有基准测试的不足,其四维标准确保了问题的可验证性、复杂性、难度和多样性,展示了智能体在动态数据环境下的性能限制。
大厂专区
DRBENCHER:你的智能体能识别实体、检索其属性并进行数学运算吗?
机构 * IBM Research(IBM研究院)
AI总结 DRBENCHER通过综合评估浏览与计算能力,揭示了现有基准测试的不足,其四维标准确保了问题的可验证性、复杂性、难度和多样性,展示了智能体在动态数据环境下的性能限制。
成长之痛:通过固定参数校准实现可扩展且高效的LLM基准测试
机构 * The Hebrew University of Jerusalem(海法大学) ; IBM Research(IBM研究院) ; MIT(麻省理工学院) ; Technion(技术学院) ; Allen Institute for AI(人工智能研究院)
AI总结 本文提出基于多维项目反应理论的框架,利用锚定项目校准新基准,保持原有参数固定,实现随时间扩展基准测试的同时保持评分可比性,且评估成本恒定。
语义交易:用于预测市场聚类和关系发现的代理AI
机构 * Columbia University(哥伦比亚大学) ; IBM Research(IBM研究院)
AI总结 本文提出一种代理AI方法,通过自然语言处理将预测市场划分为主题组并发现市场间的关系,利用历史数据验证其预测准确性及交易策略收益。