AdMem: Advanced Memory for Task-solving Agents
AdMem: 面向任务求解智能体的高级记忆
机构 * Princeton University(普林斯顿大学) ; Amazon(亚马逊) ; Arm
AI总结 提出一种统一自动记忆框架,集成语义、情节和程序记忆,通过双层级设计和多智能体架构实现自动生成、奖励标注与自适应检索,提升长程多轮任务的鲁棒性和成功率。
大厂专区
AdMem: 面向任务求解智能体的高级记忆
机构 * Princeton University(普林斯顿大学) ; Amazon(亚马逊) ; Arm
AI总结 提出一种统一自动记忆框架,集成语义、情节和程序记忆,通过双层级设计和多智能体架构实现自动生成、奖励标注与自适应检索,提升长程多轮任务的鲁棒性和成功率。
CrowdMath: 众包数学研究讨论数据集
机构 * University of Massachusetts Lowell(马萨诸塞大学洛文分校) ; San Jose State University(圣何塞州立大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Dartmouth College(达特茅斯学院) ; Amazon AGI(亚马逊人工智能研究院)
AI总结 提出CrowdMath数据集,包含164条专家标注的进展链,用于评估大语言模型在协作开放问题求解中的能力,发现模型在局部预测上表现良好但在角色分类上存在不足。
Comments 16 pages, 4 figures
TSAQA:时间序列分析问答基准
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Virginia Polytechnic Institute and State University(弗吉尼亚理工学院和州立大学) ; Amazon(亚马逊) ; Meta AI ; University of Houston(休斯顿大学)
AI总结 提出TSAQA基准,涵盖6种时间序列分析任务(含新型PZ格式),评估LLM在13领域21万样本上的表现,最佳模型仅65.08分。
Comments Comments: 35 pages, 7 figures. Accepted to the GEM Workshop at ACL 2026