Optimizing Agentic Workflows using Meta-tools
利用元工具优化代理工作流
机构 * EPFL, Switzerland(瑞士联邦理工学院)
AI总结 本研究提出AWO框架,通过识别并优化重复的工具执行模式,减少LLM调用次数并提高代理工作流的成功率。
高校专区
利用元工具优化代理工作流
机构 * EPFL, Switzerland(瑞士联邦理工学院)
AI总结 本研究提出AWO框架,通过识别并优化重复的工具执行模式,减少LLM调用次数并提高代理工作流的成功率。
MEMOIR: LLMs的终身模型编辑与最小覆盖与有意识保留
机构 * EPFL(苏黎世联邦理工学院)
AI总结 MEMOIR通过残差记忆模块实现LLM的终身模型编辑,高效处理连续编辑任务,保持模型核心能力并减少遗忘。
Comments The first two authors contributed equally to this work; Accepted to NeurIPS 2025
HalluHard: 一种具有挑战性的多轮 hallucination 评估基准
机构 * EPFL(苏黎世联邦理工学院) ; ELLIS Institute Tübingen(图宾根ELLIS研究所) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; Tübingen AI Center(图宾根人工智能中心)
AI总结 HalluHard是一种具有挑战性的多轮hallucination评估基准,通过内联引用和网络搜索评估模型的事实性输出,发现即使使用网络搜索,幻觉仍然普遍存在。
直接偏好优化与评分信息:实用算法和可证明的收益
机构 * EPFL(苏黎世联邦理工学院) ; Amazon AGI(亚马逊人工智能实验室) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Cornell University(康奈尔大学) ; Qualcomm AI Research(高通人工智能研究)
AI总结 本文提出利用评分间隙信息改进直接偏好优化算法,通过理论证明和实验验证,在准确评分间隙条件下实现更快的统计速率,并在多种LLM和基准上表现优异。
生成评估的预训练扩展定律
机构 * Computer Science Stanford University(计算机科学 斯坦福大学) ; AI Center EPFL(人工智能中心 EPFL)
AI总结 本文提出三种预训练扩展定律,用于生成评估的性能预测,揭示了不同扩展定律在稳定性与预测性能上的差异。