arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

EPFL(洛桑联邦理工学院)

2026-02-03 至 2026-02-03 共收录 5
2601.22037 2026-02-03 cs.AI cs.LG

Optimizing Agentic Workflows using Meta-tools

利用元工具优化代理工作流

Sami Abuzakuk, Anne-Marie Kermarrec, Rishi Sharma, Rasmus Moorits Veski, Martijn de Vos

机构 * EPFL, Switzerland(瑞士联邦理工学院)

AI总结 本研究提出AWO框架,通过识别并优化重复的工具执行模式,减少LLM调用次数并提高代理工作流的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07899 2026-02-03 cs.CL cs.LG

MEMOIR: Lifelong Model Editing with Minimal Overwrite and Informed Retention for LLMs

MEMOIR: LLMs的终身模型编辑与最小覆盖与有意识保留

Ke Wang, Yiming Qin, Nikolaos Dimitriadis, Alessandro Favero, Pascal Frossard

机构 * EPFL(苏黎世联邦理工学院)

AI总结 MEMOIR通过残差记忆模块实现LLM的终身模型编辑,高效处理连续编辑任务,保持模型核心能力并减少遗忘。

Comments The first two authors contributed equally to this work; Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01031 2026-02-03 cs.AI cs.CL

HalluHard: A Hard Multi-Turn Hallucination Benchmark

HalluHard: 一种具有挑战性的多轮 hallucination 评估基准

Dongyang Fan, Sebastien Delsad, Nicolas Flammarion, Maksym Andriushchenko

机构 * EPFL(苏黎世联邦理工学院) ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

AI总结 HalluHard是一种具有挑战性的多轮hallucination评估基准,通过内联引用和网络搜索评估模型的事实性输出,发现即使使用网络搜索,幻觉仍然普遍存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00603 2026-02-03 cs.LG

Direct Preference Optimization with Rating Information: Practical Algorithms and Provable Gains

直接偏好优化与评分信息:实用算法和可证明的收益

Luca Viano, Ruida Zhou, Yifan Sun, Mahdi Namazifar, Volkan Cevher, Shoham Sabach, Mohammad Ghavamzadeh

机构 * EPFL(苏黎世联邦理工学院) Amazon AGI(亚马逊人工智能实验室) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Cornell University(康奈尔大学) Qualcomm AI Research(高通人工智能研究)

AI总结 本文提出利用评分间隙信息改进直接偏好优化算法,通过理论证明和实验验证,在准确评分间隙条件下实现更快的统计速率,并在多种LLM和基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24012 2026-02-03 cs.LG

Pretraining Scaling Laws for Generative Evaluations of Language Models

生成评估的预训练扩展定律

Rylan Schaeffer, Noam Levi, Brando Miranda, Sanmi Koyejo

机构 * Computer Science Stanford University(计算机科学 斯坦福大学) AI Center EPFL(人工智能中心 EPFL)

AI总结 本文提出三种预训练扩展定律,用于生成评估的性能预测,揭示了不同扩展定律在稳定性与预测性能上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏