MALLM: Multi-Agent Large Language Models Framework
MALLM:多智能体大语言模型框架
机构 * University of Göttingen(哥廷根大学) ; LKA NRW(北莱茵-威斯特法伦州实验室)
AI总结 MALLM是一个开源框架,通过提供多种配置选项,系统分析多智能体辩论的组件,促进对智能体角色、响应生成器、讨论范式和决策协议的深入理解。
Comments Accepted at EMNLP 2025 (Demo)
期刊&会议
Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing
MALLM:多智能体大语言模型框架
机构 * University of Göttingen(哥廷根大学) ; LKA NRW(北莱茵-威斯特法伦州实验室)
AI总结 MALLM是一个开源框架,通过提供多种配置选项,系统分析多智能体辩论的组件,促进对智能体角色、响应生成器、讨论范式和决策协议的深入理解。
Comments Accepted at EMNLP 2025 (Demo)
原则性人格:定义并衡量人格提示对任务表现的预期效果
AI总结 本文研究了专家人格提示对任务表现的影响,发现其效果不一致,模型对无关属性敏感,提出缓解策略但仅对大模型有效,强调需更严谨的人格设计和评估方案。
Comments 30 pages, 29 figures, accepted to EMNLP 2025
Journal ref In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 26845-26874, Suzhou, China. Association for Computational Linguistics
GRADE: 生成多跳问答和细粒度难度矩阵用于RAG评估
机构 * DATUMO ; Graduate School of Culture Technology, KAIST(文化科技研究生院,韩国科学技术院)
AI总结 GRADE提出了一种新的RAG评估框架,通过多跳问答和细粒度难度矩阵来评估和改进多步推理能力。
Comments Accepted at EMNLP 2025 findings
通过反向学习推理步骤来衡量推理链的忠实性
机构 * Technion - Israel Institute of Technology(技术学院-以色列理工学院) ; University of Utah(犹他大学)
AI总结 通过反向学习推理步骤来评估推理链的参数忠实性,揭示模型推理与预测之间的关系。
Comments Outstanding paper at EMNLP 2025