arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

2025-12-16 至 2025-12-16 共收录 4
2509.11656 2025-12-16 cs.MA cs.AI cs.CL

MALLM: Multi-Agent Large Language Models Framework

MALLM:多智能体大语言模型框架

Jonas Becker, Lars Benedikt Kaesberg, Niklas Bauer, Jan Philip Wahle, Terry Ruas, Bela Gipp

机构 * University of Göttingen(哥廷根大学) LKA NRW(北莱茵-威斯特法伦州实验室)

AI总结 MALLM是一个开源框架,通过提供多种配置选项,系统分析多智能体辩论的组件,促进对智能体角色、响应生成器、讨论范式和决策协议的深入理解。

Comments Accepted at EMNLP 2025 (Demo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19764 2025-12-16 cs.CL

Principled Personas: Defining and Measuring the Intended Effects of Persona Prompting on Task Performance

原则性人格:定义并衡量人格提示对任务表现的预期效果

Pedro Henrique Luz de Araujo, Paul Röttger, Dirk Hovy, Benjamin Roth

AI总结 本文研究了专家人格提示对任务表现的影响,发现其效果不一致,模型对无关属性敏感,提出缓解策略但仅对大模型有效,强调需更严谨的人格设计和评估方案。

Comments 30 pages, 29 figures, accepted to EMNLP 2025

Journal ref In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 26845-26874, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16994 2025-12-16 cs.CL cs.AI

GRADE: Generating multi-hop QA and fine-gRAined Difficulty matrix for RAG Evaluation

GRADE: 生成多跳问答和细粒度难度矩阵用于RAG评估

Jeongsoo Lee, Daeyong Kwon, Kyohoon Jin

机构 * DATUMO Graduate School of Culture Technology, KAIST(文化科技研究生院,韩国科学技术院)

AI总结 GRADE提出了一种新的RAG评估框架,通过多跳问答和细粒度难度矩阵来评估和改进多步推理能力。

Comments Accepted at EMNLP 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14829 2025-12-16 cs.CL

Measuring Chain of Thought Faithfulness by Unlearning Reasoning Steps

通过反向学习推理步骤来衡量推理链的忠实性

Martin Tutek, Fateme Hashemi Chaleshtori, Ana Marasović, Yonatan Belinkov

机构 * Technion - Israel Institute of Technology(技术学院-以色列理工学院) University of Utah(犹他大学)

AI总结 通过反向学习推理步骤来评估推理链的参数忠实性,揭示模型推理与预测之间的关系。

Comments Outstanding paper at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏