arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

共收录 7861
2505.14435 2026-01-06 cs.CY cs.AI

Choosing a Model, Shaping a Future: Comparing LLM Perspectives on Sustainability and its Relationship with AI

选择模型,塑造未来:比较LLM对可持续性和其与AI关系的视角

Annika Bush, Meltem Aksoy, Markus Pauly, Greta Ontrup

机构 * Research Center Trustworthy Data Science and Security, University Alliance Ruhr(可信数据科学与安全研究中心,鲁尔大学联盟) Department of Computer Science, Technical University Dortmund(计算机科学系,图林根技术大学) Chair of Mathematical Statistics and Applications in Industry, Technical University Dortmund(工业数学统计与应用教授职位,图林根技术大学) Department of Computer Science, University of Duisburg-Essen(计算机科学系,杜伊斯堡-埃森大学)

AI总结 本研究比较了五个先进LLM对可持续性与AI关系的视角,发现模型间存在显著差异,强调模型选择对可持续性战略的影响。

Comments Accepted for EMNLP Conference

Journal ref Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06696 2026-01-05 cs.CL cs.LG

Simple and Effective Input Reformulations for Translation

简单而有效的输入改写用于翻译

Brian Yu, Hansen Lillemark, Kurt Keutzer

AI总结 本文通过简单输入改写方法提升翻译任务的性能,实验表明在佛洛斯200基准测试中性能提升达3.5 chrF++。

Comments 13 pages, 6 figures. To be published in Empirical Methods in Natural Language Processing (Main) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11938 2025-12-30 cs.CL cs.AI cs.LG

Improving Large Language Model Safety with Contrastive Representation Learning

通过对比表征学习提升大语言模型安全性

Samuel Simko, Mrinmaya Sachan, Bernhard Schölkopf, Zhijing Jin

机构 * ETH Zurich(苏黎世联邦理工学院) MPI for Intelligent Systems(智能系统最大计划) University of Toronto(多伦多大学)

AI总结 本文提出基于对比表征学习的框架,通过三元组损失和对抗性难负样本挖掘提升大语言模型对对抗攻击的鲁棒性。

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20899 2025-12-30 cs.CL cs.SD eess.AS

Dub-S2ST: Textless Speech-to-Speech Translation for Seamless Dubbing

Dub-S2ST: 无文本语音到语音翻译用于无缝配音

Jeongsoo Choi, Jaehun Kim, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 Dub-S2ST通过无文本语音到语音翻译模型实现无缝配音,保留语音特征并提升翻译质量。

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11244 2025-12-30 cs.CL

Iterative Multilingual Spectral Attribute Erasure

迭代多语言光谱属性擦除

Shun Shao, Yftah Ziser, Zheng Zhao, Yifu Qiu, Shay B. Cohen, Anna Korhonen

机构 * University of Cambridge(剑桥大学) University of Edinburgh(爱丁堡大学) NVIDIA Research(NVIDIA研究)

AI总结 IMSAE通过迭代SVD截断在多语言中减轻联合偏见子空间,优于传统单语言和跨语言去偏方法。

Comments Accepted to the main conference of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03814 2025-12-29 cs.LG cs.AI cs.CL

Recursive Training Loops in LLMs: How training data properties modulate distribution shift in generated data?

LLMs中的递归训练循环:训练数据属性如何调节生成数据中的分布偏移

Grgur Kovač, Jérémy Perez, Rémy Portelas, Peter Ford Dominey, Pierre-Yves Oudeyer

机构 * Flowers TEAM, INRIA(INRIA Flowers TEAM) Ubisoft La Forge INSERM UMR 1093-CAPS Robot Cognition Laboratory, Institute Marey(Institute Marey Robot Cognition Laboratory)

AI总结 本文研究了LLMs中递归训练循环中训练数据属性对生成数据分布偏移的影响,发现词汇多样性放大偏移,而语义多样性和数据质量减轻偏移,并揭示了不同领域数据之间的模块化影响。

Comments Accepted to EMNLP 2025 (Oral), Source Code: https://github.com/flowersteam/ce_llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18848 2025-12-29 cs.CL cs.AI cs.LG stat.ME

A Causal Lens for Evaluating Faithfulness Metrics

一种评估忠实度度量的因果视角

Kerem Zaman, Shashank Srivastava

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文提出因果诊断性框架,用于评估自然语言解释的忠实度度量,通过生成忠实-不忠实解释对,发现Filler Tokens在多任务中表现最佳,连续度量更优但易受噪声影响。

Comments Published at EMNLP 2025; 25 pages, 22 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21559 2025-12-23 cs.CV

X-CoT: Explainable Text-to-Video Retrieval via LLM-based Chain-of-Thought Reasoning

X-CoT:基于LLM链式推理的可解释文本到视频检索

Prasanna Reddy Pulakurthi, Jiamian Wang, Majid Rabbani, Sohail Dianat, Raghuveer Rao, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗切斯特理工学院) DEVCOM Army Research Laboratory(陆军研究实验室)

AI总结 X-CoT通过基于LLM的链式推理实现文本到视频检索的可解释性,提升检索性能并提供详细的推理依据。

Comments 12 pages, 7 figures. Accepted at EMNLP 2025 (Main Conference)

Journal ref Proc. EMNLP 2025, pages 31172-31183, Suzhou, China, Nov. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16923 2025-12-23 cs.CL cs.AI

A Systematic Survey of Automatic Prompt Optimization Techniques

大规模语言模型自动提示优化技术系统调查

Kiran Ramnath, Kang Zhou, Sheng Guan, Soumya Smruti Mishra, Xuan Qi, Zhengyuan Shen, Shuai Wang, Sangmin Woo, Sullam Jeoung, Yawei Wang, Haozhu Wang, Han Ding, Yuzhe Lu, Zhichao Xu, Yun Zhou, Balasubramaniam Srinivasan, Qiaojing Yan, Yueyan Chen, Haibo Ding, Panpan Xu, Lin Lee Cheong

机构 * Amazon Web Services(亚马逊网络服务)

AI总结 本文系统调查了自动提示优化技术,提出了统一框架并分类相关工作,旨在推动该领域进一步研究。

Comments 8 main pages, 31 total pages, 1 figure

Journal ref In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP), pages 33066-33098, Suzhou, China, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18362 2025-12-23 cs.CL

SRS-Stories: Vocabulary-constrained multilingual story generation for language learning

SRS-Stories: 词汇受限的多语言故事生成用于语言学习

Wiktor Kamzela, Mateusz Lango, Ondrej Dusek

机构 * Poznan University of Technology, Institute of Computer Science(波兹南技术大学计算机科学学院) Charles University, Faculty of Mathematics and Physics(查尔斯大学数学与物理系)

AI总结 SRS-Stories通过间隔重复系统生成多语言故事,利用已知词汇教授新词并复习旧词,提升语言学习效果。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18360 2025-12-23 cs.CL cs.AI

LLM Agents Implement an NLG System from Scratch: Building Interpretable Rule-Based RDF-to-Text Generators

LLM Agents 实现从零构建 NLG 系统:构建可解释的基于规则的 RDF-to-Text 生成器

Mateusz Lango, Ondřej Dušek

机构 * Charles University, Faculty of Mathematics and Physics(查理大学数学与物理系)

AI总结 本文提出了一种基于 LLM agent 的神经符号框架,通过协作交互生成可解释的 RDF-to-Text 生成器,减少幻觉并提升生成效率。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09587 2025-12-19 cs.CL

OpenNER 1.0: Standardized Open-Access Named Entity Recognition Datasets in 50+ Languages

OpenNER 1.0: 50余种语言标准化开放访问命名实体识别数据集

Chester Palen-Michel, Maxwell Pickering, Maya Kruse, Jonne Sälevä, Constantine Lignos

机构 * Michtom School of Computer Science(米切姆计算机科学学院) Brandeis University(布兰迪大学)

AI总结 OpenNER 1.0提供50余种语言的标准化NER数据集,通过修正标注格式和统一表示形式,支持多语言和多本体NER研究,并展示了不同预训练模型在NER任务中的性能差异。

Comments Published in the proceedings of EMNLP 2025

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 33637-33662, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15250 2025-12-19 cs.CL cs.AI

EMNLP: Educator-role Moral and Normative Large Language Models Profiling

EMNLP: 教育者角色道德与规范大型语言模型画像

Yilin Jiang, Mingzi Zhang, Sheng Jin, Zengyi Yu, Xiangjie Kong, Binghao Tu

机构 * College of Education, Zhejiang University of Technology(浙江工业大学教育学院) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Faculty of Education, East China Normal University(华东师范大学教育学院) GuangHua Law School, ZheJiang University(浙江大学光华法学院) College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院)

AI总结 本文提出EMNLP框架,用于评估教育者角色LLM的伦理和心理一致性,通过构建88个教师特定道德困境,揭示教师角色LLM在道德推理和情感复杂情境中的表现差异。

Comments 29pages, 15 figures, Accepted by EMNLP Main Confrence

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12913 2025-12-19 cs.CL

MAIN: Mutual Alignment Is Necessary for instruction tuning

MAIN:互斥对齐是指令微调的必要条件

Fanyi Yang, Jianfeng Liu, Xin Zhang, Haoyu Liu, Xixin Cao, Yuefeng Zhan, Hao Sun, Weiwei Deng, Feng Sun, Qi Zhang

机构 * Peking University(北京大学) Microsoft Corporation(微软公司)

AI总结 本文提出MAIN框架,通过互斥约束增强指令与响应的一致性,提升LLM在多种基准上的性能。

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20764 2025-12-18 cs.CL

Feel the Difference? A Comparative Analysis of Emotional Arcs in Real and LLM-Generated CBT Sessions

感知差异?真实与LLM生成CBT对话中情感弧的比较分析

Xiaoyi Wang, Jiwei Zhang, Guangtao Zhang, Honglei Guo

机构 * Department of Computer Science, Shantou University(汕头大学计算机科学系) Department of Automation, Tsinghua University(清华大学自动化系) BNRIST, Tsinghua University(清华大学脑科学与类脑智能研究院)

AI总结 本研究通过比较真实与LLM生成的CBT对话,揭示了合成对话在情感动态上的不足,强调了情感真实性的关键作用。

Comments Accepted at 2025 EMNLP findings,19 page,2 figures

Journal ref In Findings of the Association for Computational Linguistics: EMNLP 2025, pages 19999-20017

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11162 2025-12-17 cs.CV cs.LG

VIBE: Can a VLM Read the Room?

VIBE:视觉语言模型能否读懂房间?

Tania Chakraborty, Eylon Caplan, Dan Goldwasser

机构 * Purdue University(普渡大学)

AI总结 本文提出视觉社交-语用推理任务,揭示VLM在社交推理中的局限性,并通过高质量数据集评估多种VLM的性能。

Comments Findings of EMNLP, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17399 2025-12-17 cs.CL

DIWALI: Diversity and Inclusivity aWare cuLture specific Items for India: Dataset and Assessment of LLMs for Cultural Text Adaptation in Indian Context

DIWALI:多样性与包容性-aware的文化特定项目用于印度:数据集和对LLM进行文化文本适应的评估

Pramit Sahoo, Maharaj Brahma, Maunendra Sankar Desarkar

机构 * Natural Language and Information Processing Lab (NLIP) Indian Institute of Technology Hyderabad(自然语言与信息处理实验室(NLIP)印度理工学院海得拉巴)

AI总结 DIWALI数据集通过17个文化维度的8,000个文化概念,评估LLM在印度文化文本适应中的文化意识与一致性。

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16313 2025-12-17 cs.LG cs.AI cs.CL

Retrieval Enhanced Feedback via In-context Neural Error-book

通过上下文神经错误本增强的检索反馈

Jongyeop Hyun, Bumsoo Kim

机构 * School of CSE Chung-Ang University(计算机科学与工程学院 Chung-Ang 大学)

AI总结 REFINE通过结构化反馈框架,系统分析并缓解多模态推理中的错误,提升推理效率和可扩展性。

Comments Accepted at EMNLP 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11656 2025-12-16 cs.MA cs.AI cs.CL

MALLM: Multi-Agent Large Language Models Framework

MALLM:多智能体大语言模型框架

Jonas Becker, Lars Benedikt Kaesberg, Niklas Bauer, Jan Philip Wahle, Terry Ruas, Bela Gipp

机构 * University of Göttingen(哥廷根大学) LKA NRW(北莱茵-威斯特法伦州实验室)

AI总结 MALLM是一个开源框架,通过提供多种配置选项,系统分析多智能体辩论的组件,促进对智能体角色、响应生成器、讨论范式和决策协议的深入理解。

Comments Accepted at EMNLP 2025 (Demo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19764 2025-12-16 cs.CL

Principled Personas: Defining and Measuring the Intended Effects of Persona Prompting on Task Performance

原则性人格:定义并衡量人格提示对任务表现的预期效果

Pedro Henrique Luz de Araujo, Paul Röttger, Dirk Hovy, Benjamin Roth

AI总结 本文研究了专家人格提示对任务表现的影响,发现其效果不一致,模型对无关属性敏感,提出缓解策略但仅对大模型有效,强调需更严谨的人格设计和评估方案。

Comments 30 pages, 29 figures, accepted to EMNLP 2025

Journal ref In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 26845-26874, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16994 2025-12-16 cs.CL cs.AI

GRADE: Generating multi-hop QA and fine-gRAined Difficulty matrix for RAG Evaluation

GRADE: 生成多跳问答和细粒度难度矩阵用于RAG评估

Jeongsoo Lee, Daeyong Kwon, Kyohoon Jin

机构 * DATUMO Graduate School of Culture Technology, KAIST(文化科技研究生院,韩国科学技术院)

AI总结 GRADE提出了一种新的RAG评估框架,通过多跳问答和细粒度难度矩阵来评估和改进多步推理能力。

Comments Accepted at EMNLP 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14829 2025-12-16 cs.CL

Measuring Chain of Thought Faithfulness by Unlearning Reasoning Steps

通过反向学习推理步骤来衡量推理链的忠实性

Martin Tutek, Fateme Hashemi Chaleshtori, Ana Marasović, Yonatan Belinkov

机构 * Technion - Israel Institute of Technology(技术学院-以色列理工学院) University of Utah(犹他大学)

AI总结 通过反向学习推理步骤来评估推理链的参数忠实性,揭示模型推理与预测之间的关系。

Comments Outstanding paper at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22888 2025-12-12 cs.CL

When Models Reason in Your Language: Controlling Thinking Language Comes at the Cost of Accuracy

当模型用你的语言思考:控制思考语言会以准确性为代价

Jirui Qi, Shan Chen, Zidi Xiong, Raquel Fernández, Danielle S. Bitterman, Arianna Bisazza

机构 * University of Groningen(格罗宁根大学) Harvard University(哈佛大学) Mass General Brigham(麻省总医院) Boston Children’s Hospital(波士顿儿童医院) University of Amsterdam(阿姆斯特丹大学)

AI总结 研究发现,强制模型用用户语言推理虽提高可读性但降低准确性,通过微调可缓解此矛盾,揭示当前大型推理模型在多语言推理上的局限性。

Comments Accepted at EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08694 2025-12-12 cs.CL

TP-RAG: Benchmarking Retrieval-Augmented Large Language Model Agents for Spatiotemporal-Aware Travel Planning

TP-RAG:用于时空感知旅行规划的检索增强型大语言模型代理基准测试

Hang Ni, Fan Liu, Xinyu Ma, Lixin Su, Shuaiqiang Wang, Dawei Yin, Hui Xiong, Hao Liu

AI总结 TP-RAG提出了一种用于时空感知旅行规划的检索增强型大语言模型基准测试,通过整合参考轨迹提升旅行计划的空间效率和兴趣点合理性,采用EvoRAG框架实现更高效的时空合规性。

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00597 2025-12-12 cs.CL cs.AI

On the Consistency of Multilingual Context Utilization in Retrieval-Augmented Generation

在检索增强生成中多语言上下文利用的一致性

Jirui Qi, Raquel Fernández, Arianna Bisazza

机构 * Center for Language and Cognition (CLCG), University of Groningen(格罗宁根大学语言与认知中心) Institute for Logic, Language and Computation (ILLC), University of Amsterdam(阿姆斯特丹大学逻辑、语言与计算研究所)

AI总结 研究探讨LLMs在多语言RAG中利用不同语言上下文的一致性,发现其能提取异语言信息但难以生成正确语言答案。

Comments Best Paper Award at MRL Workshop 2025, colocated with EMNLP 2025. All codes and data are released at https://github.com/Betswish/mRAG-Context-Consistency

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19999 2025-12-12 cs.CL

The SIFo Benchmark: Investigating the Sequential Instruction Following Ability of Large Language Models

SIFo基准:研究大型语言模型的顺序指令遵循能力

Xinyi Chen, Baohao Liao, Jirui Qi, Panagiotis Eustratiadis, Christof Monz, Arianna Bisazza, Maarten de Rijke

机构 * University of Amsterdam(阿姆斯特丹大学) University of Groningen(格罗宁根大学)

AI总结 SIFo基准通过四个任务评估大型语言模型在多指令遵循中的能力,发现较新和更大的模型在任务表现上更优,揭示了当前语言模型在指令序列处理上的鲁棒性不足。

Comments EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11927 2025-12-11 cs.AI cs.CL

Transparent and Coherent Procedural Mistake Detection

透明且一致的程序性错误检测

Shane Storks, Itamar Bar-Yossef, Yayuan Li, Zheyuan Zhang, Jason J. Corso, Joyce Chai

机构 * University of Michigan(密歇根大学)

AI总结 本文提出了一种透明且一致的程序性错误检测方法,通过生成视觉自我对话的合理性来提高检测性能,并利用NLI模型制定自动化指标以评估生成的合理性一致性。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06272 2025-12-09 cs.CL cs.CE

Golden Touchstone: A Comprehensive Bilingual Benchmark for Evaluating Financial Large Language Models

黄金触点:一种全面的双语基准,用于评估金融大语言模型

Xiaojun Wu, Junxi Liu, Huanyi Su, Zhouchi Lin, Yiyan Qi, Chengjin Xu, Jiajun Su, Jiajie Zhong, Fuwei Wang, Saizhuo Wang, Fengrui Hua, Jia Li, Jian Guo

机构 * IDEA Research(IDEA研究机构) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Nanjing University(南京大学) South China Normal University(华南师范大学) DataArcTech Ltd.(DataArcTech有限公司)

AI总结 本研究提出Golden Touchstone双语基准,用于全面评估金融大语言模型的性能,通过对比分析揭示模型在处理复杂金融信息时的优势与局限。

Comments Published in Findings of EMNLP 2025

Journal ref In Findings of the Association for Computational Linguistics: EMNLP 2025, pages 22544-22560, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11192 2025-12-09 cs.CL cs.AI

I Learn Better If You Speak My Language: Understanding the Superior Performance of Fine-Tuning Large Language Models with LLM-Generated Responses

我如果能用我的语言说话会学得更好:理解通过微调大型语言模型与LLM生成响应的优越性能

Xuan Ren, Biao Wu, Lingqiao Liu

机构 * University of Adelaide(阿德莱德大学) University of Technology Sydney(悉尼科技大学)

AI总结 本文研究了LLM生成响应在微调大型语言模型时的优越性能,发现LLM对自身生成响应的熟悉性是提升学习效果的关键因素。

Comments The paper has been accepted to EMNLP 2024 (Main Conference) there is a follow up paper: Efficiently Selecting Response Generation Strategies for Synthetic Data Construction by Self-Aligned Perplexity Note: This is a revised version of arXiv:2402.11192 (v1, submitted 17 Feb 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16188 2025-12-08 cs.CL

SAE-SSV: Supervised Steering in Sparse Representation Spaces for Reliable Control of Language Models

SAE-SSV: 在稀疏表示空间中进行监督引导以可靠控制语言模型

Zirui He, Mingyu Jin, Bo Shen, Ali Payani, Yongfeng Zhang, Mengnan Du

机构 * NJIT(新 jersey 理工学院) Rutgers University(罗格斯大学) Cisco(思科公司)

AI总结 SAE-SSV通过在稀疏表示空间中训练监督引导向量,实现对语言模型行为的可靠控制,提高了生成任务的成功率和可解释性。

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏