arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

至 收录 7861
2605.28639 2026-05-28 cs.CL cs.AI

The Attentional White Bear Effect in Transformer Language Models

Transformer语言模型中的注意力白熊效应

Rebecca Ramnauth, Brian Scassellati

机构 * Yale University(耶鲁大学)

AI总结 通过表征探测、注意力分析和行为语义泄露实验,发现指令抑制下Transformer语言模型仍能恢复被禁止概念的表征并影响后续生成,揭示了行为对齐与表征对齐之间的根本差距。

Comments Currently under review at EMNLP 2026

URL PDF HTML 收藏
2605.28363 2026-05-28 cs.CL

PubMedCausal: A Span-Level Annotated Corpus for Causal Relation Extraction in Biomedical Text

PubMedCausal: 用于生物医学文本中因果关抽取的跨度级标注语料库

Ifeoluwa Kunle-John, Josiah Paul, Oluwatosin Agbaakin, Peter Aina, Ikenna Odezuligbo, Sydney Anuyah

机构 * Edyah Limited(Edyah有限公司) University of Ibadan(伊巴丹大学) Indiana University(印第安纳大学) Creighton University(克雷顿大学)

AI总结 为解决现有资源将因果关系与广义关联混淆、限制句子级标注或仅关注显式因果线索的问题,构建了基于PubMed摘要的跨度级因果关抽取语料库PubMedCausal,包含30,000段落级行、3,945因果行和6,491个裁决的因果对,并基准测试了判别式编码器和开源生成模型。

Comments Submitted to EMNLP 2026, 8 Pages, 23 page appendix

URL PDF HTML 收藏
2605.28123 2026-05-28 cs.CL

Risk-aware Selective Prompting for Hallucination Mitigation in Large Vision-Language Models

风险感知的选择性提示用于大型视觉-语言模型中的幻觉缓解

Yuang Huang, Yafeng Zhang, Yu Zilan

机构 * Shanghai Jiao Tong University(上海交通大学) iFLYTEK Tsinghua University(清华大学)

AI总结 本文系统研究提示验证在大型视觉-语言模型中的风险,发现其效果依赖输入难度,并提出基于预生成不确定性信号的选择性提示方法RSP以平衡性能。

Comments 7 pages, 1 figures, submitted to ACL ARR 2026 May (EMNLP)

URL PDF HTML 收藏
2605.27374 2026-05-28 cs.CL

ICG: Improving Cover Image Generation via MLLM-based Prompting and Personalized Preference Alignment

ICG: 通过基于MLLM的提示和个性化偏好对齐改进封面图像生成

Zhipeng Bian, Jieming Zhu, Qijiong Liu, Wang Lin, Guohao Cai, Zhaocheng Du, Jiacheng Sun, Zhou Zhao, Zhenhua Dong

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学)

AI总结 提出ICG框架,利用多模态大语言模型和扩散模型,通过元标记提取语义特征、用户嵌入个性化对齐及多奖励学习策略,实现高质量、个性化封面图像生成。

Comments Published in Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 12268-12278, EMNLP 2025. Official version: https://doi.org/10.18653/v1/2025.emnlp-main.617

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (Main Track) EMNLP 2025 12268-12278

URL PDF HTML 收藏
2601.10085 2026-05-28 cs.CL

CALM-IT: Generating Realistic Long-Form Motivational Interviewing Dialogues with Dual-Actor Conversational Dynamics Tracking

CALM-IT: 通过双角色对话动态追踪生成逼真的长形式动机访谈对话

Viet Cuong Nguyen, Nhi Yen Nguyen, Kristin A. Candan, Mary Conlon, Vanessa Rumie, Kristen Risola, Michael L. Birnbaum, Munmun De Choudhury

机构 * Georgia Institute of Technology(佐治亚理工学院) Northwell Health(北well健康) Columbia University(哥伦比亚大学)

AI总结 提出CALM-IT框架,通过显式建模客户与咨询师状态的演变来生成和评估长形式动机访谈对话,在8,232个合成对话语料上优于基线方法,尤其在MITI 4.2全局评分和客户接受率上表现最佳。

Comments 53 pages, in submission to EMNLP

URL PDF HTML 收藏
2605.26840 2026-05-27 cs.CL

Optimising Factual Consistency in Summarisation via Preference Learning from Multiple Imperfect Metrics

通过来自多个不完美指标的偏好学习优化摘要的事实一致性

Yuxuan Ye, Raul Santos-Rodriguez, Edwin Simpson

机构 * Intelligent System Laboratory(智能系统实验室)

AI总结 提出一种自动化训练流程,通过聚合多个弱事实性指标的分数并映射为偏好,过滤高分歧样本,利用词汇相似摘要对进行偏好学习,从而提升摘要的事实一致性。

Comments EMNLP 2025 Findings

URL PDF HTML 收藏
2605.26645 2026-05-27 cs.CL

Bounded Path Context: A Controlled Study of Visible Path History in LLM-Based Knowledge Graph Question Answering

有界路径上下文:基于LLM的知识图谱问答中可见路径历史的受控研究

Xihang Shan, Ye Luo

机构 * School of Mathematical Sciences(数学科学学院) Xiamen University(厦门大学) School of Informatics(信息学院)

AI总结 本文提出有界路径上下文(BPC)方法,通过将完整路径存储在符号记忆中,仅暴露最近K跳路径给关系选择提示,在WebQSP和CWQ数据集上使用Qwen3.5-9B-AWQ模型达到或超过全历史提示的性能,同时减少输入token。

Comments 13 pages, 1 figure, submitted to EMNLP 2026

URL PDF HTML 收藏
2605.07990 2026-05-27 cs.CL cs.AI cs.LG cs.SE

Tool Calling is Linearly Readable and Steerable in Language Models

语言模型中的工具调用是线性可读且可引导的

Zekun Wu, Ze Wang, Seonglae Cho, Yufei Yang, Adriano Koshiyama, Sahan Bulathwela, Maria Perez-Ortiz

机构 * University College London(伦敦大学学院) Holistic AI Imperial College London(伦敦帝国学院)

AI总结 本文发现语言模型内部存在对应工具选择的线性方向,通过干预该方向可切换工具调用,并能提前检测潜在错误,在多个模型和基准上验证了有效性。

Comments 24 pages. ACL ARR May 2026 submission (EMNLP 2026 preferred venue); v2 reflects revised manuscript

URL PDF HTML 收藏
2605.25358 2026-05-26 cs.CL cs.AI cs.CY

AI-Associated Lexical Shifts Across 34 Languages: Cross-Lingual Convergence and Diachronic Uptake in News Writing

AI相关的词汇转变跨越34种语言:新闻写作中的跨语言趋同与历时采纳

Thomas Stephan Juzek

机构 * Florida State University(佛罗里达州立大学)

AI总结 通过分析34种语言的新闻语料,使用GPT-4.1续写诊断方法,发现AI过度使用的词汇在跨语言中呈现语义趋同,且ChatGPT发布后这些词汇的使用频率显著增加。

Comments 19 pages (9-page main body, plus references and appendices), 3 figures; ACL ARR reviewed, committed to EMNLP 2026

URL PDF HTML 收藏
2502.11167 2026-05-26 cs.LG cs.CL

SURGE: On the Potential of Large Language Models as General-Purpose Surrogate Code Executors

SURGE: 大型语言模型作为通用代理代码执行器的潜力

Bohan Lyu, Siqiao Huang, Zichen Liang

机构 * Department of Computer Science and Technology, Tsinghua(清华大学计算机科学与技术系) Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua(清华大学交叉信息研究院)

AI总结 提出SURGE基准,包含1160个问题覆盖8个关键方面,通过评估21个开源和专有LLM,研究其作为代码执行预测代理模型的可行性、扩展律、数据效率和预测准确性。

Journal ref Proceedings of The 2025 Conference on Empirical Methods in Natural Language Processing

URL PDF HTML 收藏
2605.25186 2026-05-26 cs.CL cs.AI

By Their Fruits You Will Know Them: Comparing Formalizations of Law by the Decisions They Encode

凭其果实,你们将认识它们:通过编码的决策比较法律的形式化

Julius Vernie, Matthias Grabmair

机构 * Technical University of Munich(慕尼黑技术大学)

AI总结 提出一种系统方法,通过SAT求解器枚举不同形式化在边缘案例上的分歧,并转化为具体事实场景,以比较同一法律条款的不同形式化,应用于九个前沿LLM生成的十个欧盟条款形式化,发现行为分歧与结构一致性基本不相关。

Comments 23 pages, 17 figures, submitted to EMNLP PROC 2026

URL PDF HTML 收藏
2605.24659 2026-05-26 cs.LG

IterInject: Indirect Prompt Injection Against LLM Agents via Feedback-Guided Iterative Optimization

IterInject: 通过反馈引导的迭代优化实现对LLM智能体的间接提示注入

Zixuan Chen, Jiaxiang Chen, Li Luo, Ke Xu, Xiaoxiang Huang, Tanfeng Sun, Xinghao Jiang

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学)

AI总结 提出IterInject框架,通过规则诊断器和LLM优化器迭代优化对抗载荷,实现对LLM智能体的间接提示注入攻击,在多个基准和实际系统中显著优于现有方法,并揭示了注意力介导的阈值机制。

Comments Submitted to EMNLP 2026

URL PDF HTML 收藏
2509.10515 2026-05-26 cs.LG cs.CL

Adaptive Preference Optimization with Uncertainty-aware Utility Anchor

基于不确定性感知效用锚点的自适应偏好优化

Xiaobo Wang, Zixia Jia, Jiaqi Li, Qi Liu, Zilong Zheng

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究院,合肥综合性国家科学中心) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

AI总结 提出一种通用离线偏好优化框架UAPO,通过引入锚点函数估计偏好数据标注的不确定性,支持非配对数据训练,提升数据利用效率和训练鲁棒性。

Comments Accepted by EMNLP 2025 Findings

URL PDF HTML 收藏
2311.01468 2026-05-25 cs.CL cs.LG

Remember what you did so you know what to do next

记住你做了什么,以便知道下一步该做什么

Manuel R. Ciosici, Alex Hedges, Yash Kankanampati, Justin Martin, Marjorie Freedman, Ralph Weischedel

机构 * Information Sciences Institute, University of Southern California(信息科学研究所,南加州大学)

AI总结 本研究使用中等规模的大语言模型GPT-J为模拟机器人在ScienceWorld文本游戏中的30类目标生成计划,通过填充更多历史步骤显著提升性能,并发现任务平均可能掩盖性能差异。

Comments Identical to EMNLP 2023 Findings

URL PDF HTML 收藏
2110.01552 2026-05-25 cs.CL cs.AI cs.LG

Perhaps PTLMs Should Go to School -- A Task to Assess Open Book and Closed Book QA

或许PTLMs应该去上学——一项评估开卷和闭卷问答的任务

Manuel R. Ciosici, Joe Cecil, Alex Hedges, Dong-Ho Lee, Marjorie Freedman, Ralph Weischedel

机构 * Information Sciences Institute, University of Southern California(信息科学研究所,南加州大学)

AI总结 提出一项基于大学教科书内容的新问答任务,通过闭卷和开卷测试评估预训练语言模型对教材的理解能力,发现模型在闭卷测试中表现接近随机,开卷测试略有提升。

Comments Identical to the EMNLP 2021 version

URL PDF HTML 收藏
2605.13989 2026-05-22 cs.CL

VectraYX-Nano: A 42M-Parameter Spanish Cybersecurity Language Model with Curriculum Learning and Native Tool Use

VectraYX-Nano: 一个具有课程学习和原生工具使用的4200万参数西班牙语网络安全语言模型

Juan S. Santillana

机构 * Globant

AI总结 本文提出了一种基于西班牙语的网络安全语言模型VectraYX-Nano,通过课程学习和原生工具调用,展示了在网络安全领域的应用与改进。

Comments 24 pages, 5 figures, 12 tables. v3: post-Chinchilla compute ablation (v8-v15), Globant affiliation finalized, EMNLP Findings 2026 submission. Released model: VectraYX-Nano v7 (42M params, GGUF Q4 ~20 MB, native MCP)

URL PDF HTML 收藏
2506.04708 2026-05-22 cs.CL

Accelerated Test-Time Scaling with Model-Free Speculative Sampling

加速测试时间缩放与模型无关的推测采样

Woomin Song, Saket Dingliwal, Sai Muralidhar Jayanthi, Bhavana Ganesh, Jinwoo Shin, Aram Galstyan, Sravan Babu Bodapati

机构 * KAIST(韩国科学技术院) Amazon AGI(亚马逊人工智能实验室) AirSignal

AI总结 本文提出STAND,一种无需模型的推测解码方法,通过利用推理轨迹中的冗余性,显著提升推理效率而不牺牲准确性,经多个模型和任务评估,STAND在保持准确性的同时将推理延迟降低了60-65%。

Comments EMNLP 2025 Oral

URL PDF HTML 收藏
2605.22001 2026-05-22 cs.CR cs.AI cs.CL

Blind Spots in the Guard: How Domain-Camouflaged Injection Attacks Evade Detection in Multi-Agent LLM Systems

守卫中的盲区:如何域伪装注入攻击在多智能体大语言模型系统中逃避检测

Aaditya Pai

机构 * Data Science Institute(数据科学研究所) Columbia University(哥伦比亚大学)

AI总结 本文研究了在多智能体大语言模型系统中,域伪装注入攻击如何通过模仿目标文档的领域词汇和权威结构来逃避检测,揭示了检测器在静态和伪装负载之间的检测率差异(Camouflage Detection Gap, CDG),并展示了多智能体辩论架构对静态注入攻击的放大效应以及检测器增强的有限有效性。

Comments 8 pages, 3 figures, 2 tables. Submitted to EMNLP 2026 ARR cycle

URL PDF HTML 收藏
2605.21974 2026-05-22 cs.AI

Format-Constraint Coupling in Knowledge Graph Construction from Statistical Tables

知识图谱构建中统计表的格式约束耦合

Jingxuan Qi, Zhiqiang Ye, Yuxiang Feng

机构 * South China University of Technology(华南理工大学)

AI总结 本文研究了在统计表中构建知识图谱时,格式约束与提取方案之间的耦合效应,发现格式与约束的联合影响超过了独立影响的总和,并提出了CSVFidelity-Bench基准测试集以支持基于保真的评估。

Comments 8 pages main body, 18 pages appendices. Submitted to EMNLP 2026 via ACL Rolling Review (ARR). Corresponding author: Yuxiang Feng (yxfeng@scut.edu.cn). Code and data available at https://anonymous.4open.science/r/sge_lightrag-BE19

URL PDF HTML 收藏
2605.21958 2026-05-22 cs.CL

Diagnosis Is Not Prescription: Linguistic Co-Adaptation Explains Patching Hazards in LLM Pipelines

诊断并非处方:语言共适应解释了LLM流水线中的修补危害

Yoon Jeonghun, Kim Dongchan

机构 * KAIST (Korea Advanced Institute of Science and Technology)(韩国科学技术院) NAVER Corp.(NAVER公司)

AI总结 本文研究了多模块LLM代理失败时,诊断与修补之间的矛盾,发现路由模块虽为瓶颈,但注入修正示例反而降低性能,而修正查询重写模块则更有效,提出了语言合同假说解释这种现象。

Comments Preprint. Under review at EMNLP 2026 (ARR)

URL PDF HTML 收藏
2605.20798 2026-05-21 cs.LG cs.CL

Most Transformer Modifications Still Do Not Transfer at 1-3B: A 2020-2026 Update to Narang et al. (2021) with Downstream Evaluation and a Noise Floor

大多数变换器修改仍无法在1-3B规模上迁移:对Narang等人(2021)的2020-2026年更新,包含下游评估和噪声底限

Yang Zhao, Jiahao Lu, Bin Huang, Guhua Zhang, Jie Zhou

机构 * Tencent(腾讯)

AI总结 本文在1-3B参数规模下,大多数变换器修改仍无法迁移,通过严格的等数据、等计算、等配方控制测试,并结合下游评估和噪声底限进行验证。

Comments 19 pages, 3 figures, under review at EMNLP 2026

URL PDF HTML 收藏
2605.20364 2026-05-21 cs.CL

When Reasoning Supervision Hurts: TTCW-Based Long-Form Literary Review Generation

推理监督有害:基于TTCW的长文本文学评论生成

Jinlong Liu, Mohammed Bahja, Mark Lee

机构 * School of Computer Science, University of Birmingham, United Kingdom(英国伯明翰大学计算机科学学院)

AI总结 本文提出了一种基于TTCW的长文本文学评论生成方法,通过构建包含263911个长文本故事的数据集,每个故事都标注了14个TTCW维度的评分和元合成评论。实验发现,非推理微调在性能和稳定性上更优,而推理监督模型更易出现解析失败,导致生成无关或重复的推理文本,表明在固定格式评分标准下,推理监督并不总是有益的。

Comments Submit to EMNLP 2026

URL PDF HTML 收藏
2507.18902 2026-05-20 cs.CL

SLoW: Select Low-frequency Words! Automatic Dictionary Selection for Translation on Large Language Models

SLoW: 选择低频词!大型语言模型翻译上的自动词典选择

Hongyuan Lu, Zixuan Li, Zefan Zhang, Wai Lam

机构 * The Chinese University of Hong Kong(香港中文大学) Southeast University(东南大学) FaceMind Corporation(FaceMind公司) College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院)

AI总结 本文提出了一种名为自动词典选择(ADS)的新任务,通过SLoW方法选择低频词典以提升翻译性能,无需访问训练数据,且在100种语言上显著节省token消耗并提升翻译效果。

Comments EMNLP 2025 Main

URL PDF HTML 收藏
2510.21712 2026-05-19 cs.IR cs.AI cs.CL

DecoupleSearch: Decouple Planning and Search via Hierarchical Reward Modeling

DecoupleSearch: 通过分层奖励建模解耦规划与搜索

Hao Sun, Zile Qiao, Bo Wang, Guoxin Chen, Yingyan Hou, Yong Jiang, Pengjun Xie, Fei Huang, Yan Zhang

机构 * Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团)

AI总结 本文提出DecoupleSearch框架,通过双值模型解耦规划与搜索过程,利用蒙特卡洛树搜索评估每一步的质量,并通过分层束搜索迭代优化规划和搜索候选,验证了方法的有效性。

Comments EMNLP 2025 Main Conference

URL PDF HTML 收藏
2410.13181 2026-05-19 cs.CL

AdaSwitch: Adaptive Switching between Small and Large Agents for Effective Cloud-Local Collaborative Learning

AdaSwitch: 一种在小型和大型代理之间自适应切换以实现有效的云-本地协作学习方法

Hao Sun, Jiayi Wu, Hengyi Cai, Xiaochi Wei, Yue Feng, Bo Wang, Shuaiqiang Wang, Yan Zhang, Dawei Yin

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Beijing, China(一般人工智能国家重点实验室,北京大学,北京,中国) School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学) East China Normal University(东华大学) Chinese Academy of Sciences(中国科学院) Baidu Inc(百度公司) Beijing Institute of Technology(北京理工大学) University of Birmingham(伯明翰大学)

AI总结 本文提出了一种新的LLM使用范式,通过自适应机制在云端和本地部署的LLM之间切换,以提高任务完成性能和效率,通过本地代理处理简单推理步骤,云代理处理复杂推理步骤,实验表明该方法在多个基准测试中有效提升了本地代理的性能。

Comments EMNLP 2024 Main Conference

URL PDF HTML 收藏
2605.17691 2026-05-19 cs.CL cs.AI

Validate Your Authority: Benchmarking LLMs on Multi-Label Precedent Treatment Classification

验证你的权威:在多标签先例处理分类上对LLM进行基准测试

M. Mikail Demir, M. Abdullah Canbaz

机构 * Department of Information Science and Technology(信息科学与技术系) College of Emergency Preparedness, Homeland Security, and Cybersecurity(应急准备、国土安全与网络安全学院) University at Albany, SUNY(萨利纳大学)

AI总结 本文提出了一种新的评估框架,通过专家标注的数据集对现代大语言模型进行基准测试,引入了平均严重性误差指标,以更准确地衡量分类错误的实践影响。

Comments Accepted for publication at the Natural Legal Language Processing Workshop (NLLP) 2025, co-located with EMNLP

URL PDF HTML 收藏
2509.21820 2026-05-19 cs.CL

Can LLMs Generate and Solve Linguistic Olympiad Puzzles?

大语言模型能否生成并解决语言奥林匹克谜题?

Neh Majmudar, Elena Filatova

机构 * CUNY(纽约大学)

AI总结 本文研究了大语言模型在生成和解决语言谜题中的能力,发现其在大多数谜题类型上优于人类,但对书写系统和不为人知语言的谜题表现较弱,提出了通过谜题生成促进语言学普及的研究意义。

Comments Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)

URL PDF HTML 收藏
2409.11022 2026-05-18 cs.CL cs.AI

DynamicNER: A Dynamic, Multilingual, and Fine-Grained Dataset for LLM-based Named Entity Recognition

DynamicNER: 一种动态、多语言和细粒度的用于基于大语言模型的命名实体识别的数据集

Hanjun Luo, Yingbin Jin, Xinfeng Li, Xuecheng Liu, Ruizhe Chen, Tong Shang, Kun Wang, Qingsong Wen, Zuozhu Liu

机构 * New York University Abu Dhabi(纽约大学阿布扎赫德分校) Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学) Nanyang Technology University(南阳技术大学) University of Electronic Science and Technology of China(电子科技大学) Texas A&M University(德克萨斯大学) Squirrel AI

AI总结 本文提出DynamicNER数据集,用于改进基于大语言模型的命名实体识别方法,通过动态实体分类和多语言支持,提升模型泛化能力与细粒度任务的准确率。

Comments This paper is accepted by EMNLP 2025 Main Conference

URL PDF HTML 收藏
2605.11348 2026-05-13 cs.CL cs.AI cs.IR cs.SI

Large Language Models for Causal Relations Extraction in Social Media: A Validation Framework for Disaster Intelligence

用于社交媒体因果关系提取的大型语言模型:灾害情报的验证框架

Ujun Jeong, Saketh Vishnubhatla, Bohan Jiang, Andre Harrison, Adrienne Raglin, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) DEVCOM Army Research Laboratory(陆军研究实验室)

AI总结 本文研究大型语言模型在灾害社交媒体中提取因果关系的有效性,提出专家导向的评估框架并评估提取关系是否由事后证据支持。

Comments Submitted to EMNLP

URL PDF HTML 收藏
2312.02549 2026-05-13 cs.CV cs.CL

DemaFormer: Damped Exponential Moving Average Transformer with Energy-Based Modeling for Temporal Language Grounding

DemaFormer: 带能量建模的阻尼指数移动平均变换器用于时序语言定位

Thong Nguyen, Xiaobao Wu, Xinshuai Dong, Cong-Duy Nguyen, See-Kiong Ng, Luu Anh Tuan

机构 * National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出DemaFormer,通过阻尼指数移动平均机制改进时序语言定位任务中的注意力机制,有效分离目标视频片段与其余片段。

Comments Accepted at EMNLP 2023 (Findings). Code is available at https://github.com/nguyentthong/demaformer

URL PDF HTML 收藏