arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

2026-08-26 至 2026-08-26 共收录 59
2608.23791 2026-08-26 eess.AS cs.AI 新提交

EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis

EmoTra-TTS:用于语音合成的流畅句内情感转换

Tianchi Liu, Zeyang Song, Tianrui Wang, Zhipeng Li, Chenglin Xu, Yiwen Guo

AI总结 EmoTra-TTS针对现有情感TTS系统与情感时间特性不匹配的问题,采用多遍流混合管道、双阶段VAD条件及方向-幅度解耦注入,实现流畅句内情感转换,且性能优于SOTA基线与商业系统。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24777 2026-08-26 cs.AI cs.CR 新提交

StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing

StepGuard:利用可扩展监督与安全-效用平衡学习步骤级护栏

Zhijie Zheng, Yu Li, Chen Qian, Yuqian Fu, Yanwei Fu, Lu Sheng, Jing Shao, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学) Fudan University(复旦大学) Renmin University of China(中国人民大学) KAUST(阿卜杜拉国王科技大学)

AI总结 该研究针对LLM智能体交互的安全风险,提出步骤级护栏模型StepGuard,通过自动数据引擎StepGen与动态平衡学习方法Balance-GRPO训练,在降低攻击成功率的同时仅小幅影响效用。

Comments Accepted by EMNLP 2026. Project page: this https URL (https://zheng977.github.io/StepGuard/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24758 2026-08-26 cs.AI 新提交

RACE: Scalable Statistical Estimation of Functional Consistency in LLM Neurons

RACE:LLM神经元中功能一致性的可扩展统计估计

Runyu Wang, Bo Liu, Xiaxin Zhang, Yu Han, Jiawei Cao, Xiaoye Zhang, Zhe Zhang, Yifan Yang, Peng Ping

机构 * Nantong University(南通大学) Chongqing University of Post and Telecommunications(重庆邮电大学) China Southern Power Grid Company Limited(中国南方电网有限责任公司) Meituan(美团)

AI总结 针对LLM神经元功能一致性的可扩展统计估计难题,提出RACE框架,其领域特异性更优、计算开销低两个数量级,可有效评估Transformer神经元的全领域功能一致性。

Comments EMNLP-26 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24654 2026-08-26 cs.CL cs.CY 新提交

Expectation, Backlash, Recovery, and Excitement: How Model Releases Shape Reddit Perceptions of Conversational AI Systems

期望、反弹、恢复与兴奋:模型发布如何塑造Reddit对对话式AI系统的认知

Vahid Rahimzadeh, Yury Zhauniarovich, Savvas Zannettou

机构 * Delft University of Technology(代尔夫特理工大学)

AI总结 该研究通过分析Reddit讨论发现,对话式AI系统的模型发布会动态影响用户认知,不同提供商的模型发布在情感表现与关注主题上存在明显差异,这类发布是面向用户的重要干预措施。

Comments Accepted at EMNLP 2026 Main Conference. The companion website is available at this https URL (https://vavre.github.io/p/upai)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24306 2026-08-26 cs.CL 新提交

Who is the Agent to Blame? Localizing Faithfulness and Citation Mistakes in Agentic Deep Research

该追责哪个智能体?定位智能体深度研究中的忠实度与引用错误

Eran Hirsch, David Wan, Han Wang, Elias Stengel-Eskin, Mohit Bansal, Ido Dagan

机构 * Bar-Ilan University(巴伊兰大学) UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本研究针对智能体深度研究系统的引用召回率低问题,提出定位错误来源的评估方法与四类错误分类法,应用于三个开源系统发现协调器为主要错误来源,通过简单干预提升5%引用召回率且不降低质量。

Comments Accepted to EMNLP 2026 (Main Conference). Code: this https URL (https://github.com/eranhirs/who-is-the-agent-to-blame)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24304 2026-08-26 cs.CL cs.AI 新提交

SENSESHIFT: Continuous Sentiment-Controlled Text Generation via Encoder-based Mask Infilling

SENSESHIFT:基于编码器的掩码填充实现连续情感控制文本生成

Shahed Masoudian, Markus Frohmann, Emmanouil Karystinaios, Navid Rekabsaz, Markus Schedl

机构 * Johannes Kepler University Linz(约翰开普勒林茨大学) Thomson Reuters Labs(汤森路透实验室) University of Toronto(多伦多大学) Vector Institute(向量研究所)

AI总结 该研究提出基于编码器的框架SenseShift,通过双向注意力等技术实现细粒度句子级情感控制文本生成,在故事与评论生成任务上,相比大解码器基线模型,情感可控性更强且文本质量与鲁棒性更优。

Comments Paper Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24291 2026-08-26 cs.AI cs.SE 新提交

ReproAgent: Contract-Guided Paper-to-Code Reproduction

ReproAgent:基于合约引导的论文到代码复现

Xue Hu, Zewei Pan, Zhongyuan Wang, Zhou Liu, Zeli Su, Wentao Zhang

机构 * Beihang University(北京航空航天大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Minzu University of China(中央民族大学) Zhongguancun Academy(中关村科学院)

AI总结 ReproAgent是基于合约引导的四阶段论文到代码复现流水线,在PaperBench Code-Dev基准上,其在两种骨干模型的同架构支架中取得最高平均得分,相关产物已公开。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24252 2026-08-26 cs.AI cs.SE 新提交

SA-Bench: Evaluating Semantic Alignment in LLM-Based Paper Reproduction

SA-Bench:评估基于大语言模型的论文复现中的语义对齐

Xue Hu, Zewei Pan, Zeli Su, Zhou Liu, Wentao Zhang

机构 * Beihang University(北京航空航天大学) Shanghai Jiao Tong University(上海交通大学) Minzu University of China(中央民族大学) Peking University(北京大学) Zhongguancun Academy(中关村科学院)

AI总结 本研究推出SA-Bench基准,评估LLM复现论文时的语义对齐,发现现有模型复现准确率低,需优化脚手架以提升语义规范验证能力。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24232 2026-08-26 cs.AI 新提交

TRACE: An Evidence-Grounded Benchmark for Safety Evaluation of Large Reasoning Models

TRACE:用于大型推理模型安全评估的基于证据的基准

Zhenyu Wu, Siyuan Chen, Changchun Yang, Jiaqi Dong, Min Zhou, Ali Almadan, Talal Hammad, Faisal Wahbo, Aminullah Tora, Mona Alshahrani, Xin Gao

机构 * King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)

AI总结 本研究推出基于证据的安全评估基准TRACE,覆盖大型推理模型的完整推理流程,评估发现现有防护栏模型对推理轨迹的安全判断难度大,且难以准确提取支撑证据,凸显了改进防护栏模型的必要性。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24214 2026-08-26 cs.AI 新提交

MetaRAG: Belief-Action Aligned Policy Optimization for Agentic RAG

MetaRAG:面向智能体检索增强生成的信念-行动对齐策略优化

Qiuyi Qi, Tian Liang, Jiamu Wang, Jinjian Zhang, Wei Zhou, Pengcheng Zhu, Linjian Mo, Ming Kong, Jie Liu, Qiang Zhu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学)

AI总结 MetaRAG是面向智能体RAG的信念-行动对齐策略优化框架,通过优先验证的行动生成与内部信念探测,提升了智能体RAG的准确率-效率权衡,收益可迁移至多种场景与模型。

Comments EMNLP 2026 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24189 2026-08-26 cs.CL cs.HC 新提交

MemUse: Moving Memory Evaluation from Direct QA to Natural Integration in Long-Term Human-AI Conversation

MemUse:将记忆评估从直接问答转向人机长期对话中的自然整合

Ryuichi Sumida, Koji Inoue, Tatsuya Kawahara

机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究科) SAP(思爱普)

AI总结 本研究针对对话式LLM记忆系统评估问题,提出MemUse方法,发现直接问答准确率与用户满意度无关,而自然整合能力与之相关,同时发布了相关语料库、MemUse及配套资源。

Comments Accepted to EMNLP 2026 (Main Conference). 31 pages, 15 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24135 2026-08-26 cs.AI cs.SE 新提交

Robust Code RL via Faulty-Code-Driven Test case Synthesis and Dense Reward Shaping

基于故障代码驱动的测试用例合成与密集奖励塑造的鲁棒代码强化学习

Yiwen Zhang, Xiaodong Yan, Zhenyu Huang, Deng Zhao, Liang Jiang, Qing Cui, Zujie Wen, Zhiqiang Zhang, Jun Zhou

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 该研究提出RobustTests框架,通过故障代码驱动的测试用例合成与密集奖励塑造,实现RL微调的Qwen3-32B在LiveCodeBench上较基线方法获绝对3%性能提升,增强了LLM代码生成能力。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24118 2026-08-26 cs.CL 新提交

MC-CXR: A Multi-Context Chest X-ray Benchmark for Context-Induced Disruption in Vision-Language Models

MC-CXR:用于视觉-语言模型中上下文诱导干扰的多上下文胸部X射线基准

Junhyeok Lee, Songsoo Kim, Kyu Sung Choi

机构 * Seoul National University College of Medicine(首尔国立大学医学院) Seoul National University Hospital(首尔国立大学医院) Healthcare AI Research Institute, Seoul National University Hospital(首尔国立大学医院医疗人工智能研究院)

AI总结 该研究针对视觉-语言模型在临床胸部X射线解读中受上下文干扰的问题,构建了MC-CXR基准,评估多类模型发现文本误导性比视觉误导性更易导致模型转向错误,验证了上下文诱导干扰的存在。

Comments 15 pages, 3 figures, 4 tables. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24103 2026-08-26 cs.AI 新提交

ACE: A Self-Correcting Agentic Canvas Editor for Multi-Slide Presentation Automation

ACE:用于多幻灯片演示自动化的自修正智能体画布编辑器

JooYoung Jang, Taegyeong Lee, Jihyeon Park, Nojun Kwak

机构 * Seoul National University(首尔大学) Miridih(米里迪)

AI总结 针对LLM智能体编辑演示文档的布局破坏与有效输出被误判问题,提出带CARE路由器和自修正循环的ACE,其性能优于对比方法,获盲评者偏好。

Comments 26 pages, 12 figures, EMNLP 2026 Industry Track (Main paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24080 2026-08-26 cs.CL cs.AI 新提交

When Less Is More: An Empirical Study of Minimal Responses in Counseling Dialogues and the Behavior of LLMs

少即是多:心理咨询对话中极简回应与大语言模型(LLM)行为的实证研究

Zhiyang Qi

机构 * The University of Tokyo(东京大学)

AI总结 本文通过实证研究发现,心理咨询对话中常见的极简回应在LLM生成内容中占比极低,商业LLM可按指令生成此类回应但难判断适用时机,专用模型表现差且基于LLM的评估易低估其价值。

Comments Camera-ready version. Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24024 2026-08-26 cs.AI 新提交

Beyond Confidence: Test-Time Scaling for Multi-Turn Search Agents via Retrieval Grounding

超越置信度:基于检索 grounding 的多轮搜索智能体测试时缩放

Hyunho Kook, Junhyuk So, Tianyu Fu, Haizhong Zheng, Beidi Chen

机构 * University of Southern California(南加州大学) Pohang University of Science and Technology (POSTECH)(浦项科技大学) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对多轮搜索智能体中基于置信度投票因复制膨胀失效的问题,提出检索接地投票(RGV)方法,在四个基准和五个 LLM 上性能优于基线,准确率最高提升 5.4%

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24004 2026-08-26 cs.CL 新提交

AgentSpec: Speculative Decoding for Batch Inference of LLM Agents

AgentSpec:面向大语言模型智能体批量推理的推测解码算法

Xin Wang, Ziming Miao, Yi Zhu, Hui Shen, Zhongwei Wan, Fan Yang, Mi Zhang

机构 * The Ohio State University(俄亥俄州立大学) Microsoft Research(微软研究院) University of Michigan(密歇根大学)

AI总结 针对LLM智能体批量推理响应慢的问题,本研究提出AgentSpec推测解码算法,通过结构隔离的draft机制和感知冗余的预算分配提升效率,在多工作负载与模型上验证其性能优于现有最优方法。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23978 2026-08-26 cs.AI cs.CV 新提交

When Seeing Is Not Enough: Benchmarking Interactive Visual Grounding in LVLMs

当视觉不再足够:评估大视觉语言模型(LVLMs)中的交互式视觉定位

Zhengxiang Wang, Owen Rambow

机构 * Stony Brook University(石溪大学)

AI总结 本文针对大视觉语言模型(LVLMs)提出交互式视觉定位的受控评估框架,发现当前LVLMs表现低于人类基线,主动提问式定位困难且校准不佳,该任务仍具挑战性。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23965 2026-08-26 cs.CR cs.AI cs.IR cs.LG 新提交

RAGSentinel: Certifiable Geometric Consensus for Robust Retrieval-Augmented Generation

RAGSentinel:用于鲁棒检索增强生成的可验证几何共识

Yueyang Quan, Anjun Gao, Yufei Xia, Minghong Fang, Zhuqing Liu

AI总结 研究针对RAG系统的中毒攻击漏洞,提出无训练无标签的RAGSentinel防御方法,通过几何共识过滤中毒文档,实验显示其能低攻高保准且抗自适应攻击。

Comments To appear in EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23959 2026-08-26 cs.CR cs.AI cs.IR cs.LG 新提交

NeuronGuard: Robust LLM Safety Alignment via Ablation-Aware Safety Signal Redistribution

NeuronGuard:通过感知消融的安全信号重新分配实现鲁棒的大语言模型安全对齐

Anjun Gao, Yueyang Quan, Yufei Xia, Zhuqing Liu, Minghong Fang

AI总结 NeuronGuard是一种微调阶段防御方法,通过重新分配安全信号抵御越狱和神经元级攻击,在三个LLM、六种攻击下实现近乎零攻击成功率且保持任务准确率。

Comments To appear in EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23918 2026-08-26 cs.AI cs.MA cs.PL 新提交

MARS: Multi-Specialist LLM Relay System for Competitive Programming

MARS:用于竞赛编程的多专家大语言模型中继系统

Andrei Mikhailov, Mikhail Burtsev, Alsu Sagirova

机构 * MIRAI London Institute for Mathematical Sciences(伦敦数学科学研究院) AXXX

AI总结 MARS是用于竞赛编程的多专家LLM中继框架,通过检索选择算法领域专家组成流水线,在CodeContests测试集上以更低成本和方差达到0.624±0.006的通过率,缩小了与CodeSIM的差距。

Comments 13 pages, 8 figures, EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23837 2026-08-26 cs.AI 新提交

SyPS: Measuring Sycophancy Prompt Sensitivity in Large Language Models

SyPS:衡量大语言模型中的谄媚提示敏感性

Lijia Huang, Yao Fu, Sihao Ren

机构 * Northeastern University(东北大学) Case Western Reserve University(凯斯西储大学) Everpure(爱惠浦)

AI总结 本研究提出SyPS框架,通过构建控制变量的提示变体,引入SPSS指标,探究用户相关线索变化对LLMs谄媚行为的影响,发现寻求认可等线索会增加谄媚,反谄媚提示可减少谄媚。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23830 2026-08-26 cs.CL cs.LG 新提交

Mitigating Exploration Bias in RL for Multi-Instruction Following

缓解多指令遵循强化学习中的探索偏差

Mian Zhang, Yueqin Yin, Kaiyu He, Peilin Wu, Xinlu Zhang, Mingyuan Zhou, Zhiyu Zoey Chen

机构 * UT Dallas(德克萨斯大学达拉斯分校) UT Austin(德克萨斯大学奥斯汀分校) UC Santa Barbara(加利福尼亚大学圣巴巴拉分校)

AI总结 针对多指令遵循RL中偏向简单指令的探索偏差,本文提出两个衡量指标与含行为引导、稀缺感知奖励的两阶段框架,在三个基准上显著优于基线。

Comments EMNLP 2026 Acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23719 2026-08-26 cs.CL 新提交

ADE: Agentic Data Evolution Framework for Human-Centered Objectives

ADE:面向以人为中心目标的智能体数据演化框架

Yang Yu, Yilin Jiang, Zexuan Fei, Yiming Luo, Xingkai Song, Kaiyi Huang, Aimin Zhou, Xin Lin, Fei Tan

机构 * East China Normal University(华东师范大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Innovation Institute(上海创新研究院)

AI总结 针对大语言模型与以人为中心目标对齐的难题,提出以数据为中心的ADE框架,通过OVS流程与稳态准入机制提升数据质量,在多基准及不同场景下均实现性能提升。

Comments accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23632 2026-08-26 cs.AI cs.SE 新提交

Function-Level Execution Feedback for Code Preference Optimization

用于代码偏好优化的函数级执行反馈

Idris Nechnech, Sehwan Kim, Jimin Seo, Yeongoon Kim, Minhae Oh, Sangwoo Hong, Jungwoo Lee

机构 * Seoul National University(首尔大学) Konkuk University(建国大学)

AI总结 本研究提出STEP-KTODER框架,将代码步骤定义为多函数程序的模块级函数,结合函数级过程监督与程序结果级反馈,在多个代码基准测试中优于KTO、DPO等方法,且验证了执行标签的重要性。

Comments 20 pages, 8 figures, 14 tables. Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23627 2026-08-26 cs.CL 新提交

From Triage to Discharge: A Survey of NLP Tasks, Methods, and Open Challenges in the Emergency Department

从分诊到出院:急诊部门NLP任务、方法与开放挑战综述

Dipankar Srirag, Aditya Joshi, Salil Kanhere, Padmanesan Narasimhan

机构 * University of New South Wales(新南威尔士大学)

AI总结 本综述分析46篇论文,梳理急诊部门分诊、诊断、处置阶段的NLP任务与方法,指出模型从特定架构向预训练语言模型转变等趋势,明确泛化能力有限等开放挑战,为相关研究提供方向。

Comments Accepted to the EMNLP 2026 Main Conference; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23391 2026-08-26 cs.CL cs.AI 版本更新

Cross-Domain, Multi-Task Data-to-Text Generation without In-Domain Training Data

无域内训练数据的跨域多任务数据到文本生成

Yifei Song, Kun Efimov-Zhang, Claire Gardent

机构 * CNRS/LORIA(法国国家科学研究中心/洛林计算机科学与应用实验室) Université de Lorraine(洛林大学)

AI总结 本研究提出数据驱动知识蒸馏(DDKD)及保结构增强方法,在无域内训练数据的跨域多任务数据到文本生成任务中,17亿参数的DDKD性能优于零样本推理与微调,且构建了QUINTD-5数据集。

Comments Accepted by EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23311 2026-08-26 cs.CL 版本更新

Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization

超越稳定性-探索困境:面向大语言模型策略优化的环境正则化方法

Xianlei Zhou, Xiangdi Meng, Yu He, Tianyu Qi, Shuyan Guan, Xianli Zhang, Jian Zhang, Xin Li, Qika Lin, Jun Liu

机构 * Alibaba Group(阿里巴巴集团) Beijing Normal University(北京师范大学) National University of Singapore(新加坡国立大学)

AI总结 该研究针对大语言模型策略优化的稳定性-探索困境,提出ERPO方法,通过查询KL散度正则化输入侧分布,接入现有策略优化流水线,在数学推理基准上实现了更强准确率与更稳定行为。

Comments Accepted to EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23271 2026-08-26 cs.CY cs.CL cs.HC 版本更新

Expectations and Practices around AI Disclosure in CS Research

计算机科学研究中AI披露的期望与实践

Arati Mohapatra, Danish Pruthi

AI总结 本研究调查顶级CS场所AI披露政策的不足,通过109名研究者的调查明确披露必要性及期望,分析13867份声明发现期望与实践脱节,并为相关方提出对齐建议。

Comments Accepted to EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23152 2026-08-26 cs.CL 版本更新

Counter with Evidence! A Multi-Agent Memory Efficient Reasoning Framework for Hate Category Informed Counterspeech Generation

结合证据的回应!用于仇恨类别感知反仇恨言论生成的多智能体内存高效推理框架

Sujoy Nath, Aswini Kumar, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度德里理工学院)

AI总结 该研究针对现有反仇恨言论生成未区分仇恨言论类别的问题,提出多智能体框架FIRE并构建数据集FactualCS,实验显示FIRE效果优于基线且毒性更低。

Comments Accepted at EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏