arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

2026-08-25 至 2026-08-25 共收录 93
2608.20920 2026-08-25 cs.CL 版本更新

ForeDreamer: A Self-Evolving Dual-Agent Memory Architecture for Future Event Prediction

ForeDreamer:用于未来事件预测的自进化双智能体记忆架构

Linhao Zhong, Zongze Du, Linyu Wu, Yu Bo, Hourong Li, Chenchen Jing, Hao Chen, Yuling Xi, Chunhua Shen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) National University of Singapore(新加坡国立大学) Zhejiang University of Technology(浙江工业大学)

AI总结 针对开放网络未来事件预测的不足,提出自进化双智能体框架ForeDreamer,分离事实与经验记忆,经Prophet Arena、FutureX实验验证其有效性

Comments accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20768 2026-08-25 cs.AI 版本更新

Beyond Endpoint Gains: A Weight-Delta Audit of Medical Specialization

超越端点增益:医学专业化的权重增量审计

Praphul Singh, Shanu Kumar, Akshat Agarwal

机构 * IIT Kanpur(印度理工学院坎普尔分校) Oracle Health AI(甲骨文健康人工智能公司) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

AI总结 本研究提出配对权重增量路径审计方法,应用于两组通用模型到医学专业模型的检查点对,发现解码器更新与医学基准变动相关,但组件定位不清晰,明确审计仅针对纯文本多项选择题基准变动。

Comments Preprint: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16554 2026-08-25 cs.CL 版本更新

Ask, Condition or Abstain: Reinforcement Learning for Missing-Premise Reasoning

询问、条件化或弃权:针对缺失前提推理的强化学习

Yongqi Tong, Zhenyu Zhang, Zimi Liu, Kewei Fu, Mingli Song, Haofei Zhang, Junshao Zhang, Hong Zhu, Jiang-Ming Yang, Xin Zhang, Jianshe Li

机构 * Ant International(蚂蚁国际) Zhejiang University(浙江大学) Dingtalk, Alibaba Group(阿里巴巴集团钉钉) Ant Group(蚂蚁集团)

AI总结 本研究提出ACA-RL框架,结合MPB基准,训练模型应对缺失前提的推理任务,可询问、条件化或弃权,提升欠定问题处理能力。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12750 2026-08-25 cs.CL cs.AI cs.HC 版本更新

PatientAct: Theory-Grounded Mental Health Client Simulation

PatientAct:基于理论的心理健康来访者模拟

Sahand Sabour, TszYam NG, Yaqian Chen, Guanqun Bi, Jialu Zhao, Minlie Huang

机构 * Tsinghua University(清华大学) Beijing Normal University(北京师范大学)

AI总结 PatientAct是基于临床理论的来访者模拟框架,通过整合5Ps临床案例 formulation与带信任阈值的动态记忆层,生成高临床合理性的多样化来访者,在40种临床情境中较基线方法显著提升了抗拒质量与行为真实性。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06495 2026-08-25 cs.CL 版本更新

ConstructCIE: A Dataset for Extracting Causal Information from Construction Accident Narratives

ConstructCIE:用于从施工事故叙述中提取因果信息的数据集

Hung Nguyen, Jaehoon Lee, Namgyun Kim, Kuan-Hao Huang

机构 * Texas A&M University(德克萨斯农工大学)

AI总结 该研究构建了用于提取施工事故因果信息的ConstructCIE数据集,评估了相关模型的性能,发现模型在精确跨度提取上存在局限,需强化领域基础与证据提取。

Comments Paper accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03446 2026-08-25 cs.CL 版本更新

Predicting Multilingual Classification and Translation Performance of LLMs with Cross-Lingual Alignment -- Is English Enough?

用跨语言对齐性预测大语言模型的多语言分类与翻译性能——英语足够了吗?

Adnan Al Ali, Kathy Hämmerl, Jindřich Libovický, Alexander Fraser

AI总结 该研究对比分析27种跨语言对齐分数变体,提出基于PMI的翻译指标,发现用英语的跨语言对齐可相当或更好预测LLMs翻译性能,为LLMs以英语为内部枢纽语言提供新证据。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20507 2026-08-25 cs.AI cs.LG 版本更新

CacheSpec: Finding the Sweet Spot for Small Models in Large Language Models

MiniCache:用于高效大语言模型推理的具有小模型接口的可重复使用程序缓存

Jingquan Chen, Jie Feng, Jinghua Piao, Shaogang Hu, Yong Li

AI总结 研究针对大语言模型推理成本高的问题,提出MiniCache框架,将PoT程序转换为参数化缓存对象,通过重用小模型进行语义变量提取和推测性起草,减少目标大语言模型调用,实验证明其能提升推理性能,平衡延迟、缓存重用和准确性。

Comments Accepted by EMNLP 2026, codes via this https URL (https://github.com/chenjqQAQ/CacheSpec)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17904 2026-08-25 cs.AI 版本更新

DiagFlowBench: Evaluating How Language Models Handle Off-Procedure Inputs in Grounded Diagnostic Dialogue

DiagFlowBench:评估语言模型在基于规程的诊断对话中如何处理偏离规程输入

Guillermo Gil de Avalle, Laura Maruster, Shaina Raza, Christos Emmanouilidis

机构 * University of Groningen(格罗宁根大学) Vector Institute for Artificial Intelligence(向量人工智能研究所)

AI总结 提出DiagFlowBench基准,包含50个工业诊断流程图转化的1676轮对话,评估10个模型在识别偏离规程输入时的表现,发现模型常选择真实但不恰当的步骤而非捏造事实。

Comments Accepted to the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026) Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16151 2026-08-25 cs.CL 版本更新

GRACE: Step-Level Benchmark for Faithful Reasoning over Context

GRACE:基于上下文忠实推理的步骤级基准

Hoang Pham, Dong Le, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) VinUniversity

AI总结 提出GRACE,首个带人工标注的步骤级忠实性基准,通过数据驱动错误分类法评估上下文推理中的链式思维步骤,并证明步骤级忠实信号可提升下游准确性和推理可靠性。

Comments Accepted at EMNLP Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14782 2026-08-25 cs.CV cs.CL 版本更新

Last But Not Least: Boundary Attention CalibratiON for Multimodal KV Cache Compression

最后但同样重要:用于多模态KV缓存压缩的边界注意力校准

Tianhao Chen, Yuheng Wu, Kelu Yao, Xiaogang Xu, Xiaobin Hu, Dongman Lee

机构 * KAIST(韩国科学技术院) Zhejiang Laboratory(之江实验室) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学)

AI总结 针对多模态大语言模型长视觉上下文中KV缓存压缩导致关键证据丢失的问题,提出BACON方法,通过校准观察窗口注意力与最后查询注意力,并利用层内一致性和层间持久性抑制噪声,在激进压缩下平均提升7.5%性能。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13610 2026-08-25 cs.CL cs.AI 版本更新

One Polluted Page Is Enough: Evaluating Web Content Pollution in LLM Recommenders

一个被污染的页面就够了:评估生成式推荐系统中的网页内容污染

Minghao Luo, Liang Chen

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 本研究提出FORGE基准,评估搜索增强LLM在检索结果被污染时推荐虚假产品的脆弱性,发现单个污染页面即可导致高达27%的推荐错误率,且推理能力无法缓解此问题。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11864 2026-08-25 cs.IR 版本更新

CORE-Bench: A Comprehensive Benchmark for Code Retrieval in the Era of Agentic Coding

CORE-Bench:智能体编程时代代码检索的综合基准

Fuwei Zhang, Yanzhao Zhang, Mingxin Li, Dingkun Long, Lexiang Hu, Pengjun Xie, Zhao Zhang, Fuzhen Zhuang

AI总结 针对智能体编程中需求驱动的仓库级代码检索问题,构建了包含18万查询和10.6万上下文相关性标签的三级基准CORE-Bench,实验表明现有嵌入模型性能显著下降,微调可提升效果。

Comments Accepted By EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11119 2026-08-25 cs.LG cs.AI cs.CL 版本更新

TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning

TRACE:一种用于高效智能体强化学习的统一展开预算分配框架

Heming Zou, Qi Wang, Yun Qu, Yuhang Jiang, Lizhou Cai, Yixiu Mao, Ru Peng, Xin Xu, Weijie Liu, Kai Yang, Saiyong Yang, Xiangyang Ji

机构 * Tsinghua University(清华大学) Tencent(腾讯)

AI总结 针对多轮智能体强化学习中奖励对比度不足的问题,提出TRACE框架,通过将每个ReAct式思考-行动-观察步骤建模为语义节点,在固定采样预算内将预算分配到提示根和中间前缀,增强奖励对比,提升策略更新信号。

Comments Accepted by EMNLP 2026 Main Conference, 32 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00726 2026-08-25 cs.AI 版本更新

Latent Reward Steering: An Adaptive Inference-Time Framework that Implicitly Promotes Cognitive Behaviors in Reasoning LLMs

潜在奖励引导:一种自适应推理时框架,隐式促进推理大语言模型中的认知行为

Jiakang Li, Guanyu Zhu, Can Jin, Chenxi Huang, Dexu Yu, Ronghao Chen, Yang Zhou, Hongwu Peng, Xuanqi Lan, Dimitris N. Metaxas, Youhua Li

机构 * Rutgers University(罗格斯大学) South China Agricultural University(华南农业大学) Columbia University(哥伦比亚大学) Fenz.AI QuantaAlpha Adobe Santa Clara University(圣克拉拉大学) City University of Hong Kong(香港城市大学)

AI总结 提出潜在奖励引导(LRS)框架,通过优化稀疏自编码器潜在状态隐式促进认知行为,利用最终答案正确性训练潜在奖励模型估计中间状态质量,并在推理时提供状态特定的修正方向,实验表明该方法能提升推理性能并修复原始推理错误。

Comments Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00566 2026-08-25 cs.LG cs.CL cs.CR 版本更新

Same Payload, Different Channel: Measuring Trust Asymmetry in Tool-Using Language Models

相同载荷,不同通道:测量使用工具的語言模型中的信任不对称性

Mohammed Sameer Syed, Rozhin Yasaei (University of Arizona)

机构 * University of Arizona(亚利桑那大学)

AI总结 本研究提出安全不对称分数(SAS),通过匹配恶意载荷仅改变传递上下文,系统测量了语言模型在不同通道(用户消息、工具元数据、工具输出)中对对抗性内容的脆弱性差异,发现代理原生模型在工具描述通道更脆弱,而通用模型相反,且机制研究表明安全相关表示在深层网络非线性编码。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25002 2026-08-25 cs.CR 版本更新

MemMark: State-Evolution Attribution Watermarking for Agent Long-Term Memory Systems

MemMark: 面向智能体长期记忆系统的状态演化归属水印

Haobo Zhang, Xutao Mao, Guangyuan Dong, Ziwei Li, Xuanbo Su, Kaijie Chen, Jing Yang, Zheng Lin

AI总结 提出MemMark水印方法,通过嵌入所有者控制的信号到潜在记忆写入决策中,实现无需日志、可见输出或可信元数据的快照归属,并在多个基准上保持记忆效用。

Comments Accepted to findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29708 2026-08-25 cs.CL 版本更新

RASET: Router-Agnostic Safety-Critical Expert Tuning Exposes Localized Safety Enforcement Failures in Mixture-of-Experts LLMs

理解混合专家大语言模型中的安全敏感专家行为

Zhibo Zhang, Yuxi Li, Zhen Ouyang, Ling Shi, Kailong Wang

机构 * Huazhong University of Science and Technology, Wuhan, China(华中科技大学,武汉,中国) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

AI总结 通过提出RASET框架,研究混合专家大语言模型中安全对齐与路由专家专业化之间的关系,发现路由模式主要由主题驱动,而安全行为可通过调整少数专家改变而不影响路由路径。

Comments 20 pages, 4 figures. Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25098 2026-08-25 cs.AI cs.CL cs.LG 版本更新

Revisiting the Effectiveness of LLM Pruning for Test-Time Scaling

重新审视LLM剪枝对测试时缩放的有效性

Ocean Monjur, Shahriar Kabir Nahin, Anshuman Chhabra

机构 * Bellini College of AI, Cybersecurity, and Computing(人工智能、网络安全与计算学院)

AI总结 本文研究非结构化剪枝对推理型大语言模型测试时缩放性能的影响,发现其优于结构化剪枝甚至有时超过未剪枝模型,并探讨了层间稀疏分配策略的作用。

Comments Accepted to EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20443 2026-08-25 cs.CL cs.AI cs.LG 版本更新

DialToM: A Theory of Mind Benchmark for Forecasting State-Driven Dialogue Trajectories

DialToM:用于预测状态驱动对话轨迹的心智理论基准

Neemesh Yadav, Palakorn Achananuparp, Jing Jiang, Ee-Peng Lim

机构 * Singapore Management University(新加坡管理大学) Australian National University(澳大利亚国立大学)

AI总结 提出DialToM基准,通过多选评估框架从自然对话中构建,揭示LLMs在推断心理状态(字面ToM)与利用其进行社会预测(功能ToM)之间的系统性推理不对称性,并证明领域专家与AI之间存在显著能力差距。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01017 2026-08-25 cs.CL 版本更新

Psychologically Potent, Computationally Invisible: LLMs Generate Social-Comparison-Eliciting Posts They Fail to Detect

心理上有效,计算上不可见:LLM 生成引发社会比较的帖子但无法检测

Hua Zhao, Jiapei Gu, Michelle Mingyue Gu

机构 * Department of English Language Education(英语语言教育系) Analytics/Assessment Research Centre(分析/评估研究中心)

AI总结 本研究通过构建小红书社会比较读者诱发基准(XHS-SCoRE),发现 LLM 在生成引发社会比较的帖子时存在生成-检测不匹配,即该信号在领域内可学习但无法通过提示分类稳健访问。

Comments Accepted at the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026). 20 pages, including references and appendices; 1 figure and 6 tables. Project repository: this https URL (https://github.com/zhao4hua4/XHS-SCoRE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03460 2026-08-25 cs.AI cs.LG 版本更新

FinSTaR: Towards Financial Reasoning with Time Series Reasoning Models

FinSTaR:面向时间序列推理模型的金融推理

Seunghan Lee, Jun Seo, Jaehoon Lee, Sungdong Yoo, Minjae Kim, Tae Yoon Lim, Dongwan Kang, Hwanil Choi, Soonyoung Lee, Wonbin Ahn

机构 * LG AI Research(LG人工智能研究)

AI总结 针对时间序列推理模型在金融领域的失效问题,提出基于2x2能力分类法的FinSTaR模型,通过Compute-in-CoT和Scenario-Aware CoT策略在FinTSR-Bench基准上达到78.9%平均准确率。

Comments EMNLP Industry track 2026, KDD Workshop on SciSoc Agents & LLMs 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10145 2026-08-25 cs.CR 版本更新

Mask-Free Privacy Extraction and Rewriting: A Domain-Aware Approach via Prototype Learning

无掩码隐私提取与重写:通过原型学习的领域感知方法

Xiaodong Li, Yuhua Wang, Qingchen Yu, Zixuan Qin, Yifan Sun, Qinnan Zhang, Hainan Zhang, Zhiming Zheng

AI总结 本文提出DAMPER方法,通过对比学习生成领域隐私原型,实现精确的跨度定位和领域合规的重写策略,提升隐私与效用的平衡。

Comments EMNLP 2026 camera-ready. First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05779 2026-08-25 cs.CL cs.AI 版本更新

What Models Know, How Well They Know It: Knowledge-Weighted Fine-Tuning for Learning When to Say "I Don't Know"

什么模型知道,它知道得有多好:基于知识加权的微调方法用于学习何时说“我不知道”

Joosung Lee, Hwiyeol Jo, Donghyeon Ko, Kyubyung Chae, Cheonbok Park, Jeonghoon Kim

机构 * NAVER CLOUD(NAVER云) Seoul National University(首尔国立大学) KAIST(韩国科学技术院)

AI总结 本文提出一种基于知识加权的微调方法,通过估计实例级知识评分来提升模型在知识不足时的不确定性表达能力,同时保持对已知问题的准确性。

Comments Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01993 2026-08-25 cs.CL cs.AI 版本更新

SAFE: An LLM-as-Verifier Framework for Evidence-Grounded Multi-Hop Reasoning

SAFE: 一种基于LLM作为验证器的证据驱动多跳推理框架

Daeyong Kwon, Soyoung Yoon, Seung-won Hwang

机构 * Seoul National University(首尔国立大学)

AI总结 提出SAFE框架,通过将推理分解为知识图谱三元组,在生成过程中逐步验证中间步骤,以解决多跳问答中模型通过无效推理得到正确答案的问题,平均准确率提升8.8个百分点。

Comments Accepted to EMNLP 2026 (Main Conference). Project Page: this https URL (https://github.com/DaeyongKwon98/SAFE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16459 2026-08-25 cs.CL 版本更新

DynHD: Hallucination Detection for Diffusion Large Language Models via Denoising Dynamics Deviation Learning

DynHD: 通过去噪动态偏差学习检测扩散大语言模型的幻觉

Yanyu Qian, Yue Tan, Yixin Liu, Wang Yu, Shirui Pan

机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) Griffith University, Australia(澳大利亚格里菲斯大学)

AI总结 本文提出DynHD,通过空间和时间视角解决扩散大语言模型幻觉检测中的信息密度不均和去噪动态建模问题,采用语义感知证据构造模块和偏差检测器提升检测性能。

Comments Accepted by EMNLP 2026 Findings. 16 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16469 2026-08-25 cs.CL 版本更新

Dialects of Translationese Shape Language Model Learning

在翻译语中训练模型显示了词汇多样性与源-目标句法相似性如何塑造学习

Jenny Kunz

机构 * Department of Computer and Information Science(计算机与信息科学系) Linköping University(林雪平大学)

AI总结 本文研究了在不同源语言翻译的机器翻译数据上训练模型,探讨词汇多样性和源-目标句法相似性如何影响模型学习与语言建模。

Comments To appear at the Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16890 2026-08-25 cs.CL cs.AI cs.LG 版本更新

LLM-Based Adversarial Persuasion Attacks on Fact-Checking Systems

基于大语言模型的对抗说服攻击对事实核查系统的攻击

João A. Leite, Olesya Razuvayevskaya, Kalina Bontcheva, Carolina Scarton

机构 * Department of Computer Science, University of Sheffield, UK(计算机科学系,谢菲尔德大学)

AI总结 本文提出基于大语言模型的说服对抗攻击方法,通过重述声明影响事实核查系统的验证和证据检索效果。

Comments Accepted to EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05882 2026-08-25 cs.CL cs.AI cs.LG 版本更新

An Empirical Study on Preference Tuning Generalization and Diversity Under Domain Shift

关于领域转移下偏好微调泛化性和多样性的实证研究

Constantinos Karouzos, Xingwei Tan, Nikolaos Aletras

机构 * School of Computer Science University of Sheffield, UK(计算机科学学院 谢菲尔德大学)

AI总结 本研究通过比较不同对齐目标和适应策略,探讨领域转移下偏好微调的泛化性和多样性,发现伪标签法能有效缓解领域转移带来的性能下降。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18484 2026-08-25 cs.CV cs.CL 版本更新

Benchmarking and Boosting Multilingual Capabilities of LVLMs via OCR-Centric Reinforcement Learning

PM4Bench: 通过平行多语言多模态多任务语料库对大型视觉-语言模型进行基准测试

Junyuan Gao, Jiahe Song, Jiang Wu, Runchuan Zhu, Guanlin Shen, Shasha Wang, Xingjian Wei, Haote Yang, Weijia Li, Bin Wang, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Sun Yat-Sen University(中山大学) Chinese University of Hong Kong(香港中文大学)

AI总结 PM4Bench通过平行多语言多模态多任务语料库评估大型视觉-语言模型,揭示跨语言性能差异与OCR能力的关系。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00391 2026-08-25 cs.CV 版本更新

VinciCoder: Unifying Multimodal Code Generation via Coarse-to-fine Visual Reinforcement Learning

VinciCoder:通过粗到细的视觉强化学习统一多模态代码生成

Xuanle Zhao, Deyang Jiang, Zhixiong Zeng, Lei Chen, Haoyue Yang, Haibo Qiu, Jing Huang, Yufeng Zhong, Liming Zheng, Yilin Cao, Lin Ma

机构 * Meituan(美团)

AI总结 VinciCoder通过粗到细的视觉强化学习框架,统一多模态代码生成,实现最先进的性能,超越现有开源模型。

Comments Accepted by EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏