arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

2026-08-28 至 2026-08-28 共收录 77
2605.17873 2026-08-28 cs.LG cs.AI cs.CL 版本更新

HINT-SD: Targeted Hindsight Self-Distillation for Long-Horizon Agents

HINT-SD:针对长 Horizon 智能体的定向 hindsight 自监督学习

Woongyeong Yeo, Yumin Choi, Taekyung Ki, Sung Ju Hwang

AI总结 本文提出 HINT-SD,一种针对长 Horizon 智能体的定向 hindsight 自监督学习框架,通过全轨迹 hindsight 选择失败相关的动作,并仅在目标动作跨度上应用反馈条件自监督学习,实验表明该方法在 BFCL v3 和 AppWorld 上比密集的每回合反馈基线提高了 18.80 个百分点,同时训练时间降低 2.26 倍。

Comments EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09316 2026-08-28 cs.LG cs.CL 版本更新

A Survey of LLM Prompt Datasets: Taxonomy, Linguistic Patterns, and Practical Uses

大语言模型提示数据集:深入分析与洞察

Yuanming Zhang, Yan Lin, Arijit Khan, Huaiyu Wan

机构 * School of Computer Science and Technology(计算机科学与技术学院) Beijing Jiaotong University(北京交通大学) Department of Computer Science(计算机科学系) Aalborg University(奥尔堡大学)

AI总结 本文深入分析了129个异构LLM提示数据集,通过多层级语言分析揭示提示与一般文本的区别模式,并通过三个下游实验验证了提示过滤、领域分类和提示质量预测的实用性。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05876 2026-08-28 cs.CL 版本更新

Addressing the Reasoning Gap: Mechanistic Circuit-Based Knowledge Editing in Large Language Models

基于机制电路的知识编辑在大语言模型中

Tianyi Zhao, Yinhan He, Wendy Zheng, Chen Chen

机构 * University of Virginia(弗吉尼亚大学)

AI总结 本文提出MCircKE框架,通过识别因果电路实现精准的知识编辑,解决大语言模型在动态环境中更新知识时的推理缺口问题,提升多跳推理能力。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25489 2026-08-28 cs.CL 版本更新

Translation Asymmetry in LLMs as a Data Augmentation Factor: A Case Study for 6 Romansh Language Varieties

LLMs中的翻译不对称性作为数据增强因素:6种罗曼什语言变体的案例研究

Jannis Vamvas, Ignacio Pérez Prat, Angela Heldstab, Dominic P. Fischer, Sina Ahmadi, Rico Sennrich

机构 * University of Zurich(苏黎世大学) Lia Rumantscha(利亚·罗曼什语协会)

AI总结 本研究发现,LLMs在生成罗曼什语言变体合成数据时存在不对称性,通过调整数据增强方向以匹配语言资源梯度,提升了罗曼什最低资源变体的翻译质量,BLEU得分提高23分。

Comments Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03345 2026-08-28 cs.AI cs.CL 版本更新

Do Language Models Follow Occam's Razor? An Evaluation of Parsimony in Inductive and Abductive Reasoning

语言模型遵循奥卡姆剃刀吗?对归纳和反向推理中简约性的评估

Yunxin Sun, Abulhair Saparov

机构 * Purdue University(普渡大学)

AI总结 本文评估大型语言模型在归纳和反向推理中是否遵循奥卡姆剃刀原则,通过生成综合推理问题测试其在简单和复杂场景中的表现,发现模型在复杂世界模型中难以生成高质量假设。

Comments Accepted at EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21165 2026-08-28 cs.CL cs.CV 版本更新

Many Dialects, Many Languages, One Cultural Lens: Evaluating Multilingual VLMs for Bengali Culture Understanding Across Historically Linked Languages and Regional Dialects

多种方言,多种语言,一种文化视角:评估多语言视觉语言模型对孟加拉文化的理解,涵盖历史关联语言和地区方言

Nurul Labib Sayeedi, Md. Faiyaz Abdullah Sayeedi, Shubhashis Roy Dipta, Mahbub E Sobhani, Rubaya Tabassum, Ariful Ekraj Hridoy, Mehraj Mahmood, Md. Tarek Hasan, Swakkhar Shatabda

机构 * United International University(国际联合大学) BRAC University(布拉塔克大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

AI总结 提出 BanglaVerse 基准,通过手工标注图像和扩展至多种语言及方言,评估多语言视觉语言模型在孟加拉文化理解中的表现,发现标准孟加拉语评估高估模型能力,方言变化导致性能下降,文化知识缺失是主要瓶颈。

Comments Accepted at EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05189 2026-08-28 cs.CY 版本更新

Small Changes, Big Impact: Demographic Bias in LLM-Based Hiring Through Subtle Sociocultural Markers in Anonymised Resumes

微小变化,巨大影响:通过匿名简历中的微妙社会文化标记探讨基于LLM的招聘中的人口统计偏差

Bryan Chen Zhengyu Tan, Shaun Khoo, Bich Ngoc Doan, Zhengyuan Liu, Nancy F. Chen, Roy Ka-Wei Lee

AI总结 研究通过匿名简历中的社会文化标记揭示LLM在招聘中的人口统计偏差,发现模型能通过非显性特征推断种族和性别,且提示解释会加剧偏见。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08586 2026-08-28 cs.AI 版本更新

DIANOIA: Diagnostic Decomposition and Joint Optimization for Multi-Agent Reasoning

DIANOIA: 多智能体推理的诊断性分解与联合优化

Yiming Yang, Zhuoyuan Li, Fanxiang Zeng, Hao Fu, Yue Liu

机构 * Alibaba Group(阿里巴巴集团)

AI总结 提出DIANOIA框架,通过覆盖度、保真度和综合度三个可测量通道分解多智能体推理增益,并基于此设计诊断协议和对应系统,在多个基准上以更少token实现更优性能。

Comments DIANOIA has been accepted by EMNLP 2026 as a main conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04731 2026-08-28 cs.CL cs.LG 版本更新

Modular Expert Merging for Biomedical Retrieval

更少微调,更好检索:通过合成数据和模型合并重新思考LLM适应于生物医学检索器

Sameh Khattab, Jean-Philippe Corbeil, Osman Alperen Çinar-Koraş, Amin Dada, Julian Friedrich, Jiawei He, Douglas Teodoro, Jens Kleesiek

机构 * IKIM, University Hospital Essen(IKIM,埃森大学医院) Microsoft Healthcare & Life Sciences(微软医疗与生命科学)

AI总结 本文提出STM框架,通过合成数据和模型合并提升生物医学检索性能,实验显示在任务特定专家上提升23.5%并优于基线模型。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20650 2026-08-28 cs.CV 版本更新

OS-Marathon: Benchmarking Computer-Use Agents on Vast-Horizon, Repetitive Tasks

OS-Marathon: 在长周期重复任务上评估计算机使用代理的基准测试

Jing Wu, Wenjie Ai, Daphne Barretto, Yiye Chen, Qingyu Chen, Yuhang He, Pranit Chawla, Nicholas Gydé, Yanan Jian, Vibhav Vineet

机构 * University of Oxford(牛津大学) Microsoft(微软公司) Georgia Institute of Technology(佐治亚理工学院)

AI总结 OS-Marathon通过建立长周期重复任务的基准测试,评估计算机使用代理在处理复杂工作流中的性能和有效性。

Comments EMNLP 2026 Main Conference, Project Page: this https URL (https://os-marathon.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15236 2026-08-28 cs.CL 版本更新

MAPLE: Metadata Conditioned LLM Pretraining for Locale-Aware Question Answering

具有元数据条件的大型语言模型用于本地化

Anjishnu Mukherjee, Ziwei Zhu, Antonios Anastasopoulos

机构 * Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学)

AI总结 本文提出通过元数据条件来提升大型语言模型的本地化能力,通过预训练和实验验证了其在不同区域表现的提升效果和效率优势。

Comments Published as a conference paper at EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04778 2026-08-28 cs.CV cs.AI cs.CL cs.MM 版本更新

CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models

CounterVid: 通过生成反事实视频缓解视频-语言模型中动作和时间幻觉

Tobia Poppi, Burak Uzkent, Amanmeet Garg, Lucas Porto, Garin Kessler, Yezhou Yang, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara, Florian Schiffers

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(帕尔马大学) Amazon Prime Video(亚马逊Prime视频)

AI总结 CounterVid通过生成反事实视频缓解视频-语言模型中动作和时间幻觉问题,提出反事实视频生成框架和MixDPO方法,提升时间推理和动作识别性能。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03605 2026-08-28 cs.CL 版本更新

AEScorer: An Agentic Evidence-Grounded Framework for Graded Factuality Verification

DiVA: 基于代理-判别验证器的细粒度事实性验证

Hui Huang, Muyun Yang, Yuki Arase

机构 * Harbin Institute of Technology(哈尔滨工业大学) Institute of Science Tokyo(东京科学研究所)

AI总结 DiVA通过结合生成模型和判别模型的能力,提出了一种细粒度事实性验证方法,并构建了FGVeriBench基准,有效提升了事实性验证的精度和适用性。

Comments Accepted by Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03000 2026-08-28 cs.IR 版本更新

SustainableQA: A Comprehensive Question Answering Dataset for Corporate Sustainability and EU Taxonomy Reporting

SustainableQA:面向企业可持续发展与欧盟 taxonomy 报告的综合问答数据集

Mohammed Ali, Abdelrahman Abdallah, Adam Jatowt

AI总结 该研究推出SustainableQA数据集及配套流水线,生成超19.5万条问答对,经验证质量可靠,80亿参数模型微调后性能优于更大的现有模型,可用于开发评估处理可持续发展合规数据的知识助手。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22203 2026-08-28 cs.LG cs.AI cs.CL 版本更新

From Accuracy to Robustness: A Study of Rule- and Model-based Verifiers in Mathematical Reasoning

从准确率到鲁棒性:数学推理中基于规则与基于模型的验证器研究

Yuzhen Huang, Weihao Zeng, Xingshan Zeng, Qi Zhu, Junxian He

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

AI总结 本研究以数学推理为案例,分析了基于规则与基于模型的验证器在静态评估和RL训练中的表现,发现两类验证器分别存在误拒和奖励黑客问题,为开发更优RL奖励系统提供了参考。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25160 2026-08-28 cs.CV cs.AI cs.CL 版本更新

GSM8K-V: Can Vision Language Models Solve Grade School Math Word Problems in Visual Contexts

GSM8K-V:视觉语言模型能否在视觉语境下解决小学级数学应用题

Fan Yuan, Yuchen Yan, Yifan Jiang, Haoran Zhao, Tao Feng, Jinyan Chen, Yanwei Lou, Wenqi Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

AI总结 本研究构建了多图像视觉数学基准GSM8K-V,评估34个VLMs发现其存在显著模态差距,最优模型仅达59%准确率,瓶颈为隐式视觉推理错误,且视觉数学优化模型在此无提升。

Comments 59 pages, 7 figures, Project Page: this https URL (https://zju-real.github.io/GSM8K-V) Code: this https URL (https://github.com/ZJU-REAL/GSM8K-V) Datasets: this https URL (https://huggingface.co/datasets/ZJU-REAL/GSM8K-V) Accepted at EMNLP 2026 Main Conference. Updated to the camera-ready version with additional experiments, analyses, and revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15740 2026-08-28 cs.FL cs.AI cs.SE 版本更新

HybridProver: Augmenting Theorem Proving with LLM-Driven Proof Synthesis and Refinement

HybridProver:结合大语言模型驱动的证明合成与精化增强定理证明

Jilin Hu, Jianyu Zhang, Yongwang Zhao, Talia Ringer

机构 * College of Computer Science and Technology Zhejiang University(浙江大学计算机科学与技术学院) Siebel Center for Computer Science University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学中心)

AI总结 本研究提出HybridProver框架,以证明草图为中间表示集成两种定理证明范式,在miniF2F Isabelle基准上使7B模型成功率达73.8%,优于此前最优水平。

Comments Accepted to EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏