arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

2026-08-28 至 2026-08-28 共收录 44
2608.25677 2026-08-28 cs.CL cs.AI cs.LG 版本更新

Learning New Facts with QLoRA: An Acquisition-Retention Frontier

用QLoRA学习新事实:获取-保留前沿

Estelle Zheng, Sébastien Warichet, Emmanuel Helbert, Christophe Cerisara

机构 * LORIA, CNRS(洛林信息学与应用实验室,法国国家科学研究中心) Alcatel-Lucent Enterprise(阿尔卡特朗讯企业通信)

AI总结 该研究以Qwen3-4B为对象,对比FFT与不同秩的QLoRA,发现秩会形成事实获取与保留的前沿,该效应在需安装新事实关联时更显著。

Comments accepted EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25061 2026-08-28 cs.CL cs.AI cs.DB cs.LG cs.PL 版本更新

DataKernelBench: Can LLMs Optimize Database Queries on GPUs?

DataKernelBench:大语言模型能否在GPU上优化数据库查询?

Gokul Karthik Kumar, Yotam Perlitz, Corey Lammie, Andrea Giovannini, Katja Hose

机构 * IBM Research(IBM研究院) TU Wien(维也纳技术大学)

AI总结 本文提出DataKernelBench基准,评估LLM在GPU上优化数据库查询内核的能力,实验显示最强模型配置在TPC-H数据集上实现2.11倍加速,工作负载上下文对性能影响大于硬件上下文。

Comments Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24982 2026-08-28 cs.CL cs.AI cs.CV cs.LG cs.MM 版本更新

Unsupervised Post-Training of Foundation Models: A Survey

基础模型的无监督后训练:一项综述

Yijie Xu, Qianyi Cai, Huizai Yao, Yili Wang, Tianfu Wang, Cehao Yang, Xingbo Yao, Zhiyu Guo, Aiwei Liu, Xuming Hu, Weiyu Guo, Hui Xiong

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Xiaohongshu Inc.(小红书公司) WeChat, Tencent(腾讯微信) CUHK(香港中文大学) AI Robotics(人工智能机器人)

AI总结 该综述梳理80种无监督后训练(UPT)方法,按更新信号来源分类,揭示内部信号与任务结构对UPT效果的影响,构建统一框架用于UPT的选择与评估。

Comments Accepted to Findings of EMNLP 2026. 20 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24977 2026-08-28 cs.CR cs.CL cs.LG 版本更新

Retrieved But Not Reliable: A Survey on Attacks, and Defenses in Retrieval-Augmented Generation

可检索但不可靠:检索增强生成中的攻击与防御研究综述

Minh Tran, Cuong Dang, Tuc Nguyen, Khanh-Tung Tran, Minh Huynh Nguyen, Trinh Chau, Kien Le, Do Xuan Long, Jiahao Zhang, Fali Wang, Hoang D. Nguyen, Thanh Le, Suhang Wang

AI总结 本综述针对检索增强生成(RAG)的安全与鲁棒性问题,形式化其各阶段威胁模型,分类攻击目标并梳理各阶段防御及评估方法,为该领域提供统一研究框架。

Comments 24 pages, 6 figures. Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Peer-reviewed through ACL Rolling Review (ARR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24135 2026-08-28 cs.AI cs.SE 版本更新

Robust Code RL via Faulty-Code-Driven Test case Synthesis and Dense Reward Shaping

基于故障代码驱动的测试用例合成与密集奖励塑造的鲁棒代码强化学习

Yiwen Zhang, Xiaodong Yan, Zhenyu Huang, Deng Zhao, Liang Jiang, Qing Cui, Zujie Wen, Zhiqiang Zhang, Jun Zhou

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 该研究提出RobustTests框架,通过故障代码驱动的测试用例合成与密集奖励塑造,实现RL微调的Qwen3-32B在LiveCodeBench上较基线方法获绝对3%性能提升,增强了LLM代码生成能力。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23149 2026-08-28 cs.CL cs.AI 版本更新

Language Chain in Alignment: Cross-lingual Ranking Preference Optimization

对齐中的语言链:跨语言排序偏好优化

Seungyoon Lee, Minhyuk Kim, Jungseob Lee, Heuiseok Lim

机构 * Korea University(高丽大学)

AI总结 针对大语言模型对齐依赖英语偏好数据导致其他语言性能欠佳的问题,提出CRPO框架,通过层级结构联合优化语言内与跨语言偏好,在多语言实验中性能优于标准方法。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23098 2026-08-28 cs.AI 版本更新

Jiuge-Tuiqiao: An Interpretable Human-AI System for Classical Chinese Poetry Refinement

九歌-推敲:一款面向古典诗词润色的可解释人机协作系统

Yufeng Han, Lifan Deng, Cunliang Kong, Wenhao Li, Xin Cong, Yuzhuo Bai, Kangyang Luo, Maosong Sun

机构 * Tsinghua University(清华大学) Beijing National Research Center For Information Science And Technology(北京信息科学与技术国家研究中心) Institute for Artificial Intelligence, Tsinghua University(清华大学人工智能国际研究院) Rixin College, Tsinghua University(清华大学日新书院) Department of Statistics and Data Science, Tsinghua University(清华大学统计与数据科学系) Jiangsu Normal University(江苏师范大学)

AI总结 针对现有AI诗词系统削弱用户创作能动性的问题,提出人机协作系统Jiuge-Tuiqiao,通过三元模型实现可控可解释的诗词润色,提升了创作相关性能。

Comments Accepted to the System Demonstrations Program at EMNLP 2026. Code and demo: this https URL (https://github.com/jiangli-va/Jiuge-Tuiqiao)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23045 2026-08-28 cs.AI 版本更新

From Inertia to Objectivity: Improving Deep Research Agents with Noise Isolation

从惯性到客观性:通过噪声隔离改进深度研究智能体

Xiangxin Zhang, Zhanwei Zhang, Zhihang Fu, Binbin Lin, Wenxiao Wang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 针对深度研究智能体存在的惯性偏差问题,提出NIS-Agent方法,在网页分类和最终答案验证环节应用上下文隔离,降低33%的token成本,训练的8B模型性能可与GPT-4o相当。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22863 2026-08-28 cs.MM 版本更新

Adaptive Hierarchical Representation Alliance for Multimodal Learning

面向多模态学习的自适应层级表示联盟

Chunlei Meng, Pengbin Feng, Jacqueline J. Pang, Chih-Ting Liao, Rong Fu, Zhaolu Kang, Zhongxue Gan, Chun Ouyang

AI总结 该研究针对多模态模型的语义粒度不匹配问题,提出自适应层级表示联盟框架,经六个基准实验验证,其性能优于强基线且在噪声、缺失模态场景下更鲁棒。

Comments This study has been accepted by EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22559 2026-08-28 cs.AI cs.CL cs.IR 版本更新

ExecRubrics: Executable Tool-Augmented Rubrics for Verifiable and Efficient Long-Form Evaluation

ExecRubrics:用于可验证且高效的长文本评估的可执行工具增强型评分标准

Kaustubh D. Dhole, Charles L. A. Clarke, Eugene Y. Agichtein

机构 * Emory University(埃默里大学) University of Waterloo(滑铁卢大学)

AI总结 ExecRubrics是将评分标准转化为可执行Python程序的框架,可替代黑盒LLM评判者,在三个长文本基准上实现与自然语言评分标准相当或更优的偏好准确率,且评估延迟降低最多320倍,提升了评估的可解释性与效率。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22018 2026-08-28 cs.AI 版本更新

SPAR-Hate: Auditor-Guided Multi-Perspective Role Reasoning for Bilingual Hate Speech Parsing

SPAR-Hate:一种由审核员引导的用于双语仇恨言论解析的多智能体框架

Yifan Lyu, Dianqing Lin, Xinran Li, Jiaqi Qiao, Xiujuan Xu

机构 * Dalian University of Technology(大连理工大学) Inner Mongolia University(内蒙古大学)

AI总结 针对结构化仇恨言论解析的文化等挑战,提出SPAR-Hate多智能体框架,分解文档为决策单元后从三视角生成判断并仲裁,在基准上实现双语仇恨解析最优结果。

Comments 16 pages, 2 figures. Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21883 2026-08-28 cs.CV 版本更新

VIG: Visual Information Gain as a Reward Signal for Multimodal Chain-of-Thought Compression

VIG:作为多模态思维链压缩奖励信号的视觉信息增益

Wen Luo, Xiaohan Yi, Xiaotao Huang, Liqun Huang

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Tsinghua University(清华大学)

AI总结 该研究提出VIG奖励机制,通过提升视觉信息密度优化多模态CoT的准确率与效率权衡,无需额外资源,在多类基准及不同规模模型上均有效。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21832 2026-08-28 cs.CL 版本更新

GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding

GUI-Primitives:诊断视觉-语言GUI定位中的空间推理失败

Md Abrar Jahin, Md Rizwan Parvez

机构 * University of Southern California(南加州大学) USC Information Sciences Institute(南加州大学信息科学研究所) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)

AI总结 本文提出GUI-Primitives基准,通过994个含7种空间关系的对比指令对,发现多数视觉-语言GUI定位模型的失败源于候选定位而非关系理解,且标记候选可提升准确率。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20768 2026-08-28 cs.AI 版本更新

Beyond Endpoint Gains: A Weight-Delta Audit of Medical Specialization

超越端点增益:医学专业化的权重增量审计

Praphul Singh, Shanu Kumar, Akshat Agarwal

机构 * IIT Kanpur(印度理工学院坎普尔分校) Oracle Health AI(甲骨文健康人工智能公司) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

AI总结 本研究提出配对权重增量路径审计方法,应用于两组通用模型到医学专业模型的检查点对,发现解码器更新与医学基准变动相关,但组件定位不清晰,明确审计仅针对纯文本多项选择题基准变动。

Comments Preprint: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07261 2026-08-28 cs.CL 版本更新

Why Knowing Both Hops Is Not Enough: Understanding Two-Hop Generalization in Language Models

仅知道两跳信息是不够:理解语言模型中的两跳泛化

Zili Zhang, Yilin Wang, Heng Wang, Herun Wan, Minnan Luo

机构 * Xi’an Jiaotong University(西安交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本研究针对语言模型两跳查询失败问题,在受控环境训练Transformer,揭示其泛化规律与跨层不匹配机制,提出循环式训练策略以提升分布外两跳泛化能力。

Comments EMNLP 2026, findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01942 2026-08-28 cs.CV cs.CL cs.MM 版本更新

CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation

CultureVidBench:文本到视频生成中的文化理解基准测试

Xianjing Han, Yuhan Su, Yang Deng, Dong Ma, Wee Peng Tay, Bin Zhu

机构 * Nanyang Technological University(南洋理工大学) Centrale Supélec(中央高等电力学院) Singapore Management University(新加坡管理大学) University of Cambridge(剑桥大学)

AI总结 本研究推出CultureVidBench基准,评估7款T2V模型的文化理解能力,发现现有模型难捕捉细粒度文化细节,尤其针对代表性不足的文化区域与线索。

Comments EMNLP 2026 Main Conference, Project page: this https URL (https://hanxjing.github.io/CultureVidBench/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19326 2026-08-28 cs.CL 版本更新

Selective State-Space Adaptation and Retrieval for Language Model Reasoning

用于语言模型推理的选择性状态空间适应与检索

Atahan Dokme, Larry Heck

机构 * AI Virtual Assistant (AVA) Lab(人工智能虚拟助手(AVA)实验室) Georgia Institute of Technology(佐治亚理工学院)

AI总结 研究针对语言模型推理,提出一类含MaLoRA和MaRA的适配器,通过在令牌和上下文级别引入选择性状态空间递归实现适应,在多个冻结主干和推理基准上提升了推理准确性。

Comments Accepted to EMNLP 2026 (Main Conference). 22 pages, 5 figures, 20 tables. Code: this https URL (https://github.com/atahandokme/malora-mara)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02897 2026-08-28 cs.CR cs.AI cs.CV 版本更新

PPE-Bench: A Benchmark for Evaluating MLLM Unlearning under Private-Public Entanglement

PPE-Bench:用于评估公私纠缠下MLLM遗忘能力的基准测试

Xianren Zhang, Delvin Ce Zhang, Dongwon Lee, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Sheffield(谢菲尔德大学)

AI总结 研究针对现有MLLM遗忘基准测试的局限性,提出PPE-Bench基准测试,包含公私纠缠图像,引入两种方法在遗忘中保护公共信息,实验发现现有方法能减少隐私泄露,但常损害相邻公共信息。

Comments to appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18801 2026-08-28 cs.IR cs.AI 版本更新

SHIFT: Semantic Harmonization via Index-side Feature Transformation for Multilingual Information Retrieval

SHIFT: 通过索引侧特征变换实现多语言信息检索的语义对齐

Youngjoon Jang, Seongtae Hong, Hyeonseok Moon, Heuiseok Lim

机构 * Department of Computer Science and Engineering, Korea University(韩国大学计算机科学与工程系)

AI总结 提出SHIFT方法,在索引阶段通过平行翻译对估计相对语言向量并修正文档嵌入,以缓解多语言密集检索中的语言偏差,无需训练即可提升检索性能。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08577 2026-08-28 cs.IR 版本更新

When Should Queries Be Decomposed? A Stage-Aware Study of Query Decomposition for Multi-Condition Retrieval

何时应分解查询?面向多条件检索的查询分解的阶段感知研究

Bochao Yin, Xuan Lu, Zhengyu Qi, Xiaoyu Shen

AI总结 本文通过阶段感知实验发现,查询分解在初始检索阶段因语义稀释损害性能,但在重排序阶段通过细粒度约束验证显著提升效果,据此提出阶段感知分解框架,在初始检索保留整体查询,仅在重排序使用子查询,在MultiConIR和SSRB基准上一致提升组合查询的排序性能。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08000 2026-08-28 cs.CL cs.AI 版本更新

Summarization is Not Dead Yet

摘要生成尚未消亡

Dongqi Liu, Chenxi Whitehouse, Zheng Zhao, Zhuchen Cao, Jian Li, Yabiao Wang

机构 * Saarland University(萨尔大学) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) University of Cambridge(剑桥大学) University of Edinburgh(爱丁堡大学) Zhejiang University(浙江大学) Tencent YouTu Lab(腾讯优图实验室)

AI总结 通过多维度评估,发现人类参考摘要在信息量和忠实度上仍优于大语言模型,后者仅在表面连贯性和流畅性上占优,表明摘要生成研究仍有挑战。

Comments EMNLP 2026 Main & Long Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02502 2026-08-28 cs.CL 版本更新

CRAM: Centroid-Routing and Adaptive MoE for Multimodal Continual Instruction Tuning

CRAM:面向多模态持续指令调优的质心路由与自适应MoE

Jun-Tao Tang, Zhen-Hao Xie, Yu-Cheng Shi, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)

AI总结 提出CRAM方法,通过将任务特定模式隔离到独立模块、自适应秩实例化动态分配参数、质心路由激活现有专家以及正交惩罚约束更新方向,解决了多模态持续指令调优中任务竞争导致遗忘和参数效率低下的问题。

Comments Accepted to EMNLP 2026 (Main Conference). Code is available at [this URL]( this https URL (https://github.com/LAMDA-CL/EMNLP2026-CRAM) )

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31171 2026-08-28 cs.IR cs.AI 版本更新

MIMO: Multilingual Information Retrieval via Monolingual Objectives

MIMO: 通过单语目标实现多语言信息检索

Youngjoon Jang, Seongtae Hong, Heuiseok Lim

机构 * Department of Computer Science and Engineering, Korea University(韩国大学计算机科学与工程系)

AI总结 提出MIMO两阶段框架,利用教师模型的稳定英语语义空间,通过知识蒸馏和跨语言对比学习联合优化,解决多语言信息检索中语言聚类和嵌入对齐-均匀性权衡问题。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30931 2026-08-28 cs.CL 版本更新

MineExplorer: Evaluating Open-World Exploration of MLLM Agents in Minecraft

MineExplorer: 评估MLLM智能体在Minecraft中的开放世界探索能力

Tianjie Ju, Yueqing Sun, Zheng Wu, Wei Zhang, Yaqi Huo, Xi Su, Qi Gu, Xunliang Cai, Gongshen Liu, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Meituan(美团)

AI总结 提出MineExplorer基准,通过多智能体合成工作流构建隐式多跳任务,评估多模态大语言模型在Minecraft中的开放世界探索能力,发现长轨迹协调仍是挑战。

Comments Accepted at EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28214 2026-08-28 cs.CR cs.LG cs.MA 版本更新

Out of Sight, Not Out of Mind: Unveiling Latent Attack in Latent-based Multi-Agent Systems

眼不见,心不烦:揭示基于潜在的多智能体系统中的潜在攻击

Chenxi Wang, Ruiyang Huang, Jiayan Sun, Lei Wei, Yifan Wu

机构 * Southeast University(东南大学) Peking University(北京大学)

AI总结 研究潜在表示能否携带攻击信息,提出通过潜在干预激活攻击效果的框架,实验表明潜在攻击在清洁执行中显著降低任务性能,尤其影响智能体间KV缓存传递。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26678 2026-08-28 cs.CL 版本更新

NestedKV: Nested Memory Routing for Long-Context KV Cache Compression

NestedKV: 用于长上下文KV缓存压缩的嵌套内存路由

Hong Chen, Xiang Liu, Yubo Gao, Yuxuan Fan, Bo Wang, Yuanlin Chu, Yuanguo Lin, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Jimei University(集美大学)

AI总结 提出NestedKV方法,通过多时间尺度余弦异常评分和头自适应混合的免训练键缓存压缩,在长上下文任务中优于现有方法。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16105 2026-08-28 cs.CL cs.AI 版本更新

Frequency Matters: Fast Model-Agnostic Data Curation for Pruning and Quantization

频率至关重要:用于剪枝和量化的快速模型无关数据筛选

Francesco Pio Monaco, Elia Cunegatti, Flavio Vella, Giovanni Iacca

机构 * University of Trento(特伦托大学)

AI总结 提出一种基于Zipf幂律的模型无关数据筛选策略ZipCal,通过最大化词汇多样性来选择校准数据,在剪枝和量化中实现与依赖模型困惑度的最先进方法相当的性能,且速度快约240倍。

Comments Accepted as a Main Conference Paper at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17873 2026-08-28 cs.LG cs.AI cs.CL 版本更新

HINT-SD: Targeted Hindsight Self-Distillation for Long-Horizon Agents

HINT-SD:针对长 Horizon 智能体的定向 hindsight 自监督学习

Woongyeong Yeo, Yumin Choi, Taekyung Ki, Sung Ju Hwang

AI总结 本文提出 HINT-SD,一种针对长 Horizon 智能体的定向 hindsight 自监督学习框架,通过全轨迹 hindsight 选择失败相关的动作,并仅在目标动作跨度上应用反馈条件自监督学习,实验表明该方法在 BFCL v3 和 AppWorld 上比密集的每回合反馈基线提高了 18.80 个百分点,同时训练时间降低 2.26 倍。

Comments EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09316 2026-08-28 cs.LG cs.CL 版本更新

A Survey of LLM Prompt Datasets: Taxonomy, Linguistic Patterns, and Practical Uses

大语言模型提示数据集:深入分析与洞察

Yuanming Zhang, Yan Lin, Arijit Khan, Huaiyu Wan

机构 * School of Computer Science and Technology(计算机科学与技术学院) Beijing Jiaotong University(北京交通大学) Department of Computer Science(计算机科学系) Aalborg University(奥尔堡大学)

AI总结 本文深入分析了129个异构LLM提示数据集,通过多层级语言分析揭示提示与一般文本的区别模式,并通过三个下游实验验证了提示过滤、领域分类和提示质量预测的实用性。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05876 2026-08-28 cs.CL 版本更新

Addressing the Reasoning Gap: Mechanistic Circuit-Based Knowledge Editing in Large Language Models

基于机制电路的知识编辑在大语言模型中

Tianyi Zhao, Yinhan He, Wendy Zheng, Chen Chen

机构 * University of Virginia(弗吉尼亚大学)

AI总结 本文提出MCircKE框架,通过识别因果电路实现精准的知识编辑,解决大语言模型在动态环境中更新知识时的推理缺口问题,提升多跳推理能力。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏