arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

2026-08-31 至 2026-08-31 共收录 88
2605.21919 2026-08-31 cs.CV cs.AI 版本更新

SDGBiasBench: Benchmarking and Mitigating Vision--Language Models' Biases in Sustainable Development Goals

SDGBiasBench: 评估和减轻可持续发展目标中视觉-语言模型的偏见

Zihang Lin, Huaiyuan Qin, Muli Yang, Hongyuan Zhu

机构 * Nanyang Technological University(南洋理工大学)

AI总结 本文提出SDGBiasBench,一个用于评估和减轻可持续发展目标中视觉-语言模型偏见的大型基准测试集,通过分析模型在决策和估计层面的偏见,提出CADE方法以减少偏见,提高模型的准确性和可靠性。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18414 2026-08-31 cs.CR cs.AI 版本更新

Prompts Don't Protect: Architectural Enforcement via MCP Proxy for LLM Tool Access Control

提示不保护:通过MCP代理实现的架构强制以实现LLM工具访问控制

Rohith Uppala

机构 * Independent Researcher(独立研究员)

AI总结 本文提出了一种受控的MCP代理,通过在工具发现和工具调用两个阶段实施基于属性的访问控制(ABAC),有效阻止了未经授权的工具调用,而提示基于的限制仅能减少11-18个百分点的未授权调用率,证明了架构强制在部署的智能体系统中实现可靠工具访问控制的必要性。

Comments 7 pages, 4 tables, 2 figures. Camera-ready version accepted to the EMNLP 2026 Industry Track; adds benign-utility and abstention evaluation, latency percentiles, and revised limitations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17727 2026-08-31 cs.CV 版本更新

GraSP-VL: Length as a Semantic Granularity Interface for Vision-Language Representations

GraSP-VL: 长度作为视觉-语言表示的语义粒度接口

Zesheng Li, Chengchang Pan, Honggang Qi

机构 * University of the Chinese Academy of Sciences(中国科学院大学)

AI总结 本文研究如何将嵌入长度转化为可控的语义访问接口,提出GraSP-VL方法,通过学习共享的近正交前缀变换,实现视觉-语言嵌入的语义层次递进接口,并在多个数据集上验证了其有效性。

Comments 17 pages (9 pages of main text, plus references and appendix), 7 figures, and 13 tables. Accepted to EMNLP 2026 Main Conference. Project page: this https URL (https://lizesheng13.github.io/Grasp-VL/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12015 2026-08-31 cs.CR cs.AI cs.CL cs.LG cs.MA 版本更新

SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces

SkillSafetyBench:在技能面攻击表面下评估智能体安全性

Chang Jin, An Wang, Zeming Wei, Kai Wang, Biaojie Zeng, Qiaosheng Zhang, Chao Yang, Jingjing Qu, Xia Hu, Xingcheng Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) East China Normal University(华东师范大学)

AI总结 提出SkillSafetyBench基准,通过155个对抗案例评估大语言模型智能体在技能、本地工件和执行环境文件等非用户攻击下的安全失败模式。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03779 2026-08-31 cs.CL 版本更新

Tracing the complexity profiles of different linguistic phenomena through the intrinsic dimension of LLM representations

通过LLM表示的内在维度追溯不同语言现象的复杂性特征

Marco Baroni, Emily Cheng, Iria de-Dios-Flores, Francesca Franzon

机构 * Universitat Pompeu Fabra (UPF)(巴塞罗那自治大学) ICREA(加泰罗尼亚凝聚态物理与应用研究中心)

AI总结 研究通过LLM表示的内在维度揭示语言复杂性对比,发现复杂现象在不同层间表现出更高的维度差异。

Comments Published as a conference paper at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26535 2026-08-31 cs.AI 版本更新

PAPO: Stabilizing Rubric Integration Training via Decoupled Advantage Normalization

PAPO:通过解耦优势归一化稳定规则整合训练

Zelin Tan, Zhouliang Yu, Bohan Lin, Zijie Geng, Hejia Geng, Yudong Zhang, Mulei Zhang, Yang Chen, Shuyue Hu, Zhenfei Yin, Chen Zhang, Lei Bai

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) University of Oxford(牛津大学) Wuhan University(武汉大学)

AI总结 PAPO通过解耦优势归一化整合过程级评估,解决现有奖励设计的两个局限:Outcome Reward Models(ORM)仅评估最终答案正确性,而Process Reward Models(PRM)虽监督更丰富但易导致奖励黑客。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00234 2026-08-31 cs.CL cs.AI 版本更新

OmniFusion: Simultaneous Multilingual Multimodal Translations via Modular Fusion

OmniFusion: 通过模块融合实现多语言多模态翻译

Sai Koneru, Matthias Huck, Jan Niehues

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) SAP SE(SAP公司)

AI总结 本文提出OmniFusion系统,通过融合预训练多模态基础模型与翻译LLM,实现语音、语音加图像及文本加图像的多语言多模态翻译,降低SimulST延迟并提升翻译质量。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28387 2026-08-31 cs.AI cs.LG 版本更新

Prompts Without Evidence: How Neuroimaging Mentions Shift Clinical Vision-Language Model Predictions

脚手架效应:提示框架如何驱动临床VLM评估中的表面多模态增益

Doan Nam Long Vu, Simone Balloccu

机构 * Technical University of Darmstadt(达姆施塔特技术大学)

AI总结 研究发现,在临床VLM评估中,提示中提及MRI可用性即可解释70-80%的性能提升,与图像数据是否存在无关,这种“脚手架效应”揭示了表面评估无法反映真实多模态推理能力。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17070 2026-08-31 cs.CL cs.AI 版本更新

Large Reasoning Models Struggle to Transfer Parametric Knowledge Across Scripts

大推理模型在不同脚本间转移参数知识时面临困难

Lucas Bandarkar, Alan Ansell, Trevor Cohn

机构 * Google Research(谷歌研究) University of California, Los Angeles(加州大学洛杉矶分校) University of Melbourne(墨尔本大学)

AI总结 研究发现,大模型在跨语言知识转移中主要受脚本差异影响,通过分析数据和实验表明,提升模型对转写歧义的推理能力可改善跨脚本知识转移。

Comments Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16574 2026-08-31 cs.CL 版本更新

Diverging Transformer Predictions for Human Sentence Processing: A Comprehensive Analysis of Agreement Attraction Effects

Transformer预测在人类句子处理中的分歧:对一致吸引效应的全面分析

Titus von der Malsburg, Sebastian Padó

机构 * University of Stuttgart(斯图加特大学)

AI总结 本文通过对比不同大小和架构的Transformer模型,评估其在英语一致吸引配置中的表现,发现模型在处理宾语提取相对从句时表现不佳,无法复制人类的不对称干扰模式。

Comments Paper accepted for EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24210 2026-08-31 cs.CL cs.AI 版本更新

From Leaky Thoughts to Private Reasoning: Controlling What LRMs Say to Themselves

从泄露思维到私有推理:控制LRM对自己说的话

Haritz Puerto, Haonan Li, Xudong Han, Timothy Baldwin, Iryna Gurevych

机构 * Mohamed bin Zayed University of Artificial Intelligence, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋)

AI总结 针对大型推理模型(LRM)推理过程中隐私泄露问题,提出通过指令跟随(IF)训练和分阶段解码策略(Staged Decoding)增强隐私保护,在IF和隐私基准上分别提升高达20.9和51.9个百分点。

Comments Accepted at EMNLP 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04690 2026-08-31 cs.IR 版本更新

Multi-Source Retrieval and Reasoning for Legal Sentencing Prediction

多源检索与推理用于法律判决预测

Junjie Chen, Haitao Li, Qilei Zhang, Zhenghua Li, Ya Zhang, Quan Zhou, Cheng Luo, Yiqun Liu, Min Zhang, Yueyue Wu, Dongsheng Guo, Qingyao Ai

AI总结 本文提出MSR²框架,通过多源检索与强化学习提升法律判决预测的准确性和可解释性。

Comments EMNLP 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19151 2026-08-31 cs.AI cs.MA 版本更新

Multimodal Collaborative Debate for Zero-Shot Time Series Reasoning

TS-Debate:多模态协作辩论用于零样本时间序列推理

Patara Trirat, Jin Myung Kwak, Jay Heo, Heejun Lee, Sung Ju Hwang

机构 * KAIST Seoul(韩国科学技术院)

AI总结 TS-Debate通过多模态协作辩论框架,在零样本时间序列推理中实现显著性能提升,通过专门代理和结构化协议提升模态保真度和数值精度。

Comments EMNLP 2026 (Main), Project Page: this https URL (https://deepauto-ai.github.io/ts-debate/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17658 2026-08-31 cs.CL 版本更新

Beyond the Rabbit Hole: Mapping the Relational Harms of QAnon Radicalization

超越兔子洞:映射QAnon激进化关系危害

Bich Ngoc Doan, Gianmarco De Francisci Morales, Giuseppe Russo

AI总结 本研究通过系统映射QAnon激进化轨迹,揭示了不同人设与情绪伤害的关联,为理解激进化作为关系现象提供了实证框架。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13247 2026-08-31 cs.CL cs.AI cs.CV cs.LG cs.MM 版本更新

Aligning Agentic World Models via Knowledgeable Experience Learning

通过知识性经验学习对齐代理世界模型

Baochang Ren, Yunzhi Yao, Rui Sun, Shuofei Qiao, Ningyu Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 WorldMind通过知识性经验学习对齐代理世界模型,解决物理模拟中的幻觉问题,实现跨环境的高效迁移。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12119 2026-08-31 cs.CV cs.AI cs.CL 版本更新

PRISM: Self-Pruning Intrinsic Selection Method for Training-Free Multimodal Data Selection

PRISM:免训练多模态数据选择的自剪枝内在选择方法

Jinhe Bi, Aniri, Zengjie Jin, Yifan Wang, Danqi Yan, Wenke Huang, Xiaowen Ma, Sikuan Yan, Artur Hecker, Mang Ye, Xun Xiao, Hinrich Schuetze, Volker Tresp, Yunpu Ma

机构 * LMU Munich(慕尼黑大学) Munich Research Center, Huawei Technologies(慕尼黑研究中心,华为技术) METEOR School of Computer Science, Wuhan University(武汉大学计算机学院) Munich Center for Machine Learning(慕尼黑机器学习中心)

AI总结 针对多模态大语言模型视觉指令数据冗余问题,提出一种免训练框架PRISM,通过隐式重中心化消除视觉特征各向异性导致的全局语义漂移,实现高效数据选择,在降低计算成本的同时提升模型性能。

Comments Accepted to EMNLP 2026 and selected for the ACL 2026 Best Paper Consideration

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04524 2026-08-31 cs.AI 版本更新

BioPIE: A Biomedical Protocol Information Extraction Dataset for Experiment Understanding

BioPIE:面向实验理解的生物医学协议信息抽取数据集

Haofei Hou, Shunyi Zhao, Fanxu Meng, Kairui Yang, Lecheng Ruan, Qining Wang

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京理工大学先进制造与机器人学院) School of Integrated Circuits, Peking University(北京理工大学集成电路学院)

AI总结 提出BioPIE数据集,以程序为中心的知识图谱捕获实体、动作和关系,解决生物医学实验理解中的高信息密度和多步推理难题,并验证了信息抽取方法及问答系统的有效性。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26536 2026-08-31 cs.CL cs.AI cs.CV cs.LG cs.RO 版本更新

OceanGym: A Benchmark Environment for Underwater Embodied Agents

OceanGym: 一个用于水下具身智能体的基准环境

Yida Xue, Mingjun Mao, Xiangyuan Ru, Yuqi Zhu, Baochang Ren, Shuofei Qiao, Mengru Wang, Shumin Deng, Xinyu An, Ningyu Zhang, Ying Chen, Huajun Chen

AI总结 OceanGym通过多模态大语言模型构建首个水下具身智能体基准,揭示水下环境感知与规划的挑战,推动水下自主系统发展。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17194 2026-08-31 cs.CR 版本更新

Progressive Behavioral Drift through Compression Valleys in Large Language Models

在阴影中引导:大型语言模型中激活空间攻击的因果放大

Zhiyuan Xu, Stanislav Abaimov, Joseph Gardiner, Sana Belguith

AI总结 本文提出通过因果放大效应,利用激活空间攻击实现对大型语言模型行为的可控引导,展示了其在安全性和有效性上的贡献。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14684 2026-08-31 cs.CL 版本更新

SMRC: Aligning Large Language Models with Student Reasoning for Mathematical Error Correction

SMRC:使大语言模型与学生数学推理对齐以进行数学错误修正

Biaojie Zeng, Min Zhang, Juan Zhou, Fengrui Liu, Ruiyang Huang, Yu Song, Xin Lin

机构 * East China Normal University(华东师范大学) East Chine Normal University(华东师范大学) Southeast University(东南大学)

AI总结 该研究针对大语言模型数学推理错误的教育场景修正需求,提出SMRC方法,结合MCTS等技术构建高中数学基准MSEB,实验显示其在多数据集上性能优于现有方法。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25384 2026-08-31 cs.CL 版本更新

Roleplaying with Structure: Synthetic Therapist-Client Conversation Generation from Questionnaires

基于问卷的角色扮演:从问卷生成合成治疗师-来访者对话

Doan Nam Long Vu, Rui Tan, Lena Moench, Svenja Jule Francke, Daniel Woiwod, Florian Thomas-Odenthal, Sanna Stroth, Tilo Kircher, Christiane Hermann, Udo Dannlowski, Hamidreza Jamalabadi, Simone Balloccu, Shaoxiong Ji

机构 * Technical University of Darmstadt(达姆施塔特技术大学) Philipps-University Marburg(马尔堡菲利普斯大学) Justus Liebig University Giessen(吉森约斯特·利伯格大学) University of Münster(明斯特大学) ELLIS Institute Finland(芬兰ELLIS研究所) University of Turku(图尔库大学)

AI总结 该研究针对心理健康合成数据生成受隐私限制的问题,构建了基于结构化问卷的SQPsych流水线生成合成治疗师-来访者对话,微调开放权重LLMs后经专家评估,其治疗师角色扮演能力优于其他心理健康类LLMs。

Comments Accepted to the 5th Workshop on NLP for Positive Impact 2026 @EMNLP 2026, Budapest, Hungary

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14278 2026-08-31 cs.CL cs.AI cs.IR 版本更新

PRISM: Agentic Retrieval with LLMs for Multi-Hop Question Answering

PRISM:用于多跳问答的基于大语言模型的智能体检索框架

Md Mahadi Hasan Nahid, Davood Rafiei

机构 * Department of Computing Science University of Alberta(计算科学系阿尔伯塔大学)

AI总结 本研究提出PRISM智能体检索框架,通过三个专门LLM智能体迭代交互优化多跳问答的证据检索,在四个基准上性能优于强基线,减少无关信息并提升下游QA模型表现。

Comments EMNLP 2026 (long, main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09260 2026-08-31 cs.CR cs.LG 版本更新

GREAT: Generalizable Backdoor Attacks in RLHF via Emotion-Aware Trigger Synthesis

GREAT: 通过情感感知触发器在RLHF中实现可泛化的后门攻击

Subrat Kishore Dutta, Yuelin Xu, Piyush Pant, Xiao Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA赫尔姆霍茨信息安全中心)

AI总结 提出GREAT框架,利用情感感知触发器在RLHF中构造自然分布后门,通过潜在空间聚类和多样性提示策略生成愤怒触发器,实现对未见触发器的泛化攻击。

Comments Accepted in EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24418 2026-08-31 cs.CR 版本更新

GSPR: Aligning LLM Safeguards as Generalizable Safety Policy Reasoners

GSPR:将大语言模型(LLM)安全防护措施对齐为可泛化的安全策略推理器

Haoran Li, Jingru Zeng, Yulin Chen, Huihao Jing, Wenbin Hu, Hao Peng, Haochen Shi, Xi Yang, Ziqian Zeng, Sirui Han, Yangqiu Song

AI总结 针对现有LLM安全防护措施泛化性不足的问题,提出可泛化安全策略推理器GSPR,通过强化学习在多安全基准训练后提升安全与类别预测能力,且推理token成本更低。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24192 2026-08-31 cs.CV cs.AI 版本更新

Talk in Pieces, See in Whole: Disentangled and Hierarchical Representation Learning in Language-based Object Detection

分段对话,整体感知:面向语言型目标检测的解耦分层表示学习

Sojung An, Kwanyong Park, Yong Jae Lee, Donghyun Kim

机构 * Korea University(韩国大学) University of Seoul(首尔大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 针对视觉-语言模型难以处理复杂语言查询的问题,提出TaSe框架,构建分层合成字幕数据集与三组件解耦模块,在OmniLabel基准上实现24%的性能提升。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19212 2026-08-31 cs.CL cs.AI 版本更新

Steering Multimodal Large Language Models Decoding for Context-Aware Safety

面向上下文感知安全的多模态大语言模型解码引导

Zheyuan Liu, Zhangchen Xu, Guangyao Dou, Xiangchi Yuan, Zhaoxuan Tan, Radha Poovendran, Meng Jiang

机构 * University of Notre Dame(notre dame 大学) University of Washington(华盛顿大学) Johns Hopkins University(约翰霍普金斯大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 针对多模态大语言模型安全对齐的平衡难题,提出SafeCoDe解码框架,通过两阶段机制优化上下文敏感的弃权行为,在多基准实验中有效提升安全性能且保留模型有用性。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04342 2026-08-31 cs.CL 版本更新

Pruning Laws for Large Language Models

大语言模型的剪枝规律

Ayan Sengupta, Siddhant Chaudhary, Tanmoy Chakraborty

机构 * IIT Delhi(印度理工学院德里分校)

AI总结 本研究提出剪枝规律这一可解释缩放关系,可预测剪枝后大语言模型的性能,能跨不同模型、剪枝方法和任务迁移,为高效部署LLMs提供原则性框架。

Comments Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00728 2026-08-31 cs.LG 版本更新

Meta-Prompt Optimization for LLM-Based Sequential Decision Making

基于大语言模型的序列决策中的元提示优化

Mingze Kong, Zhiyong Wang, Yao Shu, Zhongxiang Dai

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Chinese University of Hong Kong(香港中文大学) Guangdong Lab of AI and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))

AI总结 针对基于大语言模型的序列决策中因奖励非平稳导致的元提示优化难题,提出EXPO及扩展的EXPO-ES算法,可显著提升相关任务性能。

Comments EMNLP 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏