arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

2026-09-01 至 2026-09-01 共收录 156
2608.28966 2026-09-01 eess.AS 新提交

When Vocal Tone and Literal Meaning Diverge: An Acoustic-Semantic Incongruity Study for Large Audio-Language Models

当语调与字面意义不一致时:面向大型音频语言模型的声学-语义不一致研究

Yu-Wen Chen, William Ho, Maxim Topaz, Zoran Kostic, Julia Hirschberg

AI总结 本研究针对LALMs在语调与字面意义不一致场景下的表现问题,构建CREMA-ASIS数据集,经实验发现其受语义主导且难识别不一致,监督式微调可显著提升其性能。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31069 2026-09-01 cs.LG cs.CL 新提交

A Model with No Head and Many Thoughts

无头部多思维模型

Nikita Koriagin, Yaroslav Aksenov, George Bredis, Gleb Gerasimov, Nikita Balagansky, Daniil Gavrilov

机构 * Yandex T-Tech

AI总结 该研究提出Soft Latent Thinking方法,用轻量投影器替换语言模型头部,在嵌入空间以连续推理步骤替代离散标记,在DeepSeek-Qwen-1.5B和LLaMA-3.2-3B实验中提升了pass@k并减少计算。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31058 2026-09-01 cs.CL 新提交

Improving Information Extraction with Learned Queries

利用学习到的查询改进信息抽取

Omar Sharif, Soroush Vosoughi, Nikhil Singh

机构 * Dartmouth College(达特茅斯学院)

AI总结 该研究针对信息抽取问题,提出LoQ生成文档特定问题集、FeedQ反馈驱动优化方法,优化问题可训练轻量级模型,4B参数模型性能超未调大模型,发布12820个优化问题数据集。

Comments Accepted in EMNLP-2026, 21 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31035 2026-09-01 cs.CL cs.SD eess.AS 新提交

When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models

基于预测器的强化学习何时与人类感知对齐?基于编解码器的语音语言模型中主观奖励的研究

Joonyong Park, Jerry Li

机构 * Spellbrush(斯佩尔布拉什公司)

AI总结 本研究探究基于编解码器的语音语言模型中,预测器式强化学习与人类感知的对齐条件,采用GRPO与CER区间约束,发现单奖励针对性提升对应指标,8最佳重排序性能接近GRPO,为多奖励语音后训练的奖励选择提供诊断方法。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31014 2026-09-01 cs.CL 新提交

Evidence-Bounded Mental Health Reasoning from Heterogeneous Speech Protocols

基于异构语音协议的证据受限心理健康推理

Chengyuan Gao, Jiang Wu, Tao Lu, Jiayan Guo, Mingkun Xu, Tianyi Zang, Shangyang Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Harbin Institute of Technology(哈尔滨工业大学) Renyixun Health Technology Co., Ltd.(仁医讯健康科技有限公司) GDIIST(广东省智能制造研究所) Tencent(腾讯)

AI总结 本研究针对现有心理健康筛查模型的证据边界问题,提出协议感知的证据控制框架EviBound,在抑郁症筛查任务中达到0.8658的AUROC,且实现零宣称违规。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31009 2026-09-01 cs.LG 新提交

Language-Informed Flow Matching for Trend-Guided Structure-Based 3D Molecular Generation

用于趋势引导的基于结构的3D分子生成的语言知情流匹配

Tianyu Gao, Zhikai Su, Jiashu Li, Wenjun Gao, Zichuan Ying, Zhe Zhao, Fei Zhang, Ye Wei

机构 * City University of Hong Kong(香港城市大学) The University of Hong Kong(香港大学) Stanford University(斯坦福大学)

AI总结 该研究提出基于流匹配的语言知情跨模态框架LiFT,通过“感知-演化-组装”智能体和自条件解耦路由器实现趋势引导的3D分子生成,在Cross-Docked2020数据集上验证了其分布匹配、药物化学指标及结构有效性的优势。

Comments Accepted at Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30996 2026-09-01 cs.CL 新提交

Faithfulness Is Not Free: Auditing Offline KV-Cache Quantization in Retrieval-Augmented Generation

忠实性并非免费:审计检索增强生成中的离线键值缓存量化

Atta Ul Asad, Ahsan Bilal, Muhammad Ali, Muhammad Haseeb, Dean F. Hougen

机构 * Air University(空军大学) National University of Sciences and Technology (NUST)(国家科学技术大学) University of Oklahoma(俄克拉荷马大学) Lahore University of Management Sciences (LUMS)(拉合尔管理科学大学)

AI总结 该研究针对检索增强生成的KV缓存量化,以Qwen2.5-7B-Instruct为对象,发现INT4量化会严重损害忠实性且准确性指标无法察觉,强调需在部署压缩缓存前审计忠实性。

Comments Grounding Language Models: Learning Faithfully and Efficiently @ EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30987 2026-09-01 cs.CL cs.AI cs.LG 新提交

Stick to What You Know: A Study of Knowledge-Aligned Supervised Fine-Tuning

坚持你所知:知识对齐的监督微调研究

Arthur Becker, Jakob Kemmler, David Thulke, Christine Schäfer, Christian Dugast, Hermann Ney

机构 * AppTek GmbH(AppTek有限公司) RWTH Aachen University(亚琛工业大学)

AI总结 该研究提出知识对齐的监督微调方法,引入证据重写、回忆重写两个变体,实验显示其可减少事实幻觉、保留通用能力,回忆重写效果最优且改善弃权行为,证实超知识SFT目标会引发幻觉。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30980 2026-09-01 cs.CL cs.AI 新提交

Evaluating and Improving LLM Self-Modeling

评估与改进大语言模型(LLM)的自我建模能力

Siqi Zeng, Andre N. Assis, Rowan Wang

机构 * Constellation(星群公司) Anthropic(Anthropic公司)

AI总结 本研究针对LLM的自我建模能力,构建基准测试评估其水平,开发合成数据管道结合强化学习提升该能力,发现提升未体现一致内省。

Comments 89 pages, 25 figures. Published as a conference paper at EMNLP '26 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30949 2026-09-01 cs.IR 新提交

MULTI3IR: A Benchmark for Multi-perspective Multi-domain Multi-modal Information Retrieval

MULTI3IR:多视角、多领域、多模态信息检索基准

Seokwon Song, Sohyeon Kim, Gunhee Kim

AI总结 该研究针对现有IR基准的不足,构建了多视角多领域多模态IR基准Multi³IR,提出SPIN方法提升检索器的视角覆盖度,实验验证其性能优势与泛化性。

Comments EMNLP 2026; code is available at https://github.com/seokwon99/Multi3IR

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30948 2026-09-01 cs.CL 新提交

Detecting AI Impostors: How Do Middle Schoolers Identify LLM Agents in a Live Collaborative Setting?

检测AI冒充者:中学生在实时协作场景中如何识别大语言模型(LLM)智能体?

Dan Schumacher, Pragathi Durga Rajarajan, Haven Kotara, Roman Rendon, Kosi Atupulazi, Deepti Tagare, Ismaila Temitayo Sanusi, Fred G. Martin, Anthony Rios

机构 * University of Texas at San Antonio(圣安东尼奥德克萨斯大学)

AI总结 本研究通过自研协作社交推理游戏DoppelBot,对中学生展开实验,探究其识别AI冒充者的策略、检测准确率变化规律及相关隐私反思,并发布了相关匿名数据集。

Comments Accepted to EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30927 2026-09-01 cs.SD cs.AI 新提交

Stride-k Subsampling: Train-Free Audio Token Reduction for Whisper

步长k子采样:无需训练的Whisper音频令牌缩减方法

Chanhee Cho, Junhyuk Choi, Bugeun Kim

机构 * Chung-Ang University(中央大学)

AI总结 该研究提出无需训练的步长k子采样方法,可减少Whisper音频令牌,降低计算量与延迟,在多数ASR基准上仅产生小的WER损失,适用于Whisper及基于其的语音语言模型。

Comments Accepted EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30924 2026-09-01 cs.CL 新提交

TRIPPULSE: Multi-Agent Travel Planning with Review-Grounded Reasoning

TRIPPULSE:基于评论推理的多智能体旅行规划

Priyanshu Karmakar, Borru Vijay Sai, Shubhojit Mallick, Abhik Jana, Shreya Ghosh, Manish Gupta

机构 * Microsoft(微软公司) IIT Bhubaneswar(布巴内斯瓦尔印度理工学院)

AI总结 TRIPPULSE是基于评论推理的多智能体旅行规划框架,分解行程生成任务为多智能体并结合10万+评论与RGPA指标,可兼顾约束满足与个性化体验。

Comments 31 pages, EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30922 2026-09-01 cs.AI 新提交

CARVE: Verified Expansion for Variable-Length Generation in Diffusion Language Models

CARVE:扩散语言模型中变长生成的验证式扩展

Wail Bouhedja, Amr Mohamed, Guokan Shang

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Sorbonne Université(索邦大学) Ecole Polytechnique(巴黎综合理工学院)

AI总结 本研究提出无需重训的 CARVE 算法,解决扩散语言模型固定长度生成的缺陷,通过验证式扩展实现变长生成,在代码生成与数学推理基准中提升性能并降低推理成本。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30910 2026-09-01 cs.LG cs.CL 新提交

S3C-LLM: Skill-Code Guided Agentic Language Models for Spectrum-to-Structure Elucidation

S3C-LLM:用于谱图到结构解析的技能-代码引导型智能体语言模型

Xuanle Zhao, Xinyuan Cai, Xiang Cheng, Bo Xu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 S3C-LLM是一种技能-代码引导型智能体LLM,通过检索光谱学技能、执行分析代码整合证据与约束来解析分子结构,性能优于同类模型且训练语料更少。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30903 2026-09-01 cs.CL 新提交

MMDS-Bench: Benchmarking Multimodal Large Language Models on Dynamic Stance in Social Media Interactions

MMDS-Bench:面向社交媒体互动中动态立场的多模态大语言模型基准测试

Yuzhe Ding, Kang He, Li Zheng, Shengwu Zheng, Teng Shi, Fei Li, Chong Teng, Donghong Ji

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学网络安全学院) Shanghai Innovation Institute(上海创新研究院)

AI总结 本研究构建多模态动态立场分类基准MMDS-Bench,评估12个多模态大语言模型,发现其在关系推理类多模态动态立场理解上仍存在不足。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30884 2026-09-01 cs.CL cs.AI 新提交

Evaluating and Mitigating Anti-LGBTQ Biases in German and Multilingual Language Models

评估与缓解德语及多语言大模型中的反LGBTQ偏见

Melina Morch, Daniel Braun

AI总结 本文构建德语-英语多语言基准数据集,评估8种语言模型的反LGBTQ偏见,发现模型存在相关刻板印象,微调可平均降偏但效果不均,凸显多语言偏见评估需文化适应。

Comments Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30873 2026-09-01 cs.CL cs.AI 新提交

Personas Differ from Native-Language Generation: Language Pathways Shape LLM Interpersonal Advice

角色设定与母语生成存在差异:语言路径塑造大语言模型的人际建议

Jinhee Won, Xinlan Emily Hu

AI总结 该研究对比了母语使用者角色设定(NP)与目标语言生成后翻译(NL)两种跨语言引出策略对LLM人际建议的影响,发现二者不可互换,NP会改变建议的风格、可操作性及动作选择。

Comments Accepted to EMNLP 2026 (Main Conference). 36 pages, 24 figures, 17 tables (9 pages main text; remainder references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30856 2026-09-01 cs.CL cs.HC 新提交

You Shouldn't Have Asked: A Pragmatics-Inspired Taxonomy for Evaluating LLM Refusals

你本不该问:一种受语用学启发的评估大语言模型(LLM)拒绝行为的分类法

Ruoxuan Li, Pinqiao Wang, Sheng Li, Cameron Robert Jones

机构 * Stony Brook University(石溪大学) University of Virginia(弗吉尼亚大学)

AI总结 该研究提出首个基于语用学理论的LLM拒绝分类法,通过分析16个LLM在14类有害请求下的拒绝回复,发现其拒绝的特点及存在的问题,呼吁开展兼顾情境适应性与社会问责的对齐评估。

Comments To appear in the Proceedings of the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30853 2026-09-01 cs.CL cs.LG 新提交

Linguistic Distance Segregates Latent Representations in Automatic Speech Recognition Systems

语言距离分离自动语音识别系统中的潜在表示

Ting-Hui Cheng, Line Katrine Harder Clemmensen, Sneha Das

机构 * Department of Applied Mathematics and Computer Science(应用数学与计算机科学系) Technical University of Denmark(丹麦技术大学)

AI总结 本文研究母语背景与英语自动语音识别(ASR)性能的关系,发现母语与英语的距离会系统性影响ASR错误率,且多数评估模型的深层声学层存在基于母语的潜在表示空间分离,该关联统计显著(p<0.001)。

Comments to appear in EMNLP finding 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30841 2026-09-01 cs.AI cs.CL 新提交

HSRM: Hidden-State Reward Models for Test-Time Verification

HSRM:用于测试时验证的隐藏状态奖励模型

Xianzhi Li, Xiaodan Zhu

机构 * Ingenuity Labs Research Institute(Ingenuity Labs 研究院)

AI总结 该研究提出轻量型隐藏状态奖励模型HSRM,复用生成器内部表征验证数学推理候选解,在四个基准中多数场景性能优于55M参数纯文本验证器,仅需约2M参数,实现高效验证。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30754 2026-09-01 cs.CL 新提交

CLIN: an Objective Framework for Evaluating Creativity in Short Persian Literary Text

CLIN:一种用于评估波斯语短篇文学文本创造性的客观框架

Mohammad Reza Modarres, Armin Tourajmehr, Yadollah Yaghoobzadeh, Mohammad Taher Pilehvar

机构 * Tehran Institute for Advanced Studies, Khatam University(哈塔姆大学德黑兰高等研究院) Cardiff University(卡迪夫大学)

AI总结 针对LLM评估波斯语短篇文学文本创造性的维度依赖问题,提出CLIN框架,用三类代理指标评估TTCT衍生的创造性维度,实现了与零样本LLM相当或更优的人类对齐度且评估成本更低。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30750 2026-09-01 cs.LG 新提交

Do VLMs Share Safety Neurons Across Modalities?

视觉语言模型(VLMs)是否在不同模态间共享安全神经元?

Jiaxuan Li, Jiahao Zhang, Duc Minh Vo, Huy H. Nguyen, Pride Kavumba, Koki Wataoka

机构 * SB Intuitions Corp.(SB Intuitions公司)

AI总结 该研究针对10个视觉语言模型,通过因果神经元层面分析,提出两阶段迭代消融检测流程与两个模态隔离基准,发现文本安全神经元集中、视觉安全高维弥散的差距,解释了当前对齐未缩小视觉安全差距的原因。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30748 2026-09-01 cs.CR cs.CL 新提交

The Fragility of Jailbreak Robustness Across Operational States

不同运行状态下越狱鲁棒性的脆弱性

Yuna Park, Hwang Youn Kim, Yujin Kim, Won Woo Ro, Suhyun Kim, Jae-In Hwang

AI总结 本研究发现越狱鲁棒性对运行状态变化极为脆弱,仅改变普通系统提示词就可大幅调整攻击成功率,原始状态评估无法全面表征鲁棒性,需开展非原始状态下的越狱鲁棒性评估。

Comments Accepted to Findings of the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30738 2026-09-01 cs.CL 新提交

Not All Fallbacks Are Failures: Understanding and Recovering from Fallbacks in Mobile Voice Assistants

并非所有弃权(不执行)都是失败:理解与恢复移动语音助手中的弃权(不执行)情况

Phillip Schneider, Alexandre Mercier, Joshua Oehms, Kristiina Jokinen, Florian Matthes

机构 * ALMA PHIL Technical University of Munich(慕尼黑工业大学) CNRS-AIST Joint Robotics Laboratory (JRL)(法国国家科学研究中心-日本产业技术综合研究所联合机器人实验室)

AI总结 本文针对移动语音助手的弃权(不执行)问题,基于500多用户的真实数据构建VoxFallbacks数据集,对比评估不同模型,发现轻量嵌入分类器性能更优,为设计高效弃权机制提供经验。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30716 2026-09-01 cs.CL cs.CV 新提交

SocialReasonBench: A Video-QA Benchmark for Social Reasoning with Counterfactual Narrative Videos

SocialReasonBench:基于反事实叙事视频的社会推理视频问答基准

Zheyu Huang, Zijing Shi, Haozhe Luo, Huadong Tang, Mingyu Liu, Meng Fang, Ling Chen

机构 * AAII, University of Technology Sydney(悉尼科技大学AAII(先进人工智能研究所)) Northeastern University(东北大学) Fudan University(复旦大学) University of Liverpool(利物浦大学)

AI总结 研究人员推出SocialReasonBench基准,评估LMMs的社会推理能力,发现其在反事实和因果推理上表现不佳,凸显了模型在潜在社会状态推理上的不足。

Comments Accepted to Findings of EMNLP 2026. 24 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30712 2026-09-01 cs.CL 新提交

GUIDE: Guiding Internal Evidence with Language Instructions

GUIDE:用语言指令引导内部证据

Soyeon Caren Han, Hyunsuk Chung, Jinwoo Kim, Seungyeon Ji, Kyungreem Han

机构 * The University of Melbourne(墨尔本大学) Korea Institute of Science and Technology(韩国科学技术研究院) Korea University(高丽大学) University of Science and Technology(科学技术大学)

AI总结 研究针对多模态模型依赖非指令要求的捷径线索的问题,提出GUIDE框架,结合分组参数高效适配与指令条件门控调节多模态证据通路,在多模态任务上提升鲁棒性与可控性,拓展了多模态指令跟随的范围。

Journal ref EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30686 2026-09-01 cs.CR cs.CL 新提交

Beyond the Payload: How User Invocation Shapes Coding Agent Vulnerability to Repository Poisoning

超越有效载荷:用户调用如何塑造编码代理对仓库中毒的漏洞

Fukang Zhu, Binbin Zhao, Ruixiao Lin, Ping He, Tianyu Du, Shouling Ji

AI总结 该研究推出首个针对编码代理仓库中毒漏洞的基准CIPR,发现漏洞高度依赖用户提示级配置,任务类型可使攻击成功率产生4.5倍差异,测试执行任务为隐蔽攻击面,不明确或嘈杂提示会间接改变风险。

Comments 30 pages,7 figures, Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30683 2026-09-01 cs.CL cs.CY 新提交

WildSEEK: Evaluating Language Models for Information-Seeking

WildSEEK:评估语言模型的信息获取能力

Tanise Ceron, Joachim Baumann, Elisa Bassignana, Berat Cabuk, Dirk Hovy, Debora Nozza

机构 * Bocconi University(博科尼大学) Stanford University(斯坦福大学) IT University of Copenhagen(哥本哈根信息技术大学) Pioneer Center for AI(先锋人工智能中心)

AI总结 针对现有LLM信息获取评估的不足,引入WildSEEK数据集与评估框架,发现超三分之一查询为高风险分析性查询,LLM在多方面存在缺陷,为相关研究提供实证基础。

Comments 9 pages, accepted at EMNLP Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30678 2026-09-01 cs.CL 新提交

OCR-MetaReasoning Benchmark: Evaluating the Meta-Reasoning Ability of MLLMs in Text-Rich Image Understanding

OCR元推理基准:评估多模态大语言模型在富文本图像理解中的元推理能力

Gengxu Li, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) International Center of Future Science, Jilin University(吉林大学未来科学国际中心)

AI总结 本文提出OCR-MetaReasoning基准,将演绎、归纳、溯因作为不同推理方向,分离答案正确性与推理合规性,实验发现现有MLLMs的OCR元推理能力远未饱和。

Comments EMNLP 2026 Findings camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏