arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

2026-09-01 至 2026-09-01 共收录 388
2608.30391 2026-09-01 cs.CL cs.AI 新提交

Using Grounded Theory for Agent Behavior Analysis at Scale

用扎根理论进行大规模智能体行为分析

Zhuoran Lu, Yangyang Yu, Zhuoyan Li, Yibo Meng, Nan Jiang, Chengxi Zang, Jie Gao, Ziang Xiao

机构 * Purdue University(普渡大学) Stevens Institute of Technology(史蒂文斯理工学院) Cornell University(康奈尔大学) University of Texas at El Paso(德克萨斯大学埃尔帕索分校) Johns Hopkins University(约翰斯·霍普金斯大学)

AI总结 该研究将扎根理论引入智能体轨迹分析,提出AutoTraceGT流程,在六个语料库上可恢复多数人类标注失败模式,其编码本在失败预测任务中优于LLM基线,为智能体行为分析提供可扩展工具。

Comments 33 pages. Accepted to the Findings of the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30373 2026-09-01 cs.CL 新提交

Beyond Consensus: Downward Bias and Role Asymmetry in Multi-Agent LLM Judges for Subjective Evaluation

超越共识:用于主观评估的多智能体大语言模型评判器中的向下偏差与角色不对称

Minsoo Song, Chanwoo Kim, Sugyeong Eo, Chanjun Park

机构 * Soongsil University(崇实大学) Yonsei University(延世大学)

AI总结 该研究发现多智能体辩论(MAD)用于主观评估时存在角色不对称导致的向下偏差,会降低与人类判断的对齐度,消除角色不对称可恢复性能,揭示了共识式MAD协议的结构性局限。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30372 2026-09-01 cs.CL 新提交

Auditing MCQA Benchmarks through Probability Landscapes

基于概率景观的MCQA基准测试审计

Minsoo Song, Chanjun Park

机构 * Soongsil University(崇实大学)

AI总结 本研究提出两部分概率框架,结合P_top1、H_norm、MPD及噪声注入方法,实现MCQA基准测试的基准级与条目级审计,其结果与专家注释一致,可作为轻量级审计工具。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30362 2026-09-01 cs.AI cs.CL 新提交

Will the User Ever Know? Covert Indirect Prompt Injection on Tool-Using LLM Agents

用户会知道吗?针对使用工具的大语言模型智能体的隐蔽间接提示注入攻击

Yunseok Lee, Yunji Kim, Woojin Lee

机构 * Dongguk University-Seoul(东国大学首尔校区)

AI总结 该研究针对工具型LLM智能体的间接提示注入攻击,将攻击成功率分解为隐蔽与公开成功率,提出ICoA诱导隐蔽攻击,在AgentDojo的四个模型上提升了隐蔽成功率3.79-12.01个百分点。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30348 2026-09-01 cs.SD eess.AS 新提交

Perceptually Better, Semantically Worse: Measuring Speech Enhancement Impact on LLM-Based Voice Systems

感知上更优,语义上更差:衡量语音增强对基于大语言模型的语音系统的影响

Randy Frans Fela, Pejman Mowlaee

机构 * GN Group(GN集团)

AI总结 该研究针对语音增强对LLM语音系统的影响问题,提出输出分歧率(ODR)指标,通过基准测试发现标准音频质量指标无法适配LLM流程质量评估,验证了SE引发的语义失真会传递至下游LLM任务。

Comments Accepted at EMNLP 2026. 12 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30345 2026-09-01 cs.AI 新提交

Answer Probing-Guided Search for Diverse Solution Exploration of LLMs

基于答案探测引导的大语言模型多样化解决方案探索搜索

Yi Fang, Que Shen, Chengpeng Li, Boyi Deng, Wei Shi, Wenjie Wang, Fuli Feng, Fengli Xu, Dayiheng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 该研究针对LLMs推理易收敛于单一解的问题,提出Answer Probing引导的树搜索APTS,经实验证实可提升多推理任务的解决方案多样性,具备有效性与鲁棒性。

Comments Accepted to the EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30319 2026-09-01 cs.CL cs.AI cs.LG 新提交

Beyond Token-Level Guidance: Inference-Time Alignment of Specialized LLMs via Cross-Family Representation Steering

超越token级引导:通过跨系列表示转向实现专用大语言模型的推理时对齐

Jin Gan, Xin Li, Jun Luo

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) College of Cryptology and Cyber Science, Nankai University(南开大学密码与网络科学学院)

AI总结 针对专用LLM推理时对齐的缺陷,提出CREST方法,通过跨系列表示转向提升安全性,同时保留领域能力,在安全基准上比基线提升达22.2%。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30303 2026-09-01 cs.CL 新提交

Lazy Grounding: Attacking Search Agents with Factual Evidence

惰性接地:用事实证据攻击搜索智能体

Yulin Zhang, Yukun Huang, Sanxing Chen, Tianyi Lin, Ziang Yang, Xunjian Yin, Bhuwan Dhingra

机构 * Duke University(杜克大学)

AI总结 该研究提出惰性接地攻击,即搜索智能体被邻近问题的事实证据误导,实验显示其可降低准确率最高17.3个百分点,表明需防御事实证据的误用。

Comments Accepted to EMNLP 2026 (Main Conference). Code: https://github.com/frankyzha/lazy-grounding

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30294 2026-09-01 cs.CV 新提交

Dynamic Hub-and-Spoke Memory for Streaming Video Understanding

用于流视频理解的动态轮辐式记忆

Xinru Jiang, Lin Zhao, Xi Xiao, Yunbei Zhang, Janet Wang, Chenrui Ma, Haolin Li, Yanzhi Wang, Yifan Gong, Octavia Camps

机构 * Northeastern University(东北大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Tulane University(杜兰大学) University of Virginia(弗吉尼亚大学) Adobe Research(奥多比研究院)

AI总结 针对流视频理解需同时紧凑记忆长程历史与高效检索相关证据的挑战,提出动态轮辐式记忆(D-HSM)框架,结合结构化文本记忆与近期视觉标记,在基准上提升VLM性能并优于现有基线。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30291 2026-09-01 cs.IR 新提交

PEARL: Front-Loading Relational Chains for Multi-Hop Table Retrieval

PEARL:面向多跳表格检索的前置化关系链

Subeen Ho, Hyeongu Kang, SeongKu Kang, Susik Yoon

AI总结 PEARL是无需训练的多表格检索框架,通过前置化关系链实现垂直划分的子表格编码,在3跳查询的R@2指标上最高提升30.05%,性能优于现有方法。

Comments Accept to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30260 2026-09-01 cs.CL cs.AI cs.LG 新提交

Using Prosody to Predict Syntactic Structure

用韵律预测句法结构

Junghyun Min, Alex Warstadt, Tamar I. Regev, Tiago Pimentel, Ethan Gotlieb Wilcox

机构 * Georgetown University(乔治城大学) UC San Diego(加州大学圣迭戈分校) MIT(麻省理工学院) ETH Zürich(苏黎世联邦理工学院)

AI总结 该研究从信息论视角提出通用框架,利用多模态语言模型量化韵律与句法的互信息,发现韵律可降低自然对话中10.2%的句法不确定性,为相关理论提供实证支持。

Comments 15 pages, 4 figures. EMNLP 2026 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30256 2026-09-01 cs.CL cs.AI 新提交

Beyond Surface Forms: Symbolic Edits as a Test for Logical Reasoning with LLMs

超越表面形式:以符号编辑测试大语言模型的逻辑推理能力

Ramya Keerthy Thatikonda, Wray Buntine, Ehsan Shareghi

机构 * Monash University(莫纳什大学) University College London(伦敦大学学院)

AI总结 本研究提出工具驱动的符号编辑框架,通过可控修改逻辑算子等结构成分,发现不同LLM在算子编辑下的推理行为不一致,可用于评估模型推理可靠性。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30252 2026-09-01 cs.LG 新提交

Strong Drafts Need Compact Memories: Long-Context Speculative Decoding with Compressed KV Cache

强草稿需要紧凑记忆:带压缩KV缓存的长上下文推测解码

Tong Yuan, Chengxi Liao, Zeyi Wen

机构 * Data Science and Analytics Thrust, Information Hub(数据科学与分析方向、信息枢纽) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出记忆增强草稿技术,为长上下文推测解码配备压缩KV记忆,可降低70%以上草稿侧内存,使Llama~3.1-8B和70B模型分别实现最高2.08倍、3.33倍解码加速,同时保持推测解码的无损保证。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30248 2026-09-01 cs.SE 新提交

DSEffi-Bench: Demystifying Large Language Models' Capability in Efficient Data Science Code Generation

DSEffi-Bench:揭示大语言模型在高效数据科学代码生成中的能力

Zhihao Gong, Junzhe Yu, Dong Huang, Zeyu Sun, Jie M. Zhang, Dan Hao

AI总结 该研究推出首个针对大语言模型生成数据科学代码执行效率的基准DSEffi-Bench,评估发现正确性与效率不相关,分类法可指导优化以提升效率并降低成本。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30229 2026-09-01 cs.CL 新提交

Quantifying and Mitigating Korean Jamo-Level Typographical Vulnerabilities in Large Language Models

量化并缓解大语言模型中的朝鲜语谚文初声、中声、终声(Jamo)层面的排版漏洞

Seojin Lee, Hwanhee Lee

机构 * Chung-Ang University(中央大学)

AI总结 该研究量化了LLMs对朝鲜语Jamo层面排版扰动的脆弱性,提出TACoT方法,可在低推理成本下恢复思维链的大部分准确率增益。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30226 2026-09-01 cs.AI cs.CL cs.PF 新提交

LaMoC: Loss-Aware Modular Compression for LLMs

LaMoC:面向大语言模型的损失感知模块化压缩方法

Mohanad Odema, Jacob Song

机构 * LG Electronics USA(美国LG电子公司)

AI总结 本文提出损失感知模块化压缩方法LaMoC,通过融合激活与经验费舍尔统计优化LLM压缩,在4-8B模型上较最优方法实现困惑度降2.5%、任务精度升1%。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30204 2026-09-01 cs.CL 新提交

When Models Hear What They Expect: Diagnosing Prosodic Heuristics in Multimodal Sarcasm Detection

当模型“听到”它们所期待的:诊断多模态讽刺检测中的韵律启发式算法

Yongjian Chen, Pengfei Wei, Yiqun Sun, Zhu Li, Lawrence B. Hsieh

机构 * Magellan Technology Research Institute (MTRI)(麦哲伦技术研究所(MTRI)) Center for Language and Cognition, University of Groningen(格罗宁根大学语言与认知中心)

AI总结 本文以讽刺检测为切入点,评估Qwen2.5-Omni等多模态大语言模型,发现模型依赖音高升高、停顿不规则的韵律刻板印象,操控该维度可使假阳性率达60%,且该效应可跨模型复现。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30197 2026-09-01 cs.CL cs.SE 新提交

ALTSTEER: Selective Safety Steering for Moving Beyond Hard Refusals to Constructive Alternatives

ALTSTEER:用于超越生硬拒绝并构建建设性替代方案的选择性安全引导

Hoejoon Kwon, Byeonggeuk Lim, Kahyeon Kim, YoungBin Kim

机构 * Chung-Ang University(中央大学)

AI总结 该研究提出推理时框架ALTSTEER,结合选择性干预与拒绝锚定的建设性重定向,在Llama-3.1和Qwen2.5上验证其可保持良性效用并提升建设性安全完成行为。

Comments Accepted at EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30163 2026-09-01 cs.IR cs.CV 新提交

Doc-REFRAG: Rethinking Multimodal Document Retrieval-Augmented Generation

Doc-REFRAG:重新思考多模态文档检索增强生成

Ruofan Hu, Shengyang Xu, Minjie Hong, Xiaoda Yang, Sashuai Zhou, Ke Lei, Tao Jin, Zhou Zhao

AI总结 针对现有多模态RAG模型在多图像场景中准确率有限且计算开销大的问题,提出基于大规模数据集DocLongRAG的问题引导框架Doc-REFRAG,其在六个基准上优于11个基线,实现SOTA准确率且推理延迟更低。

Comments Accepted by EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30156 2026-09-01 cs.CL 新提交

Reactivating Test-Time Scaling for Plane Geometry Problem Solving

重新激活平面几何问题求解的测试时缩放能力

Xiaoqiang Kang, Shengen Wu, Maizhen Ning, Xiaobo Jin, Kaizhu Huang, Yutao Yue, Xiaowei Huang, Qiufeng Wang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西交利物浦大学先进技术学院) University of Liverpool(利物浦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hithink Research(海天瑞声研究院) Digital Innovation Research Center, Duke Kunshan University(昆山杜克大学数字创新研究中心)

AI总结 该研究针对平面几何问题求解中测试时缩放失效的问题,提出多轨迹合成、感知增强训练及共识引导多轨迹集成方法,提升了不同模型规模下的几何问题求解性能,且采样成本最高降低8倍。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30147 2026-09-01 cs.CL 新提交

CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents

CAST:用于训练可靠长程工具调用智能体的批判感知监督

Amir Saeidi, Zehua Zhang, Rishitosh Singh, Naman Ahuja, Vivek Gupta, Ali Payani, Gaowen Liu, Jayanth Srinivasa, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学) Cisco Research(思科研究院)

AI总结 提出批判感知训练框架CAST,通过分析智能体轨迹生成结构化批判,优化Qwen3模型,在零售、远程医疗等动态工具调用任务上提升可靠性,性能优于GPT-OSS-120B。

Comments Accepted to EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30144 2026-09-01 cs.RO 新提交

Rethinking Language's Role in Efficient VLA for Autonomous Vehicles: Toward Smarter, Trustworthy Driving

重新思考语言在自动驾驶高效视觉-语言-动作(VLA)模型中的作用:迈向更智能、可信的驾驶

Tongfei Guo, Lili Su

机构 * Northeastern University(东北大学)

AI总结 本研究针对自动驾驶VLA模型的高推理开销问题,提出语言残差分类法梳理高效语言使用方法,在多基准上分析适配性,将发布相关代码仓库。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30109 2026-09-01 cs.CL 新提交

COGTRL: Training LLMs for Scientific Discovery Assistance using Cognitive Traces via Reinforcement Learning

COGTRL:通过强化学习训练大语言模型以利用认知轨迹辅助科学发现

Shrinidhi Kumbhar Santosh Mashetty Divij Handa Kevin Coutinho, Siddharth Sambhaji Ghule, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学)

AI总结 本研究提出COGTRL这一轨迹级强化学习框架,训练LLMs产生科学发现所需的认知轨迹,在AI和材料科学领域的实验中,其方法质量较3B参数模型基线平均提升7.85分,表现接近70B参数模型,且更受领域专家偏好。

Comments Accepted EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30107 2026-09-01 cs.CL cs.AI cs.CY 新提交

AtlasNLP: A Country-Aware Atlas of Dataset Representation in NLP

AtlasNLP:NLP中数据集表示的国家感知图集

Joan Nwatu, Tsedeniya Solomon Amare, Longju Bai, Bontu Fufa Balcha, Zayd Bashir, Angana Borah, Zara Burzo, Yubin Choi, Naihao Deng, Samika Gupta, Michel Faloughi, Claude Kwizera, Ziqiao Ma, Cynthia Yacel Fuertes Panizo, Ellie Seehorn, Hui Shen, Jiayi Tang, Zesen Zhao, Boyuan Zheng, Rada Mihalcea

机构 * University of Michigan(密歇根大学) Addis Ababa University(亚的斯亚贝巴大学) San Jose State University(圣何塞州立大学) Skyline High School(斯凯莱恩高中) University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本研究推出AtlasNLP国家感知图集,含13000余条NLP数据集记录及两个子数据集,发现各国各任务数据集覆盖不均等问题,推动NLP评估补充地理元数据。

Comments Proceedings of the 2026 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30076 2026-09-01 cs.CL 新提交

Budget-Aware Compression Pipeline for Single-GPU LLM Inference: Methods, Trade-offs, and Coupling Effects

面向单GPU大语言模型推理的预算感知压缩流水线:方法、权衡与耦合效应

Hongyu Yu, Yifei Shen

机构 * Lenovo Research(联想研究院) University of Washington(华盛顿大学)

AI总结 该研究针对单GPU部署70B参数大语言模型的内存、吞吐量及集成成本问题,构建了含剪枝、量化、KV缓存压缩的预算感知压缩流水线,实现了模型压缩至33GB、57 tokens/s推理速度且精度损失在5%内的效果,提供了设计规则与评估协议。

Comments Accepted by GroundLM 2026 (EMNLP 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30067 2026-09-01 cs.LG cs.AI cs.CL 新提交

How do World Models and Policies Compose in LLM Agents? A Joint Spectral and Behavioral Account

世界模型与策略如何在大语言模型智能体中结合?一种联合谱分析与行为学解释

Ruize Xu, Xiao Yu, Yujin Tang, Chenming Shang, Nikhil Singh

机构 * Dartmouth College(达特茅斯学院) Columbia University(哥伦比亚大学)

AI总结 该研究通过受控实验探究LLM智能体中世界模型与策略的结合机制,从几何与行为角度揭示二者的互补特性,并提出提升策略训练保留世界知识能力的方法。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30033 2026-09-01 cs.CL cs.AI 新提交

"Act Like a 5th Grader" is Not Enough: Bounding Knowledge in LLM-Based User Simulators

仅模仿五年级学生还不够:基于大语言模型的用户模拟器中的知识边界

Krisztian Balog, Arild Michel Bakken

机构 * University of Stavanger(斯塔万格大学)

AI总结 该研究针对基于大语言模型的用户模拟器存在的“超人偏差”问题,提出认知受限用户模拟器(CBUS)框架,通过明确建模认知边界提升模拟人类阅读行为的保真度。

Comments Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30025 2026-09-01 cs.AI 新提交

Interpreting and Steering for Safe and Correct Code Generation

面向安全且正确的代码生成的解释与引导

Hao Yan, Ziyu Yao

机构 * George Mason University(乔治梅森大学)

AI总结 本研究通过CodeSec-Pairs数据集解释LLMs代码生成的安全机制,提出DuoSteer双引导方法,在5类漏洞实验中实现26.9%漏洞率降低,效果优于基线方法且可跨模型复现。

Comments Accepted to the EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30005 2026-09-01 cs.CL 新提交

Small Language Models as Judges for Rubric-Based Reinforcement Learning

小型语言模型作为基于 rubric 的强化学习的评判者

Fengyu Xie, Yilun Zhao, Bingsen Chen, Arman Cohan, Chen Zhao

机构 * New York University(纽约大学) Yale University(耶鲁大学)

AI总结 该研究构建了两个基于 rubric 的评估数据集,对比三种提取标准级评判的方法,发现 Qwen3-1.7B 探针评判者表现最优,用作 GRPO 奖励模型时训练效率优于 8B 生成式评判者基线。

Comments 9 pages, 1 figure; EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29999 2026-09-01 cs.SD cs.AI cs.LG 新提交

TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models

TEMPO:面向大型音频-语言模型的时序锚定多任务后训练

Apoorva Kulkarni, Kaousheik Jayakumar, Sreyan Ghosh, Utathya Aich, Ramani Duraiswami, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校) CNH Industrial India(凯斯纽荷兰工业印度公司)

AI总结 TEMPO是首个处理音频、语音和音乐时间戳任务的统一模型,通过SFT结合GRPO方法,在10K样本评估基准上优于Audio Flamingo Next等最先进模型。

Comments Accepted at EMNLP 2026 Main Conference. Project page - https://kaousheik-26.github.io/tempo

详情

展开后加载摘要…

URL PDF HTML 收藏