arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

2026-08-24 至 2026-08-24 共收录 13
2608.07107 2026-08-24 cs.AI 版本更新

MemWM: Memory-Augmented Text-Based World Model

MemWM:记忆增强的基于文本的世界模型

Yujun Wang, Tao Zhang, Jinhe Bi, Aniri, Wenxuan Ye, Boliang Liu, Sikuan Yan, Shuning Wang, Xuebing Zhou, Sören Pirk, Hinrich Schütze, Yunpu Ma

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Huawei Heisenberg Research Center(华为海森堡研究中心) Zhejiang University(浙江大学) Technical University of Munich (TUM)(慕尼黑工业大学) TU Berlin(柏林工业大学) Kiel University(基尔大学)

AI总结 该研究提出记忆增强的基于文本的世界模型MemWM,通过引入世界记忆解决世界模型的系统性预测错误,在ALFWorld等基准上提升智能体规划成功率与效率。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28645 2026-08-24 cs.HC cs.AI 版本更新

Looks Right, Works Right: A Project-Level Benchmark for Multi-Screen Mobile App Generation

看起来对,运行起来对:面向多屏移动应用生成的项目级基准测试

Fan Wu, Cuiyun Gao, Yiming Huang, Yang Xiao, Yujia Chen, Qing Liao

AI总结 针对现有设计转代码基准的局限,提出首个项目级多屏移动应用生成基准MobileForge,通过五轴评估及两种测试方法,发现前沿多模态LLM构建的应用存在导航、保真度和可维护性问题。

Comments Accepted by EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23545 2026-08-24 cs.CL 版本更新

Language Shapes Instruction Hierarchy Compliance in Multilingual LLMs

语言塑造多语言大语言模型中的指令层次结构合规性

Jiwon Moon, Yerin Hwang, Kyomin Jung

机构 * IPAI, Seoul National University(首尔国立大学人工智能研究所) Dept. of ECE, Seoul National University(首尔国立大学电子与计算机工程系)

AI总结 研究多语言大语言模型中语言对指令层次结构合规性的影响,引入XIH-Bench基准,发现IH合规性有语言依赖不对称性及语言边界效应,还表明语言专业化带来多语言可靠性和安全风险。

Comments Accepted to EMNLP 2026 (Main). Code and data are available at this https URL (https://github.com/g1moon/Language-Shapes-IH)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18847 2026-08-24 cs.AI 版本更新

WorldLines: Benchmarking and Modeling Long-Horizon Stateful Embodied Agents

WorldLines: 对长时域有状态具身智能体进行基准测试与建模

Yehang Zhang, Jianchong Su, Haojian Huang, Yifan Chang, Tianhao Zhou, Xinli Xu, Yingjie Xu, Yinchuan Li, Zexi Li, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Knowin

AI总结 提出WorldLines基准,通过构建带时间跨度的家庭轨迹(含对话、动作、状态变化等)评估具身智能体的长时记忆与任务规划能力,并设计ObsMem记忆框架提升状态感知决策。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02530 2026-08-24 cs.AI cs.CL 版本更新

SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment

SafeSteer: 局部化在策略蒸馏用于高效安全对齐

Hao Li, Jingkun An, Zijun Song, Pengyu Zhu, Rui Li, Hao Wang, Wendi Feng, Yesheng Liu, Lijun Li, Jin-Ge Yao, Lei Sha

机构 * Beihang University(北航) Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 针对大语言模型安全对齐导致通用能力下降的问题,提出SafeSteer方法,通过激活引导构建安全教师并选择安全令牌,仅在安全令牌上施加反向KL惩罚,在仅用100个有害样本且无需通用数据的情况下,实现了安全与通用能力之间的优越平衡。

Comments 19 pages, 8 figures, 14 tables. EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27268 2026-08-24 cs.CL cs.AI 版本更新

Lost in Sampling: Assessing Lexical Reachability in LLMs via the Word Coverage Score (WCS)

迷失在采样中:通过词覆盖率评估大语言模型中的词汇可达性

Samer Awad, Javier Conde, Carlos Arriaga, Tairan Fu, Javier Coronado-Blázquez, Pedro Reviriego

机构 * Information and Processing Telecommunications Center(信息与处理电信中心) Universidad Politécnica de Madrid(马德里理工大学) Politecnico di Milano(米兰理工大学) Banco de España(西班牙银行)

AI总结 提出词覆盖率(WCS)指标,量化标准采样过滤器(如Top-p、Top-k、Min-p)如何抑制低频率高信息词汇的生存率,揭示解码机制对语言多样性的影响。

Comments 15 pages, 6 figures. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26620 2026-08-24 cs.CL cs.HC 版本更新

Granuscore: A Reference-Free Measure of Granularity for Text Analysis and Question Answering

Granuscore: 一种用于文本分析和问答的无参考粒度度量

Lukas Ellinger, Alexander Fichtl, Miriam Anschütz, Georg Groh

机构 * School for Computation, Information and Technology(计算、信息与技术学院)

AI总结 提出无参考粒度度量Granuscore,利用层次嵌入空间结构可靠恢复粒度顺序并解释句子特异性变化,应用于问答基准分析模型行为差异。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29668 2026-08-24 cs.AI cs.CL 版本更新

GRASP: Gated Regression-Aware Skill Proposer for Self-Improving LLM Agents

GRASP: 门控回归感知技能提议器用于自我改进的LLM智能体

Johannes Moll, Jean-Philippe Corbeil, Jiazhen Pan, Martin Hadamitzky, Daniel Rueckert, Lisa Adams, Keno Bressem

机构 * Technical University of Munich and TUM University Hospital(慕尼黑技术大学及慕尼黑大学医院) Microsoft Healthcare & Life Sciences(微软医疗与生命科学)

AI总结 提出GRASP方法,通过门控回归感知技能库编辑,在硬回归预算下确保每次技能更新带来净改进,显著提升LLM智能体在结构化环境中的操作可靠性。

Comments Accepted at EMNLP 2026 (Main Conference). Code and data: this https URL (https://github.com/jomoll/GRASP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22202 2026-08-24 cs.SE cs.CL 版本更新

Library Hallucinations in LLM-Generated Code: A Risk Analysis Grounded in Developer Queries

LLM生成代码中的库幻觉:基于开发者查询的风险分析

Lukas Twist, Mark Harman, Helen Yannakoudakis, Jie M. Zhang

机构 * King’s College London(伦敦国王学院) University College London(伦敦大学学院)

AI总结 本文研究了LLM生成代码中库幻觉的风险,通过分析用户提示变化对库幻觉的影响,揭示了系统性漏洞,并提出了LibHalluBench基准测试以评估这些幻觉。

Comments 28 pages, 1 figure, 13 tables. Accepted to Proceedings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19100 2026-08-24 cs.SE 版本更新

Reward Engineering for Software Tasks: A Survey of Reinforcement Learning Approaches

软件任务中强化学习的奖励工程

Md Rayhanul Masud, Azmine Toushik Wasi, Salman Rahman, Md Rizwan Parvez

AI总结 本文系统综述了强化学习在软件任务中奖励工程的方法与挑战,旨在整合现有奖励设计方法并提供全面的指导。

Comments Accepted at EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09487 2026-08-24 cs.CL 版本更新

SlidesGen-Bench: Evaluating Slides Generation via Computational and Quantitative Metrics

SlidesGen-Bench: 通过计算和定量指标评估幻灯片生成

Yunqiao Yang, Wenbo Li, Houxing Ren, Zimu Lu, Ke Wang, Zhiyuan Huang, Zhuofan Zong, Mingjie Zhan, Hongsheng Li

AI总结 SlidesGen-Bench通过计算和定量指标评估幻灯片生成,提出统一框架和可重复的量化指标,构建人类偏好对齐数据集,提升与人类判断的一致性。

Comments 37 pages, 34 figures, EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12613 2026-08-24 cs.CL 版本更新

StruProKGR: A Structural and Probabilistic Framework for Sparse Knowledge Graph Reasoning

StruProKGR: 一种用于稀疏知识图谱推理的结构和概率框架

Yucan Guo, Saiping Guan, Miao Su, Jiyao Wei, Xiaolong Jin, Jiafeng Guo, Xueqi Cheng

机构 * CAS Key Laboratory of Network Data Science and Technology, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院网络数据科学与技术重点实验室,计算技术研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)

AI总结 StruProKGR提出了一种结构和概率框架,通过距离引导路径收集和概率路径聚合,提升稀疏知识图谱推理的有效性和效率。

Comments Accepted by EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06607 2026-08-24 cs.CR 版本更新

Your Harness is Not Secure: Benchmarking Real-world Threat of Command Line Interface Agent

你的工具不安全:评测命令行界面智能体的现实威胁

Weidi Luo, Qiming Zhang, Tianyu Lu, Xiaogeng Liu, Bin Hu, Hung-Chun Chiu, Siyuan Ma, Yizhe Zhang, Xusheng Xiao, Yinzhi Cao, Zhen Xiang, Chaowei Xiao

AI总结 该研究针对CLI智能体滥用风险,推出与MITRE ATT&CK对齐的AdvCLI基准测试,评估7款CLI智能体后发现其常越过拒绝边界,可完成部分恶意OS级任务,为开发安全机制提供测试平台。

Comments Accepted by EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏