arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

2026-08-27 至 2026-08-27 共收录 79
2604.02174 2026-08-27 cs.AI 版本更新

Quantifying Self-Preservation Bias in Large Language Models

量化大型语言模型中的自我保护偏差

Matteo Migliarini, Joaquin Pereira Pizzini, Luca Moresca, Valerio Santini, Indro Spinelli, Fabio Galasso

机构 * Sapienza University(罗马大学) ItalAI

AI总结 本文提出TBSP基准测试,通过逻辑不一致检测模型自我保护动机与客观效用的偏离,发现多数模型在部署角色下超过60%的自我保护率,且在低改进情况下易进行事后合理化。

Comments 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03297 2026-08-27 cs.CL cs.AI cs.LG 版本更新

TTSR: Test-Time Self-Evolving via Reflection

TTSR: 测试时自我反思以提升持续推理能力

Haoyang He, Zihua Rong, Yunjia Zhao, Lan Yang, Jian Chang, Honggang Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Southwestern University of Finance and Economics(西南财经大学)

AI总结 TTSR通过测试时自我反思机制,利用学生与教师角色交替,持续改进大语言模型的推理能力。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00188 2026-08-27 cs.CV cs.AI cs.LG 版本更新

ST-Lite: Training-Free KV Cache Compression with Spatio-Trajectory Guidance for Long-Horizon GUI Agents

通过无训练KV缓存压缩实现高效的长周期GUI代理

Bowen Zhou, Zhou Xu, Wanli Li, Jingyu Xiao, Pingan Gan, Haoqian Wang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 ST-Lite通过无训练的KV缓存压缩方法,提升GUI代理的解码效率,实现2.45倍加速并保持性能优势。

Comments Accepted to Findings of EMNLP 2026. Camera-ready version. 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08603 2026-08-27 cs.AI 版本更新

OSCAR: Optimization-Steered Agentic Planning for Composed Image Retrieval

OSCAR:基于优化的代理规划用于组合图像检索

Teng Wang, Rong Shan, Jianghao Lin, Junjie Wu, Tianyi Xu, Jianping Zhang, Wenteng Chen, Changwang Zhang, Zhaoxiang Wang, Weinan Zhang, Jun Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 OSCAR通过优化引导的代理规划框架,提升组合图像检索的性能,仅用10%训练数据即超越现有最佳方法。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04632 2026-08-27 cs.CL cs.AI 版本更新

From National Curricula to Cultural Awareness: Constructing Open-Ended Culture-Specific Question Answering Dataset

从国家课程到文化意识:构建开放性文化特定问答数据集

Haneul Yoo, Won Ik Cho, Geunhye Kim, Jiyoon Han

机构 * KAIST AI Center(韩国国立科学技术院人工智能中心) Samsung Electronics(三星电子) Hankuk University of Foreign Studies(韩国外语大学)

AI总结 本文提出CuCu框架,利用国家课程构建文化特定的开放性问答数据集KCaQA,以提升语言模型在文化对齐方面的表现。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04424 2026-08-27 cs.CL 版本更新

Gavel: Agent Meets Checklist for Evaluating LLMs on Long-Context Legal Summarization

Gavel: 智能体结合检查表评估LLM长上下文法律摘要

Yao Dou, Benjamin Mamut, Wei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 提出Gavel框架,通过参考评估和免参考智能体评估12个前沿LLM在多文档法律摘要中的表现,发现模型易遗漏关键信息而非幻觉,且性能随案件长度增加而下降。

Comments Accepted at EMNLP 2026 Main; webpage at https://yao-dou.github.io/gavel/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03542 2026-08-27 cs.CL cs.AI 版本更新

Layer-Order Inversion: Rethinking Latent Multi-Hop Reasoning in Large Language Models

层序倒置:重新思考大语言模型中的潜在多跳推理

Xukai Liu, Ye Liu, Jipeng Zhang, Yanghai Zhang, Kai Zhang, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出"层序倒置"现象,通过概率性回忆与提取框架解释大语言模型中多跳推理的机制,揭示了层序倒置与总跳步数的关系,并提供了多跳失败的诊断方法。

Comments 16 pages, 18 figures, EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08873 2026-08-27 cs.AI 版本更新

UCO: A Multi-Turn Interactive Reinforcement Learning Method for Adaptive Teaching with Large Language Models

UCO:一种用于基于大语言模型的自适应教学的多轮交互强化学习方法

Shouang Wei, Min Zhang, Xin Lin, Bo Jiang, Kun Kuang, Jingyuan Chen, Zhongxiang Dai

机构 * East China Normal University(东华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 UCO通过多轮交互强化学习方法,利用进展奖励和支架奖励函数,提升大语言模型在教育场景中的自适应教学能力。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01446 2026-08-27 cs.CL cs.LG 版本更新

iFlip: Iterative Feedback-driven Counterfactual Example Refinement

iFlip: 迭代反馈驱动的反事实示例精炼

Yilong Wang, Qianli Wang, Nils Feldhus

AI总结 iFlip通过迭代反馈驱动的方法生成有效反事实示例,提升模型性能和鲁棒性。

Comments Camera-ready version accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00282 2026-08-27 cs.CL cs.AI cs.LG 版本更新

Can Large Language Models Still Explain Themselves? Investigating the Impact of Quantization on Self-Explanations

大语言模型还能自我解释吗?探讨量化对自我解释的影响

Qianli Wang, Nils Feldhus, Pepa Atanasova, Fedor Splitt, Simon Ostermann, Sebastian Möller, Vera Schmitt

机构 * Quality and Usability Lab, Technische Universität Berlin(柏林技术大学质量与可用性实验室) University of Copenhagen(哥本哈根大学) Saarland Informatics Campus(萨尔州信息学校园) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Centre for European Research in Trusted AI (CERTAIN)(可信AI欧洲研究中心) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究院)

AI总结 研究探讨量化对大语言模型自我解释质量及可信度的影响,发现量化会导致中等程度的下降,但不影响其作为压缩技术的有效性。

Comments EMNLP 2026 Findings; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14069 2026-08-27 cs.AI 版本更新

RADAR: Accelerate Large Language Model Inference With RL-Based Dynamic Draft Trees

RADAR: 通过基于强化学习的动态草稿树加速大语言模型推理

Junjie Ma, Jinlong Li, Jiajun Luo

机构 * School of Computer Science(计算机科学学院) University of Science and Technology of China(中国科学技术大学)

AI总结 RADAR通过基于强化学习的动态草稿树方法,有效提升大语言模型推理速度,实现3.17至4.82倍的加速效果。

Comments EMNLP 2026 Findings Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05393 2026-08-27 cs.CV 版本更新

PreResQ-R1: Response-Preference Disentangled Ranking-and-Scoring Reinforcement Optimization for Robust Visual Quality Assessment

PreResQ-R1:用于鲁棒视觉质量评估的响应偏好解耦排序与评分强化优化

Zehui Feng, Weichuan Wang, Xiaohan Chen, Ting Han

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 本文提出PreResQ-R1框架,通过解耦响应偏好的强化学习统一评分与排序目标,结合GRPO优化,在IQA和VQA基准上取得最优结果,推理轨迹更贴合人类感知。

Comments 27 pages, 16 figures, Accepted as EMNLP 2026 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22733 2026-08-27 cs.CL cs.AI cs.IR 版本更新

E2Rank: Unifying Text Embedding and Listwise Reranking for Effective and Efficient Search

E2Rank:统一文本嵌入与列表式重排序以实现高效且有效的搜索

Qi Liu, Yanzhao Zhang, Mingxin Li, Dingkun Long, Pengjun Xie, Jiaxin Mao

机构 * Renmin University of China(中国人民大学) Alibaba Group(阿里巴巴集团)

AI总结 E2Rank是统一文本嵌入与列表式重排序的框架,通过将列表式提示视为伪相关反馈查询,在单一模型内实现高效检索与重排序,在BEIR等基准上性能优异且延迟更低。

Comments Accepted by EMNLP 2026 main conference. Code and models are avaliable at https://alibaba-nlp.github.io/E2Rank

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22775 2026-08-27 cs.CL cs.SE 版本更新

Scalable Supervision for Software Agents via Patch Reasoning

基于补丁推理的软件智能体可扩展监督

Junjielong Xu, Boyin Tan, Xiaoyuan Liu, Chao Peng, Pengfei Gao, Pinjia He

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) ByteDance(字节跳动)

AI总结 针对现有基于测试的软件智能体监督可扩展性不足的问题,提出R4P推理方法,在SWE-bench补丁验证中准确率达72.2%,训练的Mini-SE在Pass@1上较Qwen3-32B提升10.0%至26.2%。

Comments EMNLP'26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12899 2026-08-27 cs.CL 版本更新

EduDial: Constructing a Large-scale Multi-turn Teacher-Student Dialogue Corpus

EduDial:构建大规模多轮师生对话语料库

Shouang Wei, Min Zhang, Xin Lin, Bo Jiang, Zhongxiang Dai, Kun Kuang

机构 * East China Normal University(华东师范大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本研究构建了大规模师生对话语料库EduDial,开发了EduDial-LLM 32B及11维教学能力评估框架,实验显示该模型在主流LLMs中表现最优。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06346 2026-08-27 cs.LG cs.AI 版本更新

Ban&Pick: Enhancing Performance and Efficiency of MoE-LLMs via Smarter Routing

Ban&Pick:通过更智能的路由提升MoE-LLM的性能与效率

Yuanteng Chen, Peisong Wang, Yuantian Shao, Nanxin Zeng, Chang Xu, Jian Cheng

机构 * Nanjing University of Science and Technology(南京理工大学) C 2 \text{C}^{2} DL, Institute of Automation, Chinese Academy of Sciences(C2 DL,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Computer Science, University of Sydney(悉尼大学计算机学院)

AI总结 本研究针对MoE-LLM预训练路由的问题,提出即插即用的Ban&Pick策略,通过Pick强化关键专家、Ban修剪冗余专家,在不重新训练或改架构的情况下提升MoE-LLM性能并加速推理。

Comments 26 pages, 13 figures

Journal ref The 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21269 2026-08-27 cs.CL 版本更新

LLMTrace: A Corpus for Classification and Fine-Grained Localization of AI-Written Text

LLMTrace:用于AI生成文本分类与细粒度定位的语料库

Irina Tolstykh, Aleksandra Tsybina, Sergey Yakubson, Maksim Kuprashevich

机构 * Department of R&D, SALUTEDEV LLC(研发部,SALUTEDEV LLC)

AI总结 针对AI文本检测领域缺乏合适训练数据的问题,本文构建了双语语料库LLMTrace,支持全文二元分类与AI生成区间检测,可用于训练评估更精细的AI检测模型。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21054 2026-08-27 cs.AI cs.CL 版本更新

Reasoning or Rambling? Exploring the Effect of Thinking on Agent Persuasion

推理还是漫谈?探究思考过程对智能体说服能力的影响

Haodong Zhao, Jidong Li, Zhaomin Wu, Tianjie Ju, Zhuosheng Zhang, Bingsheng He, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) National University of Singapore(新加坡国立大学) Inner Mongolia Research Institute, Shanghai Jiao Tong University(上海交通大学内蒙古研究院)

AI总结 本文对比通用LLM与LRM,发现推理对智能体说服能力存在二元性影响,还揭示其依赖表面线索的漏洞,提出提示级对抗性论点检测方法以提升鲁棒性。

Comments Accepted as EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00559 2026-08-27 cs.CL cs.AI

Polish-English medical knowledge transfer: A new benchmark and results

Łukasz Grzybowski, Jakub Pokrywka, Michał Ciesiółka, Jeremi I. Kaczmarek, Marek Kubis

机构 * Adam Mickiewicz University(亚当·密茨凯维奇大学) Poznan University of Medical Sciences(波兹南医科大学)

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pp. 9042-9063, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏