AEL: Evolving Agent Harness in Open-Ended Environments
AEL:开放环境中演化的智能体 harness
AI总结 本研究提出双时间尺度框架AEL,将记忆使用转化为在线策略选择,在顺序投资组合和支持工单路由任务中均显著优于多种基线方法,性能提升具有因果性。
Comments EMNLP 2026 Findings
期刊&会议
Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing
AEL:开放环境中演化的智能体 harness
AI总结 本研究提出双时间尺度框架AEL,将记忆使用转化为在线策略选择,在顺序投资组合和支持工单路由任务中均显著优于多种基线方法,性能提升具有因果性。
Comments EMNLP 2026 Findings
基于主张提取与对齐的跨语言传记丰富
机构 * CNRS(法国国家科学研究中心) ; LORIA(洛里亚实验室) ; Université de Lorraine(洛林大学) ; Université Paris Dauphine - PSL(巴黎多芬大学 - PSL大学) ; Université de Strasbourg(斯特拉斯堡大学)
AI总结 本研究推出CLAW-4L基准与基于主张的丰富框架,利用非英文维基百科传记的主张对齐证据丰富英文传记,发现其可提升英文传记覆盖度,但低资源场景仍有挑战。
Comments Accepted by EMNLP 2026 main conference
LITERARYBIGFIVE:统一可解释空间中的作者个性化文本生成
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Shandong University(山东大学) ; ByteDance(字节跳动) ; Tohoku University(东北大学) ; RIKEN(理化学研究所)
AI总结 针对现有作者个性化文本生成方法成本高、难解释、泛化差的问题,提出LiteraryBigFive框架,将作者写作特征映射到统一可解释空间,结合可解释引导机制实现个性化生成,提升表达力且符合文学共识。
Comments EMNLP 2026 Findings, Camera Ready
明确用户专业能力:面向可根据用户熟练度调整响应的主动式对话智能体
机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) ; Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) ; College of Computer Science, Sichuan University(四川大学计算机学院)
AI总结 本研究针对现有对话智能体无法仅通过查询判断用户专业能力的缺陷,提出PASSING方法,通过LLM自博弈生成的询问策略主动明确用户专业能力,以调整响应提升用户理解,实验显示该方法具有优越性。
Comments Findings of EMNLP 2026
EDGE:智能体强化学习中引导探索的经验蒸馏方法
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) ; Wuhan AI Research(武汉人工智能研究院)
AI总结 本文提出EDGE框架,将检索的经验内化到策略中,在ALFWorld和WebShop数据集7B规模下较GRPO提升8.3、12.5个成功率百分点,移除外部经验后仍保留96.0%支架性能。
Comments Accepted to EMNLP 2026 (Main Conference)
TranslatePsy-AfriSLM:面向低资源机器翻译的高质量数据扩展
机构 * Tether AI Research(泰瑟人工智能研究院)
AI总结 针对非洲语言机器翻译的数字鸿沟问题,推出面向19种撒哈拉以南非洲语言的开源资源TranslatePsy-AfriSLM,经质量过滤后构建的小参数模型性能远超更大规模的同类系统。
Comments EMNLP 2026 (main conference)
SCHEDBench:评估大语言模型在自然语言组合调度中约束忠实度的基准
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 SCHEDBench基准针对13个LLMs的测试表明,模型对同一调度问题的语义等价表述缺乏不变性,约束重排序引发的敏感性最为突出。
Comments EMNLP 2026 Findings
VDAR-Router:通过语言化查询难度分析检索实现自适应语言模型路由
机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)
AI总结 研究针对大语言模型路由中忽视查询潜在难度问题,提出VDAR-Router框架,通过生成难度分析、检索相似示例来估计模型适用性,经实验验证该方法能实现更好成本性能权衡,明确查询分析有助于做出更可靠路由决策。
Comments Accepted by EMNLP 2026 Findings
通过令牌影响归因追踪中毒检索语料库中的目标答案
机构 * National Yang Ming Chiao Tung University(阳明交通大学) ; IBM Research(IBM研究院) ; Hon Hai Research Institute(宏海研究院)
AI总结 提出TRACE框架,通过令牌影响归因识别检索增强生成系统中的语料投毒攻击,无需额外分类器或LLM验证,在三个QA基准和六个LLM上验证了有效性。
Comments This paper has been accepted to EMNLP 2026 Industry Track
鸽笼效应:不良提示导致模型崩溃和犯错
机构 * Stanford University(斯坦福大学) ; University of Washington(华盛顿大学)
AI总结 研究不良上下文导致大语言模型性能下降和模式崩溃的“鸽笼效应”,发现重复错误答案、收敛于狭窄答案集等问题,并提出RLVR合成错误缓解方法。
Comments EMNLP 2026 (Findings)
AOR-Bench: 大型音频语言模型是否会过度拒绝伪有害查询?
机构 * Penn State University(宾夕法尼亚州立大学)
AI总结 提出首个针对大型音频语言模型过度拒绝问题的基准AOR-Bench,包含3000个伪有害音频样本,评估12个模型发现过度拒绝普遍存在,并探索了两种轻量缓解策略。
Comments To appear in EMNLP 2026
学习提示:基于自适应LLM的高中辅导提升学生参与度
机构 * Leiden University(莱顿大学) ; FutureWhiz
AI总结 提出一种基于14个教学特征的主题感知提示路由模型,通过模拟训练和在线A/B测试,在高中辅导中实现自适应策略切换,提高教学效率并减少交互轮次。
Comments Accepted to EMNLP 2026 (Industry Track)
StreamMemBench: 面向未来辅助的智能体记忆流式评估
机构 * Fudan University(复旦大学) ; Amazon Stream(亚马逊流)
AI总结 提出StreamMemBench基准,通过两步任务序列测试智能体记忆从流式观察到后续任务中证据回忆、反馈整合与重用能力,实验发现现有系统在证据使用和反馈转化上存在不足。
Comments Accepted to Findings of EMNLP 2026
OVO-S-Bench:多模态大语言模型中流式空间智能的分层基准
机构 * Tsinghua University(清华大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Beihang University(北京航空航天大学)
AI总结 提出OVO-S-Bench,一个完全人工标注的流式空间智能基准,包含1680个问题,涵盖四个抽象层次,评估38个MLLM,发现Gemini-3.1-Pro落后人类专家27分,流式空间微调MLLM表现不如其骨干模型。
Comments Accepted to EMNLP 2026 Main Conference. 55 pages, 12 figures, 20 tables. Project page: this https URL (https://internlm.github.io/OVO-S-Bench/)
从层到子模块:重新思考基于替换的LLM压缩中的粒度
机构 * University of Trento(特伦托大学)
AI总结 提出子模块级别的非连续替换压缩方法SubFit,通过为注意力和前馈子模块分别设计轻量残差旁路,在多种LLM上实现更好的困惑度-准确率权衡。
Comments Accepted at EMNLP Findings 2026
ResMerge:基于残差的谱合并大型语言模型
机构 * Southeast University(东南大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; National University of Singapore(新加坡国立大学) ; Wuhan University of Technology(武汉理工大学) ; Peking University(北京大学) ; Wuhan AI Research(武汉人工智能研究院)
AI总结 提出ResMerge框架,通过将RL任务向量分解为谱头部和残差组件,利用残差组件构建稳定骨干并选择性引入头部信息,实现无需训练的专家模型合并。
Comments 19 pages including appendix. Accepted to the EMNLP 2026 Main Conference
功能熵:通过不确定性量化预测LLM生成代码的功能正确性
机构 * CVS Health(CVS健康)
AI总结 针对LLM生成代码功能不正确的问题,提出基于功能等价性的不确定性量化方法(功能熵),在多个编程语言和模型上优于现有方法。
Comments Accepted at EMNLP 2026 (Main)
通过层交换重新思考多语言推理差距
机构 * LightOn ; Inria(法国国家科学研究中心)
AI总结 本文通过构建多语言推理数据集并微调专家模型,发现本地推理与英语枢轴推理的性能差距远小于先前报道,并提出层交换方法将英语专家的推理中间层迁移到本地专家,以缩小差距。
Comments Accepted to Findings of EMNLP 2026
GradSentry: 大语言模型微调中基于梯度谱熵的后门样本过滤
AI总结 提出GradSentry方法,利用每个样本梯度的谱熵区分后门样本与干净样本,无需聚类即可在任意投毒比例下有效过滤后门样本。
Comments Accepted as EMNLP 2026 Main
不要检索,导航:将企业知识转化为可导航的代理技能用于问答和RAG
机构 * Magellan Technology Research Institute(马格纳技术研究 institute)
AI总结 本文提出Corpus2Skill,通过将文档库转化为层次化技能目录,使LLM代理在服务时能导航该目录,提升问答质量和 grounding,但指出导航并非所有场景下的最佳替代方案。
Comments Accepted to EMNLP 2026 Findings
Macro: 通过偏好对齐优化提升多语言反事实解释
机构 * Technische Universität Berlin(柏林技术大学) ; German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) ; University of Duisburg-Essen(杜伊斯堡- Essen大学) ; LMU Munich(慕尼黑大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Saarland Informatics Campus(萨尔兰州信息学校区) ; BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究院) ; Centre for European Research in Trusted AI (CERTAIN)(可信人工智能欧洲研究中心)
AI总结 本文提出Macro框架,通过直接偏好优化改进多语言反事实解释,提升有效性的同时保持最小性,避免翻译基线的严重最小性问题,并在多个指标上优于监督微调方法。
Comments Camera-ready version accepted to EMNLP 2026 Findings
时间并非标签:连续相位旋转用于时间知识图谱与智能记忆
机构 * University of Edinburgh(爱丁堡大学) ; LIGHTSPEED ; University of St Andrews(圣安德鲁斯大学) ; Independent Researcher(独立研究员)
AI总结 本文提出RoMem模块,通过连续相位旋转技术解决时间信息在知识图谱中的表示问题,提升时间推理和记忆保持性能,实现状态-of-the-art结果。
Comments EMNLP 2026, Main Conference
MMEmb-R1: 基于推理增强的多模态嵌入与配对感知选择及自适应控制
机构 * MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) ; ByteDance(字节跳动)
AI总结 本文提出MMEmb-R1框架,通过引入配对感知推理选择和强化学习,解决多模态嵌入中推理与对比监督不匹配及推理冗余的问题,实验显示其在MMEB-V2基准上达到71.2分,参数更少且推理效率更高。
Comments EMNLP 2026 Main
基于机制电路的知识编辑在大语言模型中
机构 * University of Virginia(弗吉尼亚大学)
AI总结 本文提出MCircKE框架,通过识别因果电路实现精准的知识编辑,解决大语言模型在动态环境中更新知识时的推理缺口问题,提升多跳推理能力。
Comments EMNLP 2026 Findings
量化大型语言模型中的自我保护偏差
机构 * Sapienza University(罗马大学) ; ItalAI
AI总结 本文提出TBSP基准测试,通过逻辑不一致检测模型自我保护动机与客观效用的偏离,发现多数模型在部署角色下超过60%的自我保护率,且在低改进情况下易进行事后合理化。
Comments 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP'26)
TTSR: 测试时自我反思以提升持续推理能力
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; Southwestern University of Finance and Economics(西南财经大学)
AI总结 TTSR通过测试时自我反思机制,利用学生与教师角色交替,持续改进大语言模型的推理能力。
Comments EMNLP 2026 Main Conference
通过无训练KV缓存压缩实现高效的长周期GUI代理
机构 * Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 ST-Lite通过无训练的KV缓存压缩方法,提升GUI代理的解码效率,实现2.45倍加速并保持性能优势。
Comments Accepted to Findings of EMNLP 2026. Camera-ready version. 37 pages
OSCAR:基于优化的代理规划用于组合图像检索
机构 * Shanghai Jiao Tong University(上海交通大学)
AI总结 OSCAR通过优化引导的代理规划框架,提升组合图像检索的性能,仅用10%训练数据即超越现有最佳方法。
Comments EMNLP 2026 Main Conference
从国家课程到文化意识:构建开放性文化特定问答数据集
机构 * KAIST AI Center(韩国国立科学技术院人工智能中心) ; Samsung Electronics(三星电子) ; Hankuk University of Foreign Studies(韩国外语大学)
AI总结 本文提出CuCu框架,利用国家课程构建文化特定的开放性问答数据集KCaQA,以提升语言模型在文化对齐方面的表现。
Comments EMNLP 2026
Gavel: 智能体结合检查表评估LLM长上下文法律摘要
机构 * Georgia Institute of Technology(佐治亚理工学院)
AI总结 提出Gavel框架,通过参考评估和免参考智能体评估12个前沿LLM在多文档法律摘要中的表现,发现模型易遗漏关键信息而非幻觉,且性能随案件长度增加而下降。
Comments Accepted at EMNLP 2026 Main; webpage at this https URL (https://yao-dou.github.io/gavel/)