AEL: Evolving Agent Harness in Open-Ended Environments
AEL:开放环境中演化的智能体 harness
AI总结 本研究提出双时间尺度框架AEL,将记忆使用转化为在线策略选择,在顺序投资组合和支持工单路由任务中均显著优于多种基线方法,性能提升具有因果性。
Comments EMNLP 2026 Findings
期刊&会议
Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing
AEL:开放环境中演化的智能体 harness
AI总结 本研究提出双时间尺度框架AEL,将记忆使用转化为在线策略选择,在顺序投资组合和支持工单路由任务中均显著优于多种基线方法,性能提升具有因果性。
Comments EMNLP 2026 Findings
脆弱代码搜索:针对代码语言模型的可迁移攻击
AI总结 本文提出一种针对代码语言模型的可迁移对抗攻击,通过扰动代码标识符实现代码检索攻击,可使部分模型的MRR最高下降77%,凸显现有代码搜索方法的脆弱性。
Comments EMNLP Findings 26
AsymSpec:面向智能体大语言模型的上下文非对称投机解码
机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) ; University of Science and Technology of China(中国科学技术大学)
AI总结 AsymSpec是面向智能体大语言模型的非对称投机解码框架,通过轻量级草稿读全输入、大型验证模型用压缩视图,实现近90%完整上下文准确率,获1.3-1.7倍吞吐量加速且计算成本仅0.2-0.3倍。
Comments EMNLP Main Conference 2026
ProgRouter:面向质量-成本权衡的多智能体大语言模型工作流的在线进度引导编排
机构 * Aston University(阿斯顿大学) ; Queen Mary University of London(伦敦玛丽女王大学) ; University of Exeter(埃克塞特大学)
AI总结 ProgRouter是一种在线进度引导路由框架,通过多视图任务进度评分器等机制,在多智能体LLM工作流中平衡任务质量与时间、成本预算,在多类任务数据集上较基线降低运营成本且保持性能。
Comments Accepted in Findings of the Association for Computational Linguistics: EMNLP 2026. Index Terms: Collaborative agentic workflows, LLM agent orchestration, Quality-cost trade-off, Task progress prediction, Online decision-making
XREPOTEST:面向大语言模型的多语言仓库级单元测试生成基准测试
AI总结 本文提出XREPOTEST多语言仓库级单元测试生成基准,针对5种少用语言,结合多上下文策略,用14种LLM实验发现独立与仓库级性能差距,为推进现实场景单元测试生成提供支撑。
Comments Accepted to EMNLP Main 2026
一种实现跨语言迁移的统一形式:超越原生正字法的多语言语言模型预训练
机构 * Ohio State University(俄亥俄州立大学) ; University of Washington(华盛顿大学)
AI总结 本文通过系统对比三种输入表示,发现罗马化预训练可实现最强跨语言迁移,且优势随模型规模增大而扩大,提出多语言模型应将罗马化作为预训练核心设计选择的结论。
Comments EMNLP 2026 (Main Conference). 9 pages, 6 figures (plus appendix)
从被动响应到主动修正:增强大语言模型(LLM)对输入事实扰动的鲁棒性
机构 * Renmin University of China(中国人民大学) ; Southeast University(东南大学) ; Zhejiang University(浙江大学)
AI总结 针对LLM易受输入事实误导产生错误响应的问题,提出三阶段框架DEDUCE,结合新数据集与指标,在多基准上提升了Qwen、LLaMA等系列模型的鲁棒性与错误修正能力。
Comments Accepted to the Main Conference of EMNLP 2026
在推理阶段解锁多模态蛋白质语言模型
AI总结 本文建立三阶段研究框架,在不更新多模态蛋白质语言模型参数的前提下,通过优化推理阶段采样策略,揭示默认推理协议的次优性并提升其任务性能,得出与现有共识不同的基础模型相关结论。
Comments Accepted to EMNLP 2026 Main Conference
LLM判断的“先定位后决策”保证
机构 * University of Exeter(埃克塞特大学) ; Cardiff University(卡迪夫大学) ; University of the West of England(西英格兰大学) ; University of Macau(澳门大学)
AI总结 针对LLM作为评估者时候选响应增多导致置信度假设失效的问题,提出“先定位后决策”框架,结合共形预测与校准规则,提升保证成功率与覆盖率。
Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Code: https://github.com/llm2409/Localize-Then-Decide
用QLoRA学习新事实:获取-保留前沿
机构 * LORIA, CNRS(洛林信息学与应用实验室,法国国家科学研究中心) ; Alcatel-Lucent Enterprise(阿尔卡特朗讯企业通信)
AI总结 该研究以Qwen3-4B为对象,对比FFT与不同秩的QLoRA,发现秩会形成事实获取与保留的前沿,该效应在需安装新事实关联时更显著。
Comments accepted EMNLP 2026 Findings
SHROOM-Visions 2026概览:大型视觉语言模型幻觉检测共享任务
机构 * University of Helsinki(赫尔辛基大学) ; Politecnico di Torino(都灵理工大学) ; Université Bretagne Sud(南布列塔尼大学) ; University of Copenhagen(哥本哈根大学) ; University Grenoble Alpes(格勒诺布尔阿尔卑斯大学) ; University of Lorraine(洛林大学)
AI总结 本文介绍了2026年在EMNLP 2026同期举办的SHROOM-Visions共享任务,该任务针对大型视觉语言模型的幻觉检测,依托SHEEP数据集开展,吸引27支团队提交600余个系统,最优系统较基线提升30-40个百分点。
Comments To appear at UncertaiNLP 2026 @ EMNLP 2026
Think-Probe-Respond:提升大型语言模型作为研究创意新颖性评判者的能力
机构 * National Institute of Informatics(情报研究综合研究所) ; TU Dresden(德累斯顿工业大学) ; ScaDS.AI Dresden/Leipzig(德累斯顿/莱比锡应用数据科学中心)
AI总结 该研究针对大型语言模型评判研究创意新颖性时的“中等新颖”偏差,提出TPR轻量方法,通过探测推理阶段隐藏状态的潜在评判约束最终响应,使性能提升22.30%。
Comments Accepted to EMNLP 2026 (Findings)
重构正确的会话片段:超越长上下文的交错式对话记忆评估
机构 * University of California San Diego(加利福尼亚大学圣迭戈分校)
AI总结 针对混合主题长对话的记忆难题,研究人员构建了SCALE-QA基准,并提出TSIM方法,在三类LLM后端上均比最强基线提升5.6-17.6个准确率点,实现最优表现。
Comments 19 pages, 6 figures, 30 tables. Accepted to the Main Conference of EMNLP 2026
RetrievalRouter:面向文档检索的联合模态与架构选择
AI总结 RetrievalRouter是一种轻量级查询感知路由模型,仅从查询文本为每个文档检索任务匹配合适流程,在金融、科学语料库基准测试中,其准确率较最佳静态基准高2.5%、速度快12.4倍,且优于现有自适应策略选择方法。
Comments Accepted at EMNLP 2026
可核查的方案:基于验证器的可执行视频编辑开放权重规划器学习
机构 * School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院) ; vivo AI Lab(vivo AI实验室) ; University of the Chinese Academy of Sciences(中国科学院大学) ; Southeast University(东南大学) ; Peking University(北京大学) ; School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) ; Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来智能网络研究院) ; Guangdong Provincial Key Laboratory of Future Networks of Intelligence, CUHK-Shenzhen(香港中文大学(深圳)广东省未来智能网络重点实验室)
AI总结 针对可执行视频编辑规划问题,提出基于验证器的RefineCut及RefineCut-Evo方法,训练8B开放权重规划器,在基准上取得优于前沿模型的效果,代码与基准已公开。
Comments Accepted to the Main Conference of EMNLP '26
AWM:面向长文档VLM智能体的可回答工作记忆
机构 * University of Oslo(奥斯陆大学) ; Bosch Center for AI(博世人工智能中心) ; University of Stuttgart(斯图加特大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Tsinghua University(清华大学)
AI总结 针对长文档VQA智能体的记忆质量盲区,提出AWM方法,通过融入仅记忆可回答性的GRPO奖励机制,提升了最终答案准确率并降低记忆缺失正确的比例。
Comments EMNLP 2026 Findings. 16 pages, 4 figures, 9 tables
MLLMCLIP:面向鲁棒视觉-语言表征的多模态大语言模型(MLLM)特征级蒸馏
机构 * KAIST(韩国科学技术院) ; Sony Group Corporation(索尼集团公司)
AI总结 MLLMCLIP是一种异构特征级蒸馏框架,直接将MLLM的多模态知识迁移至CLIP,在组合性任务和通用视觉-语言任务上均实现最优性能。
Comments EMNLP 2026 Main Conference
EgoArgus:将视觉语言模型(VLM)作为模态接地用户支持情境助手的基准测试
机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)
AI总结 研究针对当前VLMs作为日常助手的模态仲裁难题,构建人工标注数据集EgoArgus,发现现有VLMs仍难胜任该任务,且现有偏差缓解方法效果有限,为部署提供了参考。
Comments Accepted by EMNLP 2026 main conference
PonsRAG:受脑桥启发的RAG,用于连接认知孤岛以实现协调的长文本推理
机构 * School of Future Technology, South China University of Technology(华南理工大学未来技术学院) ; TikTok Inc(字节跳动公司) ; School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) ; School of Software Engineering, Sun Yat-sen University(中山大学软件工程学院)
AI总结 针对现有RAG方法的认知孤岛化与跨层证据脱节问题,提出受脑桥启发的PonsRAG框架,通过三层索引与协调推理组件,在四项长文本叙事基准上实现多项选择任务平均准确率11.56%的相对提升。
Comments Accepted to EMNLP 2026 (Main Conference)
距离并不足够:遗忘-保留对齐间隙可预测大语言模型的再学习鲁棒性
机构 * The University of Tokyo(东京大学) ; KAIST(韩国科学技术院)
AI总结 该研究提出FRAG预测器,基于权重选择性而非距离,结合FRP方法提升LLM再学习鲁棒性,揭示权重选择性对鲁棒性的解释力优于单独距离。
Comments Accepted to EMNLP 2026 Main Conference
OmniPhys:面向中文教育语料库的物理理解与生成统一多模态基准
机构 * East China Normal University(华东师范大学)
AI总结 研究人员推出OmniPhys这一覆盖中文教育语料库中中学至大学物理问题的大规模多模态基准,含15246个问题与19850张图像,可评估MLLMs的物理理解、推理及结构化图表生成能力,发现当前模型存在复杂推理与视觉生成差距,将推进物理领域多模态智能发展。
Comments Accepted to Findings of EMNLP 2026
GGSS:用于生成式视觉语言模型推理时去偏的测地线门控球面引导
AI总结 本研究提出GGSS方法,针对生成式VLMs设计推理时去偏方案,经实验验证其在降低人口统计学偏见的同时,能较好保留模型通用视觉语言能力。
Comments Accepted to EMNLP 2026
GUIDE:基于语音与视觉共享ID编码的生成式无监督中文查询纠错方法
机构 * Kuaishou Technology(快手科技) ; School of Data Science, Fudan University(复旦大学数据科学学院)
AI总结 本文针对中文查询纠错中监督方法维护成本高、无监督方法易意图偏移的问题,提出基于语音与视觉共享ID编码的生成式无监督框架GUIDE,在公开与真实数据集上均优于基线,线上测试也验证了其有效性。
Comments Accepted to EMNLP 2026 Industry Track; 7 pages, 3 figures, 8 tables
学习共享与个性化内容:面向智能体记忆的分层策略协同进化
机构 * University of Science and Technology of China(中国科学技术大学) ; State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)
AI总结 本研究提出HiPS框架,将智能体记忆管理解耦为全局共享基础与用户特定自适应层,通过协同进化优化策略,使记忆增强智能体的响应性能持续优于基线方法。
Comments EMNLP'2026 Main Conference
路由图交接:多智能体大语言模型委派的自适应格式选择
机构 * Amazon(亚马逊)
AI总结 本研究针对多智能体 LLM 协调的高 token 开销问题,提出路由图交接方法,通过轻量级 LLM 路由器在图与自然语言间自适应选择,在多基准测试中实现性能提升或持平,且开销极低。
Comments Accepted in EMNLP 2026
土拨比特翻转攻击:通过比特翻转在混合专家大语言模型中植入无限生成循环
机构 * Louisiana State University(路易斯安那州立大学) ; Northeastern University(东北大学) ; Zhejiang University(浙江大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; Southeast University(东南大学)
AI总结 本研究提出首个针对混合专家大语言模型的土拨比特翻转攻击,通过翻转路由层相关比特,可使平均输出膨胀率达5912%,揭示了MoE架构的鲁棒性漏洞。
Comments 9 pages, 3 figures; Accepted at EMNLP 2026
学习用于多目标对齐的Plackett-Luce模型混合
机构 * Northeastern University(东北大学) ; University of Michigan(密歇根大学)
AI总结 该研究针对异质偏好下多向排序的模型混合问题,提出MoPLEx算法,通过扩充排序并结合梯度估计与期望最大化,在偏好优化任务上显著优于基线方法。
Comments 19 pages; To appear in EMNLP 2026
公平可比?面向可比较的跨语言语言模型评估
机构 * Georgetown University(乔治城大学) ; EleutherAI
AI总结 该研究针对跨语言语言模型评估的可比性挑战,通过受控单语言模型和多语言LLM验证,发现常用归一化指标存在跨语言偏差,提出语义等价序列的句子级负对数似然更适合跨语言比较。
Comments EMNLP 2026
DataKernelBench:大语言模型能否在GPU上优化数据库查询?
机构 * IBM Research(IBM研究院) ; TU Wien(维也纳技术大学)
AI总结 本文提出DataKernelBench基准,评估LLM在GPU上优化数据库查询内核的能力,实验显示最强模型配置在TPC-H数据集上实现2.11倍加速,工作负载上下文对性能影响大于硬件上下文。
Comments Accepted at EMNLP 2026. Homepage: https://kerneldf.github.io/datakernelbench
Padamitra:基于 grounded 术语表生成的古典梵语研究
AI总结 该研究提出 grounded 术语表生成任务,构建含31316个三元组的梵语基准,发现指令微调及显式分词可提升性能,指出形态建模是梵词语法分解的关键瓶颈。
Comments Accepted in the Findings of EMNLP 2026