Cross-lingual Representation Learning via Centroid Intervention Fusion
基于质心干预融合的跨语言表示学习
机构 * KU Leuven(鲁汶大学)
AI总结 本文针对大语言模型跨语言性能不均的问题,提出CIF框架整合多语言干预投影,在四类基准测试中提升了跨语言性能,尤其优化了低资源语言表现。
Comments EMNLP 2026 (Main)
期刊&会议
Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing
基于质心干预融合的跨语言表示学习
机构 * KU Leuven(鲁汶大学)
AI总结 本文针对大语言模型跨语言性能不均的问题,提出CIF框架整合多语言干预投影,在四类基准测试中提升了跨语言性能,尤其优化了低资源语言表现。
Comments EMNLP 2026 (Main)
SKILL.state:可扩展的长程智能体技能
机构 * Google LLC(谷歌公司) ; Purdue University(普渡大学)
AI总结 针对现有智能体运行时的长程延迟与上下文污染问题,提出SKILL.state架构,用显式可变执行状态替代追加式对话历史,提升任务准确率并降低令牌消耗。
Comments accepted at EMNLP
面向时间序列的大语言模型(LLM)智能体:一项综述
机构 * Northwestern University(西北大学) ; Datadog AI Research(Datadog人工智能研究院) ; Nokia(诺基亚)
AI总结 本综述针对LLM智能体在时间序列问题上设计差异大的问题,采用问题驱动分类法梳理现有系统,分析任务对架构等的影响,对比模型性能,为相关设计提供指南并指出未来缺口。
Comments Accepted to Findings of EMNLP 2026
用QLoRA学习新事实:获取-保留前沿
机构 * LORIA, CNRS(洛林信息学与应用实验室,法国国家科学研究中心) ; Alcatel-Lucent Enterprise(阿尔卡特朗讯企业通信)
AI总结 该研究以Qwen3-4B为对象,对比FFT与不同秩的QLoRA,发现秩会形成事实获取与保留的前沿,该效应在需安装新事实关联时更显著。
Comments accepted EMNLP 2026 Findings
DataKernelBench:大语言模型能否在GPU上优化数据库查询?
机构 * IBM Research(IBM研究院) ; TU Wien(维也纳技术大学)
AI总结 本文提出DataKernelBench基准,评估LLM在GPU上优化数据库查询内核的能力,实验显示最强模型配置在TPC-H数据集上实现2.11倍加速,工作负载上下文对性能影响大于硬件上下文。
Comments Accepted at EMNLP 2026
基础模型的无监督后训练:一项综述
机构 * HKUST(GZ)(香港科技大学(广州)) ; HKUST(香港科技大学) ; Xiaohongshu Inc.(小红书公司) ; WeChat, Tencent(腾讯微信) ; CUHK(香港中文大学) ; AI Robotics(人工智能机器人)
AI总结 该综述梳理80种无监督后训练(UPT)方法,按更新信号来源分类,揭示内部信号与任务结构对UPT效果的影响,构建统一框架用于UPT的选择与评估。
Comments Accepted to Findings of EMNLP 2026. 20 pages, 3 figures, 8 tables
可检索但不可靠:检索增强生成中的攻击与防御研究综述
AI总结 本综述针对检索增强生成(RAG)的安全与鲁棒性问题,形式化其各阶段威胁模型,分类攻击目标并梳理各阶段防御及评估方法,为该领域提供统一研究框架。
Comments 24 pages, 6 figures. Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Peer-reviewed through ACL Rolling Review (ARR)
基于故障代码驱动的测试用例合成与密集奖励塑造的鲁棒代码强化学习
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团)
AI总结 该研究提出RobustTests框架,通过故障代码驱动的测试用例合成与密集奖励塑造,实现RL微调的Qwen3-32B在LiveCodeBench上较基线方法获绝对3%性能提升,增强了LLM代码生成能力。
Comments Accepted by EMNLP 2026
对齐中的语言链:跨语言排序偏好优化
机构 * Korea University(高丽大学)
AI总结 针对大语言模型对齐依赖英语偏好数据导致其他语言性能欠佳的问题,提出CRPO框架,通过层级结构联合优化语言内与跨语言偏好,在多语言实验中性能优于标准方法。
Comments EMNLP 2026 Main
九歌-推敲:一款面向古典诗词润色的可解释人机协作系统
机构 * Tsinghua University(清华大学) ; Beijing National Research Center For Information Science And Technology(北京信息科学与技术国家研究中心) ; Institute for Artificial Intelligence, Tsinghua University(清华大学人工智能国际研究院) ; Rixin College, Tsinghua University(清华大学日新书院) ; Department of Statistics and Data Science, Tsinghua University(清华大学统计与数据科学系) ; Jiangsu Normal University(江苏师范大学)
AI总结 针对现有AI诗词系统削弱用户创作能动性的问题,提出人机协作系统Jiuge-Tuiqiao,通过三元模型实现可控可解释的诗词润色,提升了创作相关性能。
Comments Accepted to the System Demonstrations Program at EMNLP 2026. Code and demo: this https URL (https://github.com/jiangli-va/Jiuge-Tuiqiao)
从惯性到客观性:通过噪声隔离改进深度研究智能体
机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) ; Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
AI总结 针对深度研究智能体存在的惯性偏差问题,提出NIS-Agent方法,在网页分类和最终答案验证环节应用上下文隔离,降低33%的token成本,训练的8B模型性能可与GPT-4o相当。
Comments EMNLP 2026 Main Conference
面向多模态学习的自适应层级表示联盟
AI总结 该研究针对多模态模型的语义粒度不匹配问题,提出自适应层级表示联盟框架,经六个基准实验验证,其性能优于强基线且在噪声、缺失模态场景下更鲁棒。
Comments This study has been accepted by EMNLP 2026 (Findings)
ExecRubrics:用于可验证且高效的长文本评估的可执行工具增强型评分标准
机构 * Emory University(埃默里大学) ; University of Waterloo(滑铁卢大学)
AI总结 ExecRubrics是将评分标准转化为可执行Python程序的框架,可替代黑盒LLM评判者,在三个长文本基准上实现与自然语言评分标准相当或更优的偏好准确率,且评估延迟降低最多320倍,提升了评估的可解释性与效率。
Comments Accepted to EMNLP 2026 Findings
SPAR-Hate:一种由审核员引导的用于双语仇恨言论解析的多智能体框架
机构 * Dalian University of Technology(大连理工大学) ; Inner Mongolia University(内蒙古大学)
AI总结 针对结构化仇恨言论解析的文化等挑战,提出SPAR-Hate多智能体框架,分解文档为决策单元后从三视角生成判断并仲裁,在基准上实现双语仇恨解析最优结果。
Comments 16 pages, 2 figures. Submitted to EMNLP 2026
VIG:作为多模态思维链压缩奖励信号的视觉信息增益
机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) ; Tsinghua University(清华大学)
AI总结 该研究提出VIG奖励机制,通过提升视觉信息密度优化多模态CoT的准确率与效率权衡,无需额外资源,在多类基准及不同规模模型上均有效。
Comments Accepted by EMNLP 2026 Findings
GUI-Primitives:诊断视觉-语言GUI定位中的空间推理失败
机构 * University of Southern California(南加州大学) ; USC Information Sciences Institute(南加州大学信息科学研究所) ; Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)
AI总结 本文提出GUI-Primitives基准,通过994个含7种空间关系的对比指令对,发现多数视觉-语言GUI定位模型的失败源于候选定位而非关系理解,且标记候选可提升准确率。
Comments Accepted to EMNLP 2026 Main Conference
超越端点增益:医学专业化的权重增量审计
机构 * IIT Kanpur(印度理工学院坎普尔分校) ; Oracle Health AI(甲骨文健康人工智能公司) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
AI总结 本研究提出配对权重增量路径审计方法,应用于两组通用模型到医学专业模型的检查点对,发现解码器更新与医学基准变动相关,但组件定位不清晰,明确审计仅针对纯文本多项选择题基准变动。
Comments Preprint: EMNLP 2026
仅知道两跳信息是不够:理解语言模型中的两跳泛化
机构 * Xi’an Jiaotong University(西安交通大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本研究针对语言模型两跳查询失败问题,在受控环境训练Transformer,揭示其泛化规律与跨层不匹配机制,提出循环式训练策略以提升分布外两跳泛化能力。
Comments EMNLP 2026, findings
CultureVidBench:文本到视频生成中的文化理解基准测试
机构 * Nanyang Technological University(南洋理工大学) ; Centrale Supélec(中央高等电力学院) ; Singapore Management University(新加坡管理大学) ; University of Cambridge(剑桥大学)
AI总结 本研究推出CultureVidBench基准,评估7款T2V模型的文化理解能力,发现现有模型难捕捉细粒度文化细节,尤其针对代表性不足的文化区域与线索。
Comments EMNLP 2026 Main Conference, Project page: this https URL (https://hanxjing.github.io/CultureVidBench/)
用于语言模型推理的选择性状态空间适应与检索
机构 * AI Virtual Assistant (AVA) Lab(人工智能虚拟助手(AVA)实验室) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 研究针对语言模型推理,提出一类含MaLoRA和MaRA的适配器,通过在令牌和上下文级别引入选择性状态空间递归实现适应,在多个冻结主干和推理基准上提升了推理准确性。
Comments Accepted to EMNLP 2026 (Main Conference). 22 pages, 5 figures, 20 tables. Code: this https URL (https://github.com/atahandokme/malora-mara)
PPE-Bench:用于评估公私纠缠下MLLM遗忘能力的基准测试
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; University of Sheffield(谢菲尔德大学)
AI总结 研究针对现有MLLM遗忘基准测试的局限性,提出PPE-Bench基准测试,包含公私纠缠图像,引入两种方法在遗忘中保护公共信息,实验发现现有方法能减少隐私泄露,但常损害相邻公共信息。
Comments to appear in EMNLP 2026
SHIFT: 通过索引侧特征变换实现多语言信息检索的语义对齐
机构 * Department of Computer Science and Engineering, Korea University(韩国大学计算机科学与工程系)
AI总结 提出SHIFT方法,在索引阶段通过平行翻译对估计相对语言向量并修正文档嵌入,以缓解多语言密集检索中的语言偏差,无需训练即可提升检索性能。
Comments EMNLP 2026 Findings
何时应分解查询?面向多条件检索的查询分解的阶段感知研究
AI总结 本文通过阶段感知实验发现,查询分解在初始检索阶段因语义稀释损害性能,但在重排序阶段通过细粒度约束验证显著提升效果,据此提出阶段感知分解框架,在初始检索保留整体查询,仅在重排序使用子查询,在MultiConIR和SSRB基准上一致提升组合查询的排序性能。
Comments Accepted to Findings of EMNLP 2026
摘要生成尚未消亡
机构 * Saarland University(萨尔大学) ; Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) ; University of Cambridge(剑桥大学) ; University of Edinburgh(爱丁堡大学) ; Zhejiang University(浙江大学) ; Tencent YouTu Lab(腾讯优图实验室)
AI总结 通过多维度评估,发现人类参考摘要在信息量和忠实度上仍优于大语言模型,后者仅在表面连贯性和流畅性上占优,表明摘要生成研究仍有挑战。
Comments EMNLP 2026 Main & Long Conference Paper
CRAM:面向多模态持续指令调优的质心路由与自适应MoE
机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) ; State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)
AI总结 提出CRAM方法,通过将任务特定模式隔离到独立模块、自适应秩实例化动态分配参数、质心路由激活现有专家以及正交惩罚约束更新方向,解决了多模态持续指令调优中任务竞争导致遗忘和参数效率低下的问题。
Comments Accepted to EMNLP 2026 (Main Conference). Code is available at [this URL]( this https URL (https://github.com/LAMDA-CL/EMNLP2026-CRAM) )
MIMO: 通过单语目标实现多语言信息检索
机构 * Department of Computer Science and Engineering, Korea University(韩国大学计算机科学与工程系)
AI总结 提出MIMO两阶段框架,利用教师模型的稳定英语语义空间,通过知识蒸馏和跨语言对比学习联合优化,解决多语言信息检索中语言聚类和嵌入对齐-均匀性权衡问题。
Comments EMNLP 2026 Main
MineExplorer: 评估MLLM智能体在Minecraft中的开放世界探索能力
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; Meituan(美团)
AI总结 提出MineExplorer基准,通过多智能体合成工作流构建隐式多跳任务,评估多模态大语言模型在Minecraft中的开放世界探索能力,发现长轨迹协调仍是挑战。
Comments Accepted at EMNLP 2026 (Main)
眼不见,心不烦:揭示基于潜在的多智能体系统中的潜在攻击
机构 * Southeast University(东南大学) ; Peking University(北京大学)
AI总结 研究潜在表示能否携带攻击信息,提出通过潜在干预激活攻击效果的框架,实验表明潜在攻击在清洁执行中显著降低任务性能,尤其影响智能体间KV缓存传递。
Comments Accepted to EMNLP 2026
NestedKV: 用于长上下文KV缓存压缩的嵌套内存路由
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Jimei University(集美大学)
AI总结 提出NestedKV方法,通过多时间尺度余弦异常评分和头自适应混合的免训练键缓存压缩,在长上下文任务中优于现有方法。
Comments EMNLP 2026 Main
频率至关重要:用于剪枝和量化的快速模型无关数据筛选
机构 * University of Trento(特伦托大学)
AI总结 提出一种基于Zipf幂律的模型无关数据筛选策略ZipCal,通过最大化词汇多样性来选择校准数据,在剪枝和量化中实现与依赖模型困惑度的最先进方法相当的性能,且速度快约240倍。
Comments Accepted as a Main Conference Paper at EMNLP 2026