DUD: Decoupled Update Dynamics for Reliable Uncertainty Quantification in Large Language Models
DUD:用于大语言模型可靠不确定性量化的解耦更新动力学
AI总结 本研究针对大语言模型不确定性量化的传统方法缺陷,提出DUD框架通过因果干预解耦FFN与注意力的更新贡献,实验表明其在不确定性估计、校准及跨数据集泛化上均优于现有基线。
Comments ACL 2026 Main Conference
期刊&会议
Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing
DUD:用于大语言模型可靠不确定性量化的解耦更新动力学
AI总结 本研究针对大语言模型不确定性量化的传统方法缺陷,提出DUD框架通过因果干预解耦FFN与注意力的更新贡献,实验表明其在不确定性估计、校准及跨数据集泛化上均优于现有基线。
Comments ACL 2026 Main Conference
ARCHead:大语言模型输出头的激活度量残差修正
机构 * aiXplain, Inc.(aiXplain公司)
AI总结 ARCHead是一种LM-head压缩器,通过量化低秩核心、分组INT4残差及激活衍生低秩修正,将LM-head存储降3.7-3.9倍,在Qwen3-8B-Base上性能优于朴素INT4,可补充块量化器。
Comments 13 pages, 4 figures. Submitted to ACL Rolling Review (ARR). Code: https://github.com/suayptalha/archead
TabletCraft:通过双向阿卡德语神经机器翻译(NMT)与楔形文字渲染弥合4000年的文化鸿沟
机构 * University of Southern California(南加州大学) ; USC Viterbi School of Engineering(南加州大学维特比工程学院)
AI总结 TabletCraft是首个支持美索不达米亚文字双向交互的开源系统,整合ByT5翻译模型等组件,实现阿卡德语与英语双向翻译及楔形文字渲染,在阿卡德米亚验证集上取得反向翻译的首个定量结果。
Comments 5 pages, 1 figure. Accepted to C3NLP @ ACL 2026
跨语言的推测解码
机构 * University of Colorado(科罗拉多大学)
AI总结 本文研究了通过微调草稿模型或使用n-gram模型来提高非英语语言中推测解码效率的策略,发现任务特定蒸馏虽能提升效率但泛化性差,而n-gram模型尽管接受率较低,但由于生成速度快,始终能提供显著的加速效果。
Comments 15 pages, 12 figures, submitted to ACL ARR August 2026
LEAP:用于高效Transformer推理的分层退出感知预训练
机构 * Walmart Inc.(沃尔玛公司)
AI总结 LEAP通过分层退出感知预训练解决传统蒸馏与早退机制的兼容性问题,实现显著的推理加速与效率提升。
Comments Accepted at ACL 2026 (Industry Track). 14 pages, 5 figures
Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Industry Track, pages 761-774, San Diego, California, USA
POSTCONDBENCH:形式化后置条件推理中的正确性与完备性基准测试
AI总结 本文提出POSTCONDBENCH多语言基准,用于评估LLM生成方法级后置条件的能力,发现正确性与完备性差距显著,仓库级依赖及方法复杂性会加剧该差距。
Journal ref In Findings of the Association for Computational Linguistics: ACL 2026, pages 35478-35507, San Diego, California, United States. Association for Computational Linguistics, 2026
HypEHR:基于超几何建模的电子健康记录用于高效问答
机构 * Department of Computer Science, Stony Brook University(石英布大学计算机科学系) ; Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系) ; Department of Biomedical Informatics, Stony Brook University(石英布大学生物医学信息学系)
AI总结 HypEHR通过超几何建模将电子健康记录中的代码、就诊和问题嵌入超几何空间,利用几何一致的交叉注意力和类型特定的指针头进行问答,预训练后在两个基准上实现高效问答。
Comments Accepted by Findings of ACL 2026
大型语言模型能理解创伤的影响吗?对枪支暴力幸存者访谈的LLM编码的成本与收益
机构 * University of Maryland, College Park(马里兰大学学院公园分校)
AI总结 本文研究了使用LLM对枪支暴力幸存者访谈进行主题编码的可行性,发现尽管某些配置能识别重要代码,但整体相关性低且易受数据处理影响,同时指出LLM的限制和伦理挑战。
Comments Accepted to Findings of the Association for Computational Linguistics (2026)
Journal ref Findings of the Association for Computational Linguistics (2026)
带思考的翻译:面向多领域机器翻译的难度自适应推理强化学习方法
机构 * Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院) ; School of Informatics, Xiamen University(厦门大学信息学院) ; Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism(文化和旅游部闽台非物质文化遗产数字化保护与智能处理重点实验室(厦门大学))
AI总结 该研究针对多领域机器翻译的难度差异挑战,提出TwT框架,经两阶段训练后,其7B和14B参数版本在翻译质量上优于更大的SOTA模型,且token使用量降低32%-60%。
Comments 34 pages, 17 figures, and 21 tables. Accepted to ACL 2026
检测移民路线间的经验互文性:法语叙事中超越表面相似性
机构 * CRIL, CNRS – Université d’Artois(CRIL,法国国家科学研究中心——阿图瓦大学) ; CEPED, Université Paris Cité(CEPED,巴黎西岱大学) ; EDA, Université Paris Cité(EDA,巴黎西岱大学)
AI总结 本文提出无需标注训练数据的经验互文性检测任务,采用多种方法分析法语移民叙事,发现Qwen2.5-7B零-shot及监督混合方法表现最优,且叙事位置显著影响互文性。
Comments 11 pages, 3 figures, 5 tables. Accepted at SIGDIAL 2026 (27th Annual Meeting of the Special Interest Group on Discourse and Dialogue)
Journal ref Proceedings of the 27th Annual Meeting of the Special Interest Group on Discourse and Dialogue (SIGDIAL 2026), Association for Computational Linguistics, 2026
对大型语言模型中社会期望反应进行量化与缓解:一种匹配可欲性的等级强制选择心理测量研究
机构 * The University of Tokyo(东京大学) ; Kobe University(Kobe大学)
AI总结 本文提出了一种心理测量框架,用于量化和缓解LLM问卷评估中的社会期望反应偏差,通过匹配可欲性来减少偏差并保持目标特征的恢复。
Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Volume 1: Long Papers, pp. 40148-40166
GeoRA: 为强化学习可验证奖励设计的几何感知低秩适应
机构 * Meituan(美团) ; Peking University(北京大学)
AI总结 GeoRA通过利用RLVR更新子空间的各向异性与压缩性结构,采用SVD提取主方向初始化低秩适配器,冻结残差部分作为结构锚点,从而在数学、医学和编程领域优于现有低秩基线,同时在跨领域任务中表现更佳。
Comments Accepted at ACL 2026 Main
预条件测试时适应用于叙事生成中的分布外去偏
机构 * Laboratory for Artificial Intelligence in Mathematics Education, Stevens Institute of Technology(数学教育中的人工智能实验室,史蒂文斯理工学院) ; Independent Researcher(独立研究者) ; NLP2CT Lab, Department of Computer and Information Science, University of Macau(NLP2CT实验室,澳门大学计算机与信息科学系)
AI总结 本文提出CAP-TTA框架,通过预条件预计算实现测试时适应,有效减少毒性/偏见评分,降低延迟并防止灾难性遗忘,提升叙事流畅度。
Comments This paper has been accepted to ACL2026 main conference
面向可扩展的可靠自动化评估:基于大语言模型
机构 * KIT(卡尔斯鲁厄理工学院)
AI总结 本研究提出一种基于多LLM两两比较与Elo评分的自动化评估框架,可近似专家评估,减少人工干预,实现对LLM输出的高效可靠评估。
Comments 17 pages. Published in the Proceedings of the Fourth Workshop on Generation, Evaluation and Metrics (GEM2) at ACL 2025
Journal ref Proceedings of the Fourth Workshop on Generation, Evaluation and Metrics (GEM2), pages 320-336, Association for Computational Linguistics, 2025
理解在早期完成:大语言模型的深度分工及其在无界上下文记忆中的应用
机构 * Tsinghua University(清华大学) ; Tencent(腾讯)
AI总结 该研究提出CoMem方法,利用大语言模型的深度分工构建无界上下文记忆,在RULER、LoCoMo等基准上性能优于全上下文KV-Direct,内存占用低、预填充速度快,证明长上下文记忆可沿层轴组织。
Comments 19 pages, 4 figures, 27 tables. Submitted to ACL Rolling Review
HSS-Synth:面向大语言模型的人文社科数据合成
机构 * Zhejiang University(浙江大学) ; Inclusion AI, Ant Group(蚂蚁集团Inclusion AI) ; Peking University(北京大学) ; Qwen Team, Alibaba Group(阿里巴巴集团通义千问团队)
AI总结 本文针对LLM的HSS数据稀缺问题,提出以学科为中心的HSS-Synth流水线,生成23.7万指令微调样本,使Qwen3-8B-Base达SOTA并提升相关能力。
Comments ACL Findings 2026 Paper
NorBERTo:一个基于ModernBERT架构的葡萄牙语现代编码器模型,训练于331十亿个token语料库
机构 * Itaú Unibanco ; ICTi
AI总结 NorBERTo基于ModernBERT架构,利用Aurora-PT语料库训练,具备长上下文支持和高效注意力机制,在葡萄牙语语义相似性、文本蕴含和分类任务中表现优异,达到最高F1和准确率。
Comments This article has already undergone formal submission, review, acceptance, and publication in the proceedings of PROPOR 2026: Proceedings of the 17th International Conference on Computational Processing of Portuguese, Vol. 1. The published version is available in the ACL Anthology at https://aclanthology.org/2026.propor-1.18/ 11 pages, 9 tables, 2 figures
Journal ref Proceedings of the 17th International Conference on Computational Processing of Portuguese (PROPOR 2026) - Vol. 1
通过后训练增强视频生成中的场景转换意识
机构 * Stevens Institute of Technology(史蒂文斯理工学院)
AI总结 本文提出TAV数据集,通过后训练提升视频生成中场景转换的理解能力,改善多场景生成效果并保持图像质量。
Journal ref Proceedings of the 14th International Joint Conference on Natural Language Processing and the 4th Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics (2025) 706-721
上下文如何塑造真相:LLMs中语句级真相表示的几何变换
机构 * University of Copenhagen(哥本哈根大学)
AI总结 研究LLMs中上下文如何改变真相向量,发现早期层正交、中层收敛,上下文增加向量幅度,大模型通过方向变化区分相关与无关上下文。
Comments ACL 2026 (Main)
Position: 评估分数是易逝的知识主张
机构 * DeepThought Solutions(深度思考解决方案公司) ; Meta ; University of Florida(佛罗里达大学)
AI总结 该研究指出语言模型评估存在信任膨胀问题,提出将评估分数视为具有形式性、范围性和有效性窗口的认知主张,建议添加元数据并采用最弱链聚合,发现HELM排行榜上两种聚合方式的前五名模型完全不重合。
Comments 7 pages, 1 figure, 1 table. Published at the Fifth Workshop on Generation, Evaluation and Metrics (GEM), ACL 2026, San Diego
Journal ref Proceedings of the Fifth Workshop on Generation, Evaluation and Metrics (GEM), ACL 2026, pages 1029-1035
BioHiCL:基于MeSH标签的层次多标签对比学习的生物医学检索
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 BioHiCL通过层次化MeSH标注实现多标签对比学习,提升生物医学信息检索的语义和层次理解能力,在检索、句子相似性和问答任务中表现优异且计算效率高。
Comments Accepted by ACL 2026 (Oral)
通过语言学习任务预训练增强语言模型的语言能力
机构 * School of Computer Science, University of Sheffield, United Kingdom(谢菲尔德大学计算机科学学院,英国)
AI总结 本文提出L2T框架,结合语言学习任务与标准预测任务,提升语言模型在语言能力评估中的表现,同时保持推理任务的竞争力。
Comments Accepted to ACL 2026 Main Conference
通过源保护更新缓解LLM目标语言适应中的灾难性遗忘
机构 * University of Sheffield(谢菲尔德大学) ; Hitachi, Ltd.(日立株式会社) ; University of Exeter(埃克塞特大学) ; Federal University of Rio Grande do Norte(里奥格兰德杜纳粹大学)
AI总结 本文提出源保护更新策略,利用少量源数据和参数重要性评分,在低资源条件下有效缓解LLM在目标语言适应中的灾难性遗忘问题,实验表明其在保持源语言能力的同时提升了目标语言性能。
Comments Accepted to ACL 2026 Main Conference
AdaMARP: 一种自适应多智能体交互框架用于通用沉浸式角色扮演
机构 * Zhejiang University(浙江大学) ; Tencent Youtu Lab(腾讯优图实验室)
AI总结 AdaMARP提出了一种自适应多智能体交互框架,通过沉浸式信息格式和显式场景管理器提升角色扮演的沉浸感和适应性,实验表明其在角色一致性、环境基础性和场景转换等方面优于现有系统。
Comments ACL2026 Findings
VideoNorms:视频语言模型文化意识基准测试
机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)
AI总结 本研究推出VideoNorms数据集评估VideoLLMs的文化规范意识,发现模型中文表现逊于英文、提供非语言证据更困难,视频模态必要且规模扩大无分类分数提升,成果助力文化导向的视频模型训练与评估。
Comments 29 pages, 6 figures, 19 tables. IC2S2 2026, C3NLP@ACL 2026
一种统一的命名实体识别框架
机构 * Department of Computer Science and Technology, Zhejiang University(浙江大学计算机科学技术学院)
AI总结 本文提出一种统一的命名实体识别框架,通过将NER任务转化为机器阅读理解任务,有效解决嵌套NER中的实体重叠问题,并在多个数据集上取得显著性能提升。
Comments ACL 2020
ChineseBERT:通过字形和拼音信息增强的中文预训练模型
机构 * Zhejiang University(浙江大学) ; Key Lab of Intelligent Information Processing of Chinese Academy of Sciences(中国科学院智能信息处理重点实验室)
AI总结 研究针对中文预训练模型忽略字形和拼音信息的问题,提出ChineseBERT,将二者纳入预训练,在大规模语料库上训练后,在多种中文NLP任务中性能显著提升,取得新SOTA,代码和模型已公开。
Comments To appear at ACL2021
RSMeM:用于遥感智能体的知识增强记忆进化及系统评估
AI总结 研究针对现有遥感智能体问题,提出RSMeM机制,通过分层知识基础和失败感知经验提炼两个组件,迭代吸收领域知识转化为执行经验,经实验验证能提升工具使用性能和答案质量,具有强大知识密度。
Comments Accepted to ACL 2026 Main. Code: https://github.com/AI9Stars/RSMeM
概念标记:通过概念定义学习行为嵌入
AI总结 Concept Tokens通过概念定义学习行为嵌入,能有效控制冻结语言模型的行为,减少幻觉并提升合规性。
Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 26501-26518, 2026
通过稀疏自编码器基于的转向实现可控的大语言模型推理
机构 * University of Science and Technology of China(中国科学技术大学) ; Zhongguancun Academy(中关村学院) ; Alibaba Group(阿里巴巴集团) ; Tsinghua University(清华大学)
AI总结 本文提出SAE-Steering方法,通过稀疏自编码器分解隐藏状态,实现对大语言模型推理策略的高效控制,提升推理准确率和灵活性。
Comments Accepted to the ACL 2026 Main