Near-Miss: Latent Policy Failure Detection in Agentic Workflows
近似失误:代理工作流中的潜在策略失败检测
机构 * IBM Research(IBM研究院)
AI总结 本文提出一种新指标,用于检测代理对话轨迹中的潜在策略失败,通过分析代理工具调用决策的充分性,揭示当前评估方法的盲点。
Comments GEM@ACL2026, 13 pages
期刊&会议
Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing
近似失误:代理工作流中的潜在策略失败检测
机构 * IBM Research(IBM研究院)
AI总结 本文提出一种新指标,用于检测代理对话轨迹中的潜在策略失败,通过分析代理工具调用决策的充分性,揭示当前评估方法的盲点。
Comments GEM@ACL2026, 13 pages
反长度偏移:动态异常截断用于训练高效的推理模型
机构 * University of Science and Technology of China(中国科学技术大学) ; Xiaohongshu Inc.(小红书公司) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 本文提出动态异常截断方法,通过在训练时抑制冗余token,提升推理模型的效率与性能,实验显示在AIME-24上推理token使用减少78%且准确率提升。
Comments Accepted by ACL2026
推理模型优于LLM-判官,但存在偏见
机构 * Institute of Science Tokyo(东京科学研究院) ; Harbin Institute of Technology(哈尔滨工业大学) ; The University of Osaka(大阪大学)
AI总结 本文系统比较了推理模型在判断任务中的表现,发现其在准确性、指令遵循和抗攻击能力上优于非推理LLM,但存在显著偏见,提出PlanJudge策略以缓解偏见问题。
Comments Accepted by ACL 2026 Workshop EvalEval
AgenticEval: 向大型语言模型的代理和自演化安全评估迈进
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; The University of Hong Kong(香港大学) ; East China Normal University(华东师范大学)
AI总结 本文提出AgenticEval框架,通过自演化评估流程动态检测LLM安全风险,实验显示模型安全评分随评估强化而下降,揭示静态评估的局限性。
Comments Findings of ACL 2026
通过可验证奖励的强化学习进行生成式平面设计
机构 * Mila – Quebec AI Institute(魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学) ; Polytechnique Montréal(蒙特利尔理工学院) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
AI总结 本文提出基于LLM的平面设计方法,通过强化学习与可验证奖励提升拓扑和数值约束的满足度,优于现有方法在真实性、兼容性和多样性指标上。
Comments Accepted to Findings of ACL 2026
PolitNuggets: 评估代理发现长尾政治事实
机构 * The University of Hong Kong(香港大学)
AI总结 PolitNuggets通过构建400位全球精英的政治传记,涵盖10000多个政治事实,评估代理信息合成能力,发现当前系统在细节处理和效率上存在显著差异。
Comments 24 pages, 7 figues, accpeted in The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)
在多轮交互中对大语言模型的置信度估计
机构 * University of Cambridge(剑桥大学) ; Fudan University(复旦大学)
AI总结 本文研究了多轮对话中大语言模型置信度估计的问题,提出了一种评估框架和新指标,发现传统方法在多轮对话中表现不佳,而新方法更有效。
Comments ACL 2026 Findings
本地新闻仍然本地吗?:西恩斯集团收购电台的在线内容变化
机构 * Johns Hopkins University(约翰霍普金斯大学)
AI总结 研究探讨西恩斯集团收购本地新闻电台后,其在线内容对本地与全国性话题的报道变化,发现电台更频繁报道全国性新闻,且对具有争议性的全国性话题的报道增加。
Comments Published at NLP+CSS Workshop @ ACL 2026
KV缓存压缩的陷阱
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 本文研究了KV缓存压缩在多指令提示中的问题,发现某些指令在压缩后性能下降明显,提出改进KV缓存淘汰策略以提升多指令任务表现。
Comments In Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics, ACL 2026
LoVeC:强化学习用于长文生成中的更可靠的 verbalized 自信度
机构 * University of Cambridge(剑桥大学)
AI总结 本文提出LoVeC,一种基于强化学习的方法,通过在长文生成过程中实时附加数值自信度评分,提升事实性生成的可靠性。实验表明,该方法在多个长文问答数据集上实现了更好的校准和跨领域泛化能力,且效率显著高于传统自一致性方法。
Comments ACL 2026 Main
通过监督微调紧凑LLMs实现儿童英语阅读故事生成:具有可控难度和安全性的方法
机构 * University of Florida(佛罗里达大学)
AI总结 本文通过监督微调紧凑LLMs生成儿童英语阅读故事,实现可控难度和安全性,实验表明微调模型在难度指标上优于零样本模型。
Comments Comments: 15 pages, 4 figures. Author Two and Author Three contributed equally. Accepted by the 21st Workshop on Innovative Use of NLP for Building Educational Applications (BEA 2026), ACL 2026
大型语言模型作为丹麦庇护决定中可信度评估标注者的应用:评估分类性能和错误超越聚合指标
机构 * Visual Analysis and Perception Lab(视觉分析与感知实验室) ; Pioneer Center for AI(先锋人工智能中心) ; Center of Excellence for Global Mobility Law(全球移动法律卓越中心) ; Department of Computer Science(计算机科学系)
AI总结 本文研究了大型语言模型在丹麦庇护决定文本中识别可信度评估的存在和情感的性能,引入了RAB-Cred数据集,并评估了21种模型和30种提示组合的分类效果,揭示了模型和提示选择对零样本和少样本分类的影响。
Comments Accepted at the 20th Linguistic Annotation Workshop (LAW XX), co-located with ACL 2026 (https://sigann.github.io/LAW-XX-2026/)
ArcLight:一种为多核CPU设计的轻量级大语言模型推理架构
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Tsinghua University(清华大学)
AI总结 本文提出ArcLight,一种为多核CPU优化的LLM推理架构,通过高效内存管理和线程调度及精细控制的张量并行性,解决多核CPU上的跨节点内存访问瓶颈,实现更高的推理吞吐量。
Comments Accepted by ACL 2026 Demo
注意差距: elicitation协议如何影响语言模型中的 stated-revealed偏好差距
机构 * University of Oxford(牛津大学) ; Max Planck Institute for Biological Cybernetics(生物信息学Max Planck研究所) ; University of Tuebingen(图宾根大学) ; Cardiff University(卡迪夫大学) ; Cambridge–Boston Alignment Initiative (CBAI)(剑桥-波士顿对齐倡议)
AI总结 研究探讨了elicitation协议对语言模型中stated-revealed偏好差距的影响,发现中性选项和 abstention 的引入能提高相关性,但进一步允许 abstention 又导致相关性下降。
Comments Accepted to ACL 2026 Eval Eval Workshop and 3rd Technical AI Safety Conference (TAIS 2026)
FLEXITOKENS: 用于进化语言模型的灵活分词
机构 * The Ohio State University(俄亥俄州立大学) ; University of Washington(华盛顿大学)
AI总结 本文提出FLEXITOKENS,通过可学习的分词器实现灵活的分词,减少文本过碎片化,提升多语言和生成任务性能。
Comments Accepted to ACL (findings) 2026
IndicMedDialog: 一种平行多轮医疗对话数据集,用于印地语系语言中的可及性医疗
机构 * University of Birmingham(布里斯托尔大学) ; Heritage Institute of Technology(遗产理工学院) ; Madan Mohan Malaviya University of Technology(马丹·莫汉·马尔维亚理工学院)
AI总结 本文提出IndicMedDialog数据集,包含英语和九种印地语系语言的多轮医疗对话,通过生成合成咨询并进行翻译、验证和处理,提升多语言医疗对话系统的现实性和可访问性。
Comments Accepted in BioNLP @ ACL 2026 Conference
以效用为导向的多模态证据选择用于多模态检索增强生成
机构 * Arizona State University(亚利桑那州立大学) ; Texas A&M University(德克萨斯大学) ; Morgan Stanley(摩根大通)
AI总结 本文提出以信息论视角重构多模态证据选择,定义证据效用为模型输出分布的信息增益,通过引入潜在的证据有效性概念,提出无需训练的代理加速框架,实验证明在MRAG-Bench和Visual-RAG上优于现有RAG基线并降低计算成本。
Comments Accepted to ACL 2026
CascadeMind 在 SemEval-2026 任务 4:一种混合神经符号级联用于叙述相似性
机构 * Kaons ; Epoch Learn
AI总结 CascadeMind 通过神经符号级联方法在叙述相似性任务中达到72.75%的准确率,展示了在困难实例上合理分配计算资源的重要性。
Comments 7 pages, 2 figures, 5 tables. Accepted paper for SemEval-2026 Task 4 at ACL. Code: https://github.com/chreia/CascadeMind-ACL
PersonalAlign:面向个性化GUI代理的分层隐式意图对齐
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Shenzhen Loop Area Institute(深圳河套学院)
AI总结 本文提出PersonalAlign,通过长期用户记录实现个性化GUI代理的隐式意图对齐,引入AndroidIntent基准测试,评估代理在模糊指令解析和主动建议中的表现,HIM-Agent在执行和主动性能上提升显著。
Comments Accepted to ACL26 Main
d-TreeRPO:迈向更可靠的扩散语言模型策略优化
机构 * Tsinghua University(清华大学) ; Tongyi Lab(通义实验室) ; University of Illinois at Chicago(伊利诺伊大学香槟分校) ; Peking University(北京大学)
AI总结 本文提出d-TreeRPO框架,通过树状回滚和可验证奖励提升扩散语言模型策略优化的可靠性,理论证明预测信心提升可减少预测概率偏差,并在多个推理基准上取得显著提升。
Comments ACL 2026 Main
拆解与构建:基于技能的视觉-语言导航代理混合
机构 * Michigan State University(密歇根州立大学) ; ESAT-PSI, KU Leuven(KU莱顿大学ESAT-PSI实验室)
AI总结 本文提出SkillNav框架,通过模块化技能推理提升视觉-语言导航性能,通过合成数据训练无监督的路由模型,实现对复杂场景的泛化能力。
Comments Accepted by ACL 2026 Main Conference
重新审视你所见:揭示视觉语义以引导LVLM解码
机构 * Yonsei University(延世大学)
AI总结 本文通过分析发现视觉token在幻觉中仍提供有效信息,提出ReVisiT方法通过参考视觉token引导LVLM解码,减少计算成本并提升性能。
Comments ACL 2026 Main Conference (Oral). 30 pages, 10 figures. Code: https://github.com/bscho333/ReVisiT
STELLA:一种通过统一序列-结构编码进行蛋白质功能注释的多模态大语言模型
AI总结 STELLA通过统一序列-结构编码与文本模态协同,提升蛋白质功能注释的准确性,实现功能描述预测和酶促反应预测的最新成果。
Comments Accepted to Findings of ACL 2026
通过答案可信度评分估计问题难度
机构 * University of Innsbruck(因斯布鲁克大学)
AI总结 本文提出Q-DAPS方法,通过计算候选答案可信度的熵来估计问题难度,在四个数据集上表现优异,具有可解释性和鲁棒性。
Comments Accepted at ACL 2026
Journal ref Proceedings of the 64rd Annual Meeting of the Association for Computational Linguistics (ACL 2026)
GKnow: 测量性别偏见与事实性性别之间的纠缠
机构 * Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))
AI总结 本文提出GKnow基准,用于评估语言模型在不同性别预测类型中的性别知识和偏见,发现性别偏见与事实性性别在电路和神经元层面高度纠缠,表明神经元剪除不可靠。
Comments Accepted to ACL 2026
什么使一个词难以学习?建模L1对英语词汇难度的影响
机构 * University of Göttingen(哥廷根大学)
AI总结 本文通过梯度提升模型研究了母语对英语词汇难度的影响,发现词汇熟悉度是共同主导因素,而西班牙语和德语学习者还依赖拼写转移,而中文学习者则仅依赖熟悉度和表层特征。
Comments Submitted to BEA 2026 at ACL. 18 pages, 13 figures
注意暂停:基于LLMs的多语言语音纠错中的不流畅意识目标调优
机构 * Department of Computer Science and Engineering(计算机科学与工程系) ; Indian Institute of Technology Patna(印度理工学院帕纳瓦)
AI总结 本文提出一种多语言语音纠错方法,通过序列标注器标记不流畅词并指导LLM指令微调,结合对比学习目标提升纠错可靠性,实验证明在印地语、孟加拉语和马拉地语上优于现有基线模型。
Comments Accepted to ACL 2026 (Main)
差分隐私合成文本生成用于检索增强生成(RAG)
机构 * NEC Corporation(日本电报电话公司) ; Institute of Science Tokyo(东京科学研究院) ; RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心)
AI总结 本文提出DP-SynRAG框架,通过生成差分隐私合成RAG数据库提升隐私保护下的RAG性能,避免重复噪声注入并保持固定隐私预算。
Comments Accepted to ACL 2026 Findings
迈向基于视觉的多模态摘要:通过跨模态Transformer和门控注意力
机构 * School of Computing, Macquarie University(麦考瑞大学计算机学院)
AI总结 本文提出SPeCTrA-Sum框架,通过深度视觉处理器和轻量视觉相关性预测器实现文本摘要与图像选择,提升多模态摘要的视觉连贯性与准确性。
Comments Accepted to Findings of ACL 2026
超越文本的衡量:通过质量、对齐和多样性评估多模态摘要
机构 * School of Computing, Macquarie University(麦考瑞大学计算学院)
AI总结 本文提出MM-Eval框架,整合文本质量、跨模态对齐和视觉多样性评估,通过学习聚合模型优化多模态摘要的综合评价,揭示事实一致性对整体质量的关键作用。
Comments Accepted to Findings of ACL 2026