Seeing the Whole Elephant: A Benchmark for Failure Attribution in LLM-based Multi-Agent Systems
看见整个象:面向基于大语言模型的多智能体系统故障归因的基准测试
AI总结 本文提出TraceElephant基准测试,通过完整执行轨迹和可复现环境提升故障归因准确性,验证完整轨迹对故障原因识别的重要性。
Comments Accepted by ACL 2026
期刊&会议
Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing
看见整个象:面向基于大语言模型的多智能体系统故障归因的基准测试
AI总结 本文提出TraceElephant基准测试,通过完整执行轨迹和可复现环境提升故障归因准确性,验证完整轨迹对故障原因识别的重要性。
Comments Accepted by ACL 2026
解锁多LoRA支持的多用途基础大语言模型的边缘部署与设备端加速
机构 * Samsung Research Institute(三星研究院) ; Samsung Electronics(三星电子)
AI总结 本文提出一种硬件感知框架,实现基于LLaMA的多语言基础模型在三星S24/S25设备上的高效设备端推理,通过动态任务切换和多流解码机制,提升内存和延迟性能,验证了多用途大语言模型在边缘设备上的可行性。
Comments Accepted at ACL 2026
一个身份,多种线索,不同结果:社会人口学线索如何影响LLM个性化
机构 * Institute for Natural Language Processing, University of Stuttgart(斯图加特大学自然语言处理研究所) ; Institute for Logic, Language and Computation, University of Amsterdam(阿姆斯特丹大学逻辑、语言和计算研究所) ; Weizenbaum Institute(Weizenbaum研究所;慕尼黑机器学习中心;慕尼黑技术大学) ; Munich Center for Machine Learning ; TU Munich
AI总结 研究探讨社会人口学线索对LLM个性化的影响,指出单一线索可能导致偏差,强调需考虑外部有效性。
Comments ACL 2026 Main Conference
在自监督语音识别模型的音素级嵌入中识别和分类人口不公平现象
机构 * MILES Team, LAMSADE, Université Paris Dauphine-PSL(巴黎-萨克雷大学巴黎第四大学LAMSADE团队) ; GETALP Team, LIG, Université Grenoble Alpes(格勒诺布尔阿尔卑斯大学LIG团队)
AI总结 本文研究了自监督语音识别模型中音素嵌入的不公平现象,提出两种误差类型:随机误差与系统误差,并发现音素嵌入中的偏差可能影响不同群体的性能。
Journal ref Findings of the Association for Computational Linguistics 2026
SOLAR-RL:半在线长 horizon 分配强化学习
机构 * vivo AI Lab(vivo人工智能实验室) ; Zhejiang Lab(浙江实验室) ; CUHK MMLab(香港大学多模态实验室) ; Hubei University(湖北省大学) ; Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)
AI总结 SOLAR-RL通过整合全局轨迹信息到离线学习中,提升GUI任务的长horizon完成率和鲁棒性,提供高效样本利用的自主导航方案。
Comments 14 pages, 11 figures. Accepted to Findings of the Association for Computational Linguistics: ACL 2026
RouteLMT: 为混合LLM翻译部署设计的学得样本路由
机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,中国沈阳) ; NiuTrans Research, Shenyang, China(牛译研究院,中国沈阳)
AI总结 本文提出RouteLMT,通过在模型内部预测大模型相对于小模型的边际增益,实现高效的样本路由,优于传统启发式和质量估计方法,达到更优的质量-预算帕累托前沿。
Comments Accepted to ACL 2026 Industry Track
聚合与个性化评判在商业创意评估中的对比:来自专家分歧的证据
机构 * Stockmark Inc(Stockmark公司) ; Asahi Kasei Corporation(朝日化学株式会社) ; National Institute of Informatics(日本信息处理学会) ; National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院)
AI总结 本文研究了在商业创意评估中,自动评判应接近聚合共识还是个体评判的问题,通过PBIG-DATA数据集发现个性化评判更符合评估者,而聚合评判存在较大分歧。
Comments ACL 2026 Industry Track (Oral)
SSG: 用于LLM水印的对数平衡词汇分区
机构 * AllenG-L
AI总结 本文提出SSG方法,通过对数平衡词汇分区提升水印检测效果,针对低熵场景改进水印强度下界。
Comments ACL 2026 Main Conference
选择性对比学习用于无 gloss 手语翻译
机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) ; Key Lab of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian-Taiwan (XMU), Ministry of Culture and Tourism, China(福建省 Fujian-Taiwan 非物质文化遗产数字保护与智能处理重点实验室,文化部,中国) ; National Language Resources Monitoring and Research Center for Education and Teaching Media, Xiamen University, China(教育与教学媒体语言资源监测与研究中心,厦门大学,中国)
AI总结 本文提出选择性对比学习方法,通过动态选择负样本提升手语翻译的跨模态对齐效果,减少噪声干扰。
Comments Accepted by ACL 2026 as the main conference
CNSL-bench:用于评估多模态大语言模型在中文国家手语理解能力的基准
机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) ; Key Lab of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian-Taiwan (XMU), Ministry of Culture and Tourism, China(福建省-台湾非物质文化遗产数字化保护与智能处理重点实验室(XMU),文化和旅游部,中国) ; National Language Resources Monitoring and Research Center for Education and Teaching Media, Xiamen University, China(教育与教学媒体语言资源监测与研究中心,厦门大学,中国)
AI总结 本文提出CNSL-bench,首个评估多模态大语言模型在中文国家手语理解能力的基准,通过权威 grounding、多模态覆盖和手部动作多样性,评估21个模型,发现当前模型在手语理解上仍显著劣于人类表现。
Comments Accepted as the Main Conference at ACL 2026
大型语言模型中的偏好头:可解释个性化机制框架
机构 * McGill University(麦吉尔大学) ; Mila - Quebec AI Institute(魁北克人工智能研究所) ; MBZUAI(马克斯·普朗克人工智能研究所) ; University of Montreal(蒙特利尔大学) ; Salesforce(Salesforce公司)
AI总结 本文提出DPS框架,通过因果掩码分析识别偏好头并实现可控可解释的个性化,实验表明在保持内容连贯性的同时提升个性化精度。
Comments Accepted at ACL 2026
上下文保真度提升:通过水印启发式解码增强忠实生成
机构 * Hunyuan AI Digital Human, Tencent(腾讯文深AI数字人) ; McGill University(麦吉尔大学) ; Mila - Quebec AI Institute(魁北克人工智能研究所) ; Wuhan University(武汉大学) ; University of Montreal(蒙特利尔大学) ; Tsinghua University(清华大学) ; MBZUAI
AI总结 本文提出CFB框架,通过增加源支持标记的生成概率减少大语言模型中的保真度幻觉,采用基于水印技术的logit调整策略,三种增强策略提升生成忠实度,无需重训练即可兼容多种LLM。
Comments Accepted at ACL 2026
CLARITY:一种用于交互式NL2SQL系统中对话语言歧义和不可回答性的框架和基准
机构 * Oracle Corporation(Oracle公司)
AI总结 CLARITY框架通过多维度歧义和用户行为生成NL2SQL基准,揭示现有系统在复杂歧义下的性能下降,强调需增强歧义检测与解决能力。
Comments Accepted at ACL 2026 (Industry Track)
无效训练:功能保持污染以防止未经授权使用代码数据集
AI总结 本文提出FunPoison,一种保持功能的污染方法,通过注入可编译的弱使用片段来有效防止未经授权的数据集使用,同时保持100%的编译正确性。
Comments Accepted to Findings of the Association for Computational Linguistics (ACL 2026). Code is available at: https://github.com/xiaoyuanpigo/FunPoison
在大规模文档集合中导航:MuDABench用于多文档分析问答
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Wenlan School of Business, Zhongnan University of Economics and Law(中南财经政法大学文澜商学院)
AI总结 本文提出在大规模半结构化文档集合上进行分析问答的任务,介绍了MuDABench多文档分析问答基准,要求跨多个文档提取和综合信息以进行定量分析,实验发现标准RAG系统表现不佳,提出多代理工作流以提升性能。
Comments Findings of ACL 2026. The camera-ready version corrects some labeling errors. The accompanying repository is continuously updated based on community feedback; for the most up-to-date implementation and results, please refer to the repository
UniSonate:一种统一的语音、音乐和音效生成模型,通过文本指令控制
机构 * Tianjin University(天津大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
AI总结 UniSonate通过统一的文本指令接口生成语音、音乐和音效,采用动态令牌注入机制和多阶段课程学习策略,提升跨模态生成性能,实现指令驱动的TTS和TTM的SOTA表现。
Comments Accepted to ACL 2026 main conference (oral)
大型语言模型如何在内部知识与用户和文档断言之间取得平衡
机构 * Santa Clara University(圣克拉拉大学) ; Nanyang Technological University(南洋理工大学) ; California Institute of Technology(加州理工学院)
AI总结 本文研究了大型语言模型在处理内部知识与外部信息时的平衡问题,提出三源交互框架,评估27个模型,发现模型更依赖文档断言,且通过微调可提升其区分能力。
Comments Findings of ACL 2026
语言模型中共享句法机制的细粒度分析
机构 * The University of Tokyo(东京大学) ; RIKEN(日本理化学研究所) ; Tohoku University(东北大学)
AI总结 本研究通过细粒度分析探讨语言模型在不同句法结构中是否共享神经机制,发现填词-缺口依赖在早期至中期层有高度局部化的共享机制,而否定极性项目许可则无统一机制。
Comments Accepted to ACL 2026 Main
基于知识的增强与检索的整合时间适应
机构 * University of Memphis(密苏里大学)
AI总结 本文提出KARITA方法,通过整合知识源和处理时间变化,提升多领域分类任务的性能,证明知识整合在时间增强学习中的关键作用。
Comments Accepted at ACL 2026
TEMA: 图像锚定,文本引导的多修改复合图像检索
机构 * School of Software, Shandong University(山东大学软件学院) ; Department of Computing, Hong Kong Polytechnic University(香港理工大学计算机系) ; School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院)
AI总结 TEMA通过构建多修改数据集和提出文本导向实体映射架构,解决复合图像检索中的实体覆盖不足和句法-实体对齐问题,提升检索准确性和效率。
Comments Accepted by ACL 2026
CURA:语言模型基于风险预测的临床不确定性风险对齐
机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校)
AI总结 CURA通过结合个体误差概率和群体模糊性,提升临床语言模型的风险预测不确定性校准,实验表明其能提高校准指标并减少过度自信的误判。
Comments Accepted at ACL 2026 Main Conference
为何监督微调失效:对大语言模型中不完全学习现象的系统研究
机构 * University of New South Wales(新南威尔士大学) ; Tencent Hunyuan(腾讯文言) ; Tencent Yuanbao(腾讯元宝) ; UESTC(电子科技大学) ; Peking University(北京大学)
AI总结 本文系统研究了大语言模型微调中不完全学习现象,揭示了五个导致学习不完整的原因,并提出诊断优先框架和缓解策略,证明监督微调的局限性。
Comments Accepted by ACL 2026 Main
HACHIMI: 通过协调代理实现可扩展和可控的学生人设生成
机构 * East China Normal University(华东师范大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 HACHIMI通过协调代理框架生成理论对齐且分布可控的学生人设,生成100万个人设用于1-12年级,验证了其在教育理论和人口分布上的有效性。
Comments 46 pages, 7 figures, accepted by ACL 2026. The dataset is available at https://huggingface.co/datasets/sii-research/HACHIMI-1M
DimABSA:构建多语言多领域数据集用于维度方面基于情感分析
机构 * National Yang Ming Chiao Tung University ; Yuan Ze University ; Moscow State University ; Skoltech ; AIRI ; Yunnan University ; University of Cincinnati ; University of Göttingen ; Imperial College London ; National Research Council Canada
AI总结 本文提出DimABSA,首个多语言多领域数据集,通过引入连续valence-arousal评分提升细粒度情感分析能力,提供三个子任务及连续F1指标,推动多语言维度情感分析发展。
Comments accepted at ACL 2026
扩散语言模型在代理工作流中的苦涩教训:全面的现实检验
机构 * Southeast University(东南大学) ; Alibaba(阿里巴巴) ; Southeast University Shenzhen Research Institute(东南大学深圳研究院) ; College of Computing and Data Science at Nanyang Technological University(南洋理工大学计算机与数据科学学院)
AI总结 本文评估了扩散语言模型在代理任务中的表现,发现其在长期规划和工具调用任务中存在系统性失败,提出需整合因果推理机制以提升代理能力。
Comments ACL 2026 - Main Conference
系统介导的注意力失衡使视觉-语言模型倾向于说‘是’
机构 * Saarland Informatics Campus, Saarland University, Germany(萨尔兰州信息学校区,萨尔兰州大学,德国) ; Max Planck Institute for Informatics, Germany(马克斯·普朗克信息研究所,德国)
AI总结 本文研究了视觉-语言模型中系统介导的注意力失衡对‘是’偏见的影响,提出通过重新分配注意力以减少这种偏见,从而提升模型可靠性。
Comments Accepted to ACL Findings 2026
从可解释性到性能:优化长上下文语言模型的检索头
机构 * Department of Computer Science, Institute of Science Tokyo(东京科学研究所计算机科学系)
AI总结 本文研究检索头如何提升长上下文语言模型性能,提出RetMask方法通过对比正常输出与屏蔽检索头的输出生成训练信号,显著提升生成和重排序性能,验证了检索头的功能作用。
Comments Findings of ACL 2026; Source code available at https://github.com/YoumiMa/RetMask
大语言模型是糟糕的骰子玩家:LLM在生成统计分布的随机数时表现不佳
机构 * Harvard University(哈佛大学)
AI总结 研究发现大语言模型在生成随机数时存在显著缺陷,其采样能力随分布复杂度和采样范围增加而下降,导致下游任务出现系统性偏差。
Comments Accepted to ACL 2026 (Main Conference)
AgentMark:用于代理的效用保持行为水印
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Huaqiao University(华侨大学)
AI总结 本文提出AgentMark,一种用于代理的行为水印方法,通过在规划决策中嵌入多比特标识符以保持效用,适用于黑盒API和动作层内容水印。
Comments Accepted to ACL 2026 (Main, Poster)
NiuTrans.LMT: 向包容性和可扩展的多语言机器翻译迈进 with LLMs
机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,中国沈阳) ; NiuTrans Research, Shenyang, China(牛译研,中国沈阳)
AI总结 本文提出NiuTrans.LMT,通过Strategic Downsampling和Parallel Multilingual Prompting缓解多语言监督微调中的方向退化问题,展示其在60种语言234个方向上的竞争力。
Comments Accepted to ACL 2026 Main Conference. Models are available at: https://github.com/NiuTrans/LMT