A Definition of Good Explanations and the Challenges Explaining LLM Outputs
好解释的定义及解释LLM输出的挑战
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI
AI总结 本文提出一种基于反事实解释且考虑对话者先验信念的好解释定义,并探讨该定义对AI可解释性的影响,特别是为何LLM输出难以产生好解释。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
好解释的定义及解释LLM输出的挑战
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI
AI总结 本文提出一种基于反事实解释且考虑对话者先验信念的好解释定义,并探讨该定义对AI可解释性的影响,特别是为何LLM输出难以产生好解释。
基于LLM的快速语义过滤:从统一框架到自适应两阶段方法
机构 * EPFL(瑞士联邦理工学院)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI
AI总结 提出自适应两阶段语义过滤框架,结合无模型聚类与在线代理,利用LLM的置信度作为软标签训练代理,并通过稀疏感知校准降低级联成本,在90%准确率目标下速度提升1.6-2.0倍。
从采样结果到能力分布:重新思考LLM路由的监督
机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) ; National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) ; Hong Kong University of Science and Technology(香港科学与技术大学) ; Frontier Robotics(前沿机器人)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.LG
AI总结 针对LLM路由中单次响应作为监督信号噪声大的问题,提出DARS框架,从分布视角构建路由监督,考虑输入和输出不确定性,实验表明分布感知监督更稳定有效。
翻译头:在基于LLM的机器翻译中分离意义与语言
机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) ; School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) ; Inria, Paris, France(Inria,巴黎,法国)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 通过分析注意力头,将机器翻译分解为目标语言识别和句子等价两个子任务,发现稀疏的注意力头分别专攻每个子任务,并利用此发现实现无需指令的翻译性能。
Comments 61 pages, 70 figures
编辑前先探测:基于探测引导的分子优化用于基于结构的药物设计中的LLM代理
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; City University of Hong Kong(香港城市大学) ; Beijing Institute of Mathematical Sciences and Applications(北京数学科学应用研究所)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI
AI总结 提出PROBE框架,通过探测口袋-配体复合物的编辑响应来引导LLM代理进行分子优化,解决结合亲和力与成药性之间的冲突,在CrossDocked2020上达到最优性能。
剖析黑箱:LLM 漏洞检测的电路级分析
机构 * Lund University(隆德大学)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 通过机械可解释性分析 Gemma-2-2b 模型在 C/C++ 漏洞检测中的内部计算,发现模型主要依赖安全检测器(识别安全编码模式的注意力头)而非直接检测漏洞特征,并识别出关键神经组件(早期层注意力头和 MLP 神经元),通过消融实验验证其因果作用。
Comments 11 pages, 6 figures. Supported by the Wallenberg AI, Autonomous Systems and Software Program (WASP)
LLM沙盒与人格动态的伦理
机构 * University of Cape Town(开普敦大学)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI
AI总结 本文论证LLM护栏和人格动态产生的现实差距(reality gap)构成不道德的“现实洗白”(reality laundering),并提出通过任务级因果需求规范而非响应级道德修正来解决。
Comments 8 pages
在数字孪生构建中整合韧性与人类监督 into LLM辅助建模工作流
机构 * Indian Institute of Technology Goa(印度理工学院 Goa)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI
AI总结 本文提出三种关键设计原则,用于将韧性与人类监督整合到LLM辅助的数字孪生建模工作流中,通过FactoryFlow框架的研究,探讨了如何通过正交化结构建模与参数拟合、限制模型IR到参数化预验证库组件以及使用密度保持的IR来提高建模的鲁棒性和可解释性。
空间对话:在画布上构建非线性大语言模型交互结构
机构 * LMU Munich(慕尼黑大学) ; Aalto University(阿尔托大学) ; University of Bayreuth(拜罗伊特大学)
专题命中 知识编辑与模型理解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出CanvasConvo,通过将线性聊天转化为分支对话树,支持在画布上探索假设场景,提升LLM交互的非线性结构和探索效率。
基于知识图谱的LLM引导蒙特卡洛树搜索:为药物-疾病对构建机制性解释
机构 * Institute of Data Science, Department of Advanced Computing Sciences, Maastricht University(数据科学研究所,高级计算科学系,马斯特里赫特大学)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI
AI总结 本文提出TESSERA框架,结合LLM和知识图谱进行多步解释提取,通过约束结构和反向传播实现长周期搜索,验证了其在药物机制解释中的有效性。
Comments Accepted at IJCAI-ECAI 2026. 9 pages (7 content + 2 references), 5 figures, 3 tables. Includes supplementary material (26 pages)
迈向安全可审计的LLM代理:一种统一的图表示
机构 * Huazhong University of Science and Technology(华中科技大学) ; Nanyang Technological University(南洋理工大学) ; Fudan University(复旦大学) ; Chongqing University of Posts and Telecommunications(重庆邮电大学) ; Donghua University(东华大学)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI
AI总结 本文提出Agent-BOM统一图表示,用于解决LLM代理系统中执行意图与物理事件间的语义鸿沟问题,通过构建分层属性有向图实现安全审计与风险评估。
基于LLM的临床图结构细化:增强EEG癫痫诊断中的表示学习
机构 * Department of Computer Science, Florida State University(佛罗里达州立大学计算机科学系) ; SANKEN, The University of Osaka(大阪大学SANKEN)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出利用大语言模型对图结构进行细化,以提升EEG信号在癫痫诊断中的表示学习效果,通过两阶段框架去除冗余边,提高诊断准确率和图结构意义。
Comments This paper is accepted by the 35th International Joint Conference on Artificial Intelligence (IJCAI-ECAI 2026)
将机器创造力扎根于游戏设计知识表示:在结构约束下对基于LLM的可执行合成目标可玩模式的实证探测
机构 * Chalmers University of Technology and University of Gothenburg(楚德大学技术学院和哥德堡大学)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文探讨了在结构约束下,基于LLM的可执行合成目标可玩模式的可行性,通过对比不同生成方法,揭示了结构和项目层面的瓶颈问题。
基于表示的参数高效LLM去学习
机构 * Shanghai University of Finance and Economics(上海金融学院) ; Southern University of Science and Technology(南方科技大学) ; Deepexi Technology Co. Ltd(深点科技有限公司)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出REGLU方法,利用表示空间的几何特性实现鲁棒且精确的去学习。通过开发表示引导的LoRA初始化和正则化损失,有效分离遗忘与保留集参数,提升去学习效果。
Comments Findings of ACL 2026
从子项关系到可满足性:基于LLM的主动学习用于OWL本体论
机构 * University of Glasgow(格拉斯哥大学)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出利用LLM辅助的主动学习方法,通过将候选公理转换为反概念并用受控自然语言表达,以提高OWL本体论建模的准确性,实验表明召回率稳定。
CoEvolve:通过代理-数据互演训练LLM代理
机构 * Alibaba Group(阿里巴巴集团) ; AMAP
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL
AI总结 本文提出CoEvolve框架,通过闭环交互训练提升LLM代理性能,利用反馈信号识别失败模式并指导任务合成,实验显示在AppWorld和BFCL上显著提升表现。
Comments Accepted to ACL 2026
机构 * Center for Information and Language Processing (CIS)(信息与语言处理中心) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; ScaDS.AI and TU Dresden(ScaDS.AI 和 梅克伦堡-前波美拉尼亚技术大学) ; Department of Statistics, LMU Munich(统计学系,慕尼黑大学) ; University of Maryland, College Park(马里兰大学 College Park 分校)
专题命中 知识编辑与模型理解 :prompting(title,abstract);large language model(title);language model(title);分类 cs.CL
Comments Accepted to AACL-IJCNLP 2025 Findings
使用转移解码检测大语言模型中的幻觉
机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) ; National Institute of Standards and Technology(美国国家标准与技术研究院) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG
AI总结 研究大语言模型中的幻觉检测问题,提出转移解码新方法,通过在解码阶段挑战模型响应提取特征,训练机器学习模型度量不确定性,该方法计算复杂度低,优于现有方法。
Journal ref Data and Applications Security and Privacy XXXIX. DBSec 2025
大型语言模型在博弈论实验中复制并预测人类合作行为
机构 * Department for Computational Social Sciences and Humanities, Barcelona Supercomputing Center(巴塞罗那超级计算中心计算社会科学与人文学系) ; Grupo de Sistemas Complejos, Universidad Politécnica de Madrid(马德里理工大学复杂系统研究组) ; School of Law and Political Science, Universitat Oberta de Catalunya(加泰罗尼亚开放大学法律与政治科学学院)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过复制大规模博弈实验,发现Llama模型能高保真复现人类合作模式,而Qwen更接近纳什均衡,并揭示了Llama的注意力机制与人类行为对齐的机理。
从信号到迁移:基于探针的大语言模型不确定性估计的分解研究
机构 * Nanyang Technological University(南洋理工大学) ; Shanghai Jiao Tong University(上海交通大学) ; VinUniversity ; KAIST(韩国科学技术院)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 通过分解研究,发现原始隐藏状态和注意力特征在域内表现优异,但结构化压缩特征在分布偏移下更鲁棒,提示和标签构建显著影响探针行为,并训练出可迁移的预训练探针。
Grad Detect: 基于梯度的 LLM 幻觉检测
机构 * Amazon(亚马逊)
专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出 Grad Detect,通过单次前向-反向传播中的逐层梯度模式检测 LLM 幻觉,在多项基准上优于置信度与采样基线,并发现最后五层集中了97%以上的判别梯度信号。
Comments Accepted to the 2nd Workshop on Compositional Learning at ICML 2026, Seoul, South Korea. Copyright 2026 by the author(s)
Journal ref 2nd Workshop on Compositional Learning: Safety, Interpretability, and Agents, ICML 2026
大型语言模型中真理的三难困境
机构 * Khoury College of Computer Sciences Northeastern University(东北大学科里学院) ; Network Science Institute Northeastern University(东北大学网络科学研究所) ; Santa Fe Institute(圣菲研究所)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG
AI总结 针对大型语言模型知识真实性探测方法的缺陷,提出结合多实例学习与共形预测的sAwMIL框架,实现真、假及不确定三类分类,揭示真理与虚假的非对称编码及第三种信号的存在。
Comments The main text is 9 pages long (plus 3 pages of references); supplementary material (60 pages) is included in the same PDF
Jacobian Scopes: LLM中的令牌级因果归因
机构 * Cornell University(康奈尔大学) ; Imperial College London(伦敦帝国理工学院) ; Goodfire AI
专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出Jacobian Scopes,一种基于梯度的令牌级因果归因方法,用于解释LLM预测,揭示政治偏见、翻译策略和上下文学习机制。
Comments 25 pages, 16 figures
重新思考超越余弦相似度的大型语言模型层相关性
机构 * Pontificia Universidad Católica de Chile(天主教智利大学) ; National Center for Artificial Intelligence (CENIA)(人工智能国家中心) ; Universidad de Chile(智利大学)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.LG
AI总结 本文指出余弦相似度不适合作为评估层移除影响的指标,提出基于模型准确率下降的实际指标,以更准确地评估层重要性,改进模型压缩策略。
Comments Published at ICLR 2026
Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026
Qwen-Scope:将稀疏特征转化为大语言模型的开发工具
机构 * Qwen Team(Qwen团队)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.LG
AI总结 Qwen-Scope通过稀疏自编码器为大语言模型提供开发工具,支持推理引导、评估分析、数据驱动工作流和训练优化,展示了SAEs在模型诊断与改进中的实用性。
GUARD:通过自适应角色扮演和 Jailbreak 诊断进行 LLM 的指南合规性测试
机构 * Hong Kong University of Science and Technology(香港理工大学) ; Lapis Labs(Lapis实验室) ; Capital One
专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 GUARD 通过自适应角色扮演和 Jailbreak 诊断,将指南转化为具体违规问题,验证 LLM 的合规性,经八种 LLM 测试验证有效性。
Comments 56 pages
大语言模型中认知结构的机制解码
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出基于Representation Engineering的Cognitive Reverse-Engineering框架,分析社会比较嫉妒的认知机制,揭示模型内部对嫉妒的结构化编码,并展示如何机械检测和抑制有毒情绪状态。
基于LLM的Schema自适应表格表示学习用于通用多模态临床推理
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Boston University(波士顿大学) ; University of Southern California(南加州大学) ; GDIIST ; Renyixun Health Technology Co., Ltd.(仁心迅健康科技有限公司)
专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于LLM的Schema自适应表格表示学习方法,通过将结构化变量转换为语义自然语言并编码,实现零样本跨schema对齐,结合表格和MRI数据在多模态 dementia 诊断中取得优于临床基准的性能。
Comments 11 pages, 4 figures
Journal ref ACL 2026, Main conference
小语言模型中的共享情感几何:跨架构研究中的表示、行为和方法学混淆
机构 * Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院) ; ModuLabs(ModuLabs实验室)
专题命中 知识编辑与模型理解 :language model(title,abstract);small language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了十二种小语言模型在统一理解模式下的21种情绪向量几何,发现五种成熟架构在情绪几何上几乎相同,而Gemma-3 1B base则表现出极端残差流各向异性。
Comments 34 pages, 6 figures, 1 table in main text + appendix. Ongoing series on Model Medicine
情感概念及其在大语言模型中的功能
机构 * Anthropic
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 研究揭示大语言模型中情感概念的内部表示及其对输出的影响,探讨其在对齐行为中的作用。