Automatically Interpreting Millions of Features in Large Language Models
机构 * Northwestern University, Evanston, Illinois, USA(西北大学)
专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.CL、cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
机构 * Northwestern University, Evanston, Illinois, USA(西北大学)
专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.CL、cs.LG
机构 * BIOSTIM Laboratory Faculty of Medicine Salah Boubnider University Constantine, Algeria(BIOSTIM实验室医学院萨拉赫·布宾德大学阿尔及利亚科纳克特) ; Department of IFA Faculty of NTIC Abdelhamid Mehri University Constantine, Algeria(IFA部门NTIC学院阿卜杜勒哈米德·梅赫里大学阿尔及利亚科纳克特)
专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.CL、cs.AI
专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.CL、cs.AI
专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.CL、cs.AI
专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.CL、cs.AI
Comments First three authors contributed equally
在视觉语言模型中保留局部化补丁语义
机构 * Department of Computer and Information Sciences, Temple University, Philadelphia, USA(计算机与信息科学系,特兰普大学,费城,美国)
专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract,abstract_cn)
AI总结 为解决视觉语言模型中图像与文本 tokens 信息扩散问题,提出 Logit Lens Loss(LLL)以保留图像 tokens 的局部化语义,提升模型可解释性和分割任务性能。
从大语言模型激活值中测量文本的概念内容:基于概念向量与线性探测的ESG证据
机构 * Leiden Institute of Advanced Computer Science, Leiden University(莱顿大学高级计算机科学研究所)
专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出用冻结LLMs的激活值测量文本概念内容,在ESG金融文本实验中,线性探测效果接近微调分类器,优于模型自身答案,且优于RFM概念向量。
Comments 19 pages, 1 figure, 7 tables
LM2Alloy:研究用于生产软件自动测试推导的大语言模型生成的形式规范
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 该研究探索用大语言模型从需求文档和生产源代码生成Alloy形式规范及推导可执行测试用例,在Flipper和Cerberus库上评估,发现能揭示约束级缺陷,基于代码的规范方差更低,为生产软件自动测试推导提供了新方法。
如何引导大语言模型生成:用于自动启发式设计的双代理引导搜索
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究如何在有限预算下引导大语言模型进行自动启发式设计,提出双代理引导搜索方法,通过两个互补代理评分及不确定性感知规则选择行动,在多样套件中表现出色,超越简单排名和固定偏好。
完美检测,控制失败:语言模型中知道与引导的几何学
机构 * Alomana
专题命中 知识编辑与模型理解 :language model(title);instruction tuning(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过几何角度测量发现,语言模型中检测行为的表示方向与控制行为的方向存在显著偏差(余弦值约0.12),表明检测不等于可控性,且该偏差源于预训练。
长文本语言模型输出的细粒度不确定性量化:一项比较研究
机构 * CVS Health(CVS健康公司) ; Wellesley, MA(马萨诸塞州韦尔士利)
专题命中 知识编辑与模型理解 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 针对长文本生成,提出细粒度不确定性量化分类法,通过响应分解、单元级评分和响应级聚合三阶段区分方法,引入FactScore-STEM-Geo数据集,实验发现声明-响应蕴含评分优于复杂方法,声明级评分优于句子级,不确定性感知解码有效提升事实性。
Comments Accepted by TMLR; UQLM repository: https://github.com/cvs-health/uqlm
Journal ref Transactions on Machine Learning Research, 2026
ICA Lens: 无需训练另一本词典即可解释语言模型
机构 * Independent Researcher(独立研究员) ; University of Maryland(马里兰大学)
专题命中 知识编辑与模型理解 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出ICALens,基于独立成分分析(ICA)高效提取语言模型表示中可解释方向,无需训练稀疏自编码器,在SAEBench上表现竞争力。
Comments Ongoing Project
低秩排序:稀疏成对比较下不确定性感知的任务特定大语言模型排名
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 提出一种低秩框架,通过稀疏成对比较进行任务特定的大语言模型排名,利用任务-模型能力矩阵的低秩结构实现跨任务信息共享,并开发了不确定性量化方法以提供置信区间和排名证书。
毒性存在于何处?语言模型中的机制定位与定向抑制
机构 * Indian Institute of Technology Gandhinagar(印度理工学院冈德辛加尔)
专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过分析毒性与中性提示的激活差异,定位特定层和神经元中的毒性,并利用推理时缩放或最小秩一权重编辑进行抑制,无需梯度下降,实现毒性降低同时保持语言质量。
专家反击:在专家层面解读混合专家语言模型
机构 * Department of Informatics, University of Hamburg, Hamburg, Germany(汉堡大学信息学院)
专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过k稀疏探测比较MoE专家与密集FFN,发现专家神经元更单语义,提出以专家为分析单位,揭示专家是细粒度任务专家,而非领域专家或token处理者。
Comments 8 pages, 7 Figures. Accepted at ICML 2026. Improved writing, changed author order, updated citations
揭示和塑造视觉-语言模型中3D场景拓扑的潜在表示
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)
专题命中 知识编辑与模型理解 :language model(title,abstract);SFT(abstract,abstract_cn)
AI总结 本文研究了视觉-语言模型是否能构建3D环境的拓扑表示,通过隔离空间子空间并数学塑造潜在表示,证明其与场景3D高斯核图的拉普拉斯特征映射一致,并在空间任务中提升性能。
通过概念描述解读语言模型:一项调查
机构 * BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所) ; Technische Universität Berlin(柏林技术大学)
专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文调查了通过生成自然语言概念描述来解读模型组件和抽象的方法,揭示了生成这些描述的关键方法、评估指标及数据集,并指出对更严谨因果评估的需求。
Comments Accepted at The Eight Workshop on Analyzing and Interpreting Neural Networks for NLP (BlackboxNLP), co-located with EMNLP 2025
开放式交互的双刃剑:LLM驱动的NPC如何影响玩家的认知负荷和游戏体验
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究探讨LLM驱动NPC对玩家认知负荷和游戏体验的影响,揭示心理机制、任务场景差异及个体特质作用,发现NPC显著增加认知负荷但未提升整体体验,且效果随任务场景变化。
CIR+CVN:连接LLM语义理解与Petri网验证以实现并发程序
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出CIR+CVN框架,通过LLM生成并发抽象模型,结合Petri网验证并发程序,实现迭代调试与修复,提升并发程序的可靠性。
每种回应都重要:通过张量分解量化基于大语言模型的多智能体系统不确定性
机构 * Arizona State University(亚利桑那州立大学) ; University of California, Riverside(加利福尼亚大学河滨分校)
专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出MATU框架,通过张量分解量化多智能体系统中的不确定性,解决多步推理、通信路径变化和拓扑多样性等挑战,提供通用可靠性评估。
Comments Accept to ACL 26
探索人类交互模式的地图:协作与创造力的洞察
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文通过系统分析110篇人类与LLM交互研究,提出一种新的映射方法,揭示协作与创造力领域的研究现状与挑战。
TrustTrade: 人类启发的选 择性共识降低LLM交易代理决策不确定性
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 TrustTrade通过引入多代理选择性共识框架,减少LLM交易代理在高噪声市场中的决策不确定性,提升风险意识和稳定性。
Comments 24 pages, 7 figures
LaMoGen:通过LLM引导的符号推理实现语言到动作生成
机构 * Department of Computer Science, Hong Kong Baptist University, HKSAR(香港 Baptist 大学计算机科学系)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 LaMoGen通过LLM引导的符号推理实现语言到动作的生成,利用LabanLite动作表示提升动作的可解释性和可控性。
Comments Accepted by CVPR 2026. Supplementary material included. Project page: https://jjkislele.github.io/LaMoGen/
通过概念空间对齐实现统一的视觉-语言建模
机构 * University of Edinburgh(爱丁堡大学) ; FAIR at Meta(Meta公司FAIR团队)
专题命中 知识编辑与模型理解 :language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过概念空间对齐实现统一的视觉-语言建模,V-SONAR在多语言和多模态任务中超越现有模型。
Comments ICLR 2026
LitterBox+: 一种可扩展的LLM增强Scratch静态代码分析框架
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 LitterBox+通过将Scratch块式代码转换为文本形式,利用LLM生成能力提升静态代码分析,提供API和界面扩展,支持代码查询与修复,提升学习者编程体验。
Comments ASE 2025 Tool Demonstration Track
LogicScan: 一种基于大语言模型的智能合约业务逻辑漏洞检测框架
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 LogicScan利用大语言模型和业务规范语言,通过挖掘链上协议的业务不变量,实现对智能合约业务逻辑漏洞的高效检测。
利用突变分析改进基于大语言模型的量子程序修复
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出利用突变分析提升基于大语言模型的量子程序修复效果,通过设计不同提示配置实验,发现突变分析能显著提高修复成功率和解释质量。
Comments 6 pages, Accepted at SANER-ERA 2026
基于大语言模型的伪相关反馈
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出一种结合大语言模型的伪相关反馈方法,通过在RM3计算前过滤相关文档,提升查询扩展的鲁棒性和准确性。
Comments Accepted ECIR 2026
角色扮演如何塑造零样本LLM排序器的相关性判断
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本研究探讨角色扮演如何影响零样本LLM排序器的相关性判断,发现角色描述的精心制定显著提升排序质量,且角色信号主要在早期层编码,为设计更有效的提示提供了指导。
通过协同LLM-Transformer架构提升金融预测:一种股票价格预测的混合方法
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出混合LLM-Transformer架构,通过融合文本和数值数据提升股票价格预测精度,实验证明模型在噪声环境下具有更强的鲁棒性和可解释性。
Comments 14 pages, 6 Figures, 3 Tables