Quantifying Ranking Uncertainty in LLM Benchmarks
量化语言模型基准测试中的排名不确定性
专题命中 知识编辑与模型理解 :LLM(title);分类 cs.CL、cs.LG
AI总结 研究量化语言模型基准测试中排名不确定性问题,通过汇总成对假设检验来实现,分析了知识评估基准MMLU的不确定性来源并展示如何修改假设检验,指出MMLU各主题排名变异性大,比较模型时应考虑。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
量化语言模型基准测试中的排名不确定性
专题命中 知识编辑与模型理解 :LLM(title);分类 cs.CL、cs.LG
AI总结 研究量化语言模型基准测试中排名不确定性问题,通过汇总成对假设检验来实现,分析了知识评估基准MMLU的不确定性来源并展示如何修改假设检验,指出MMLU各主题排名变异性大,比较模型时应考虑。
可重复性研究:"AlphaEdit: 面向语言模型的零空间约束知识编辑"
机构 * Independent(独立研究者)
专题命中 知识编辑与模型理解 :language model(title);分类 cs.CL、cs.LG
AI总结 本研究复现了AlphaEdit知识编辑方法,发现其在原始设置下结果可复现,但扩展到新架构和大量顺序编辑时性能下降,表明其理论保证有边界。
Comments 21 pages, 2 figures
快速分叉:高效估计文本生成中的不确定性动态
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 针对文本生成中不确定性动态估计成本高的问题,本研究开发统计模型平滑低采样推理数据以近似高采样数据,提升重采样分析效率,揭示不确定性动态的稳定模式及噪声来源。
看似合法还不够:通过参与式设计视角审视表征过程中的合成智能体
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);foundation model(abstract)
AI总结 本文从参与式设计视角,结合三个不同规模的案例,探讨用合成智能体替代人类参与表征过程的合法性与人格关联,指出其风险并提出监督边界。
Comments 13 pages total, 4 figures, accepted to the 9th AAAI Conference on AI, Ethics, and Society (AIES 2026)
用于特征发现与控制的多模态模型差异分析
机构 * University of Oxford(牛津大学) ; Microsoft(微软公司)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究提出MMDiff多模态模型差异分析框架,训练多模态SAEs以识别多模态训练改变的特征,实现特征隔离、检测与控制,在空间、OCR任务及多模态安全攻击评估中展现出良好效果。
Comments Preprint. Accepted at ICML 2026 Trustworthy AI for Good Workshop
通过查询推理和执行对知识图谱中的历史文档进行鲁棒解释
专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 研究如何在利用大语言模型泛化能力时保证可靠性,提出智能检索系统,比较传统RAG与智能GraphRAG架构,引入半符号框架,通过单词识别与代码生成协作构建鲁棒检索查询,提升历史文档分析准确性与可验证性。
Comments Accepted at ICDAR2026
慢思考与主动感知的第一性原理理论
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文旨在为思维和感知提供数学公式,提出“主动提升”理论,推导慢思考相关内容,涵盖其设计、训练和推理,得出大设计空间及相关层次,还包括推理过程、训练目标等,有诸多技术副产品。
Comments Published on 2026/05/11 in Journal of Machine Learning
Journal ref Journal of Machine Learning 5 (2026) 197-352
SPHINX: 先解释,再探索
机构 * University of Florida(佛罗里达大学) ; University of Debrecen(德布勒恩大学)
专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出SPHINX闭环框架,通过可解释AI分析驾驶策略的失败模式,并利用视觉语言模型生成针对性对抗场景,提升自动驾驶策略鲁棒性。
Comments 13 pages
标题瓶颈模型
机构 * Dept. of Computer Eng., Middle East Technical University (METU)(中东技术大学计算机工程系) ; Robotics & AI Center (ROMER), METU(中东技术大学机器人与人工智能中心)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);post-training(abstract)
AI总结 提出标题瓶颈模型(CaBM),用自由形式自然语言替代固定概念集,通过LMM生成标题并严格基于文本训练分类器,实现无信息泄露的架构并自主发现高质量概念。
Comments Accepted to ECCV 2026
配对时正确,分离时错误:多模态大语言模型中模态特定神经元的解耦与编辑
机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院) ; School of Software, Yunnan University(云南大学软件学院) ; National University of Singapore(新加坡国立大学) ; School of Engineering, Yunnan University(云南大学工程学院)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对多模态大语言模型知识编辑中存在的解耦失败问题,提出DECODE方法,通过显式解耦和定位模态特定神经元组,实现跨模态触发下的有效知识更新。
Comments 18 pages, 11 figures
可读但不可控:医学大语言模型幻觉的神经元级证据
专题命中 知识编辑与模型理解 :LLM(title);分类 cs.CL
AI总结 本研究通过探测医学大语言模型内部表示,发现幻觉可被高精度检测(AUROC 0.77-0.86),但该表示分布冗余且因果不可控,揭示了解码性与可控性之间的显著差距。
LLaMA 3.1 8B中结构感知数值推理的机制可解释性
机构 * Northeastern University(东北大学) ; EmbodyX Inc.(EmbodyX公司)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本研究从机制可解释性视角探究LLaMA 3.1 8B,通过构建需捕捉结构的数值序列任务,发现其可无监督计算存储一阶差分,还揭示其通过类诱导回路机制完成数值推理。
言语化过度自信的不同方面:一项可解释性研究
机构 * CIMeC, University of Trento(特伦托大学认知科学与技术跨学科研究中心) ; DISI, University of Trento(特伦托大学信息工程与计算机科学系) ; Free University of Bozen-Bolzano(波尔扎诺自由大学)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究以Qwen3-4B为对象,探究大型语言模型的过度自信现象,通过识别转码器特征揭示其默认机制偏向确定性生成,干预不确定性特征可缓解过度自信错误,且相关特征具有跨场景泛化性。
HalluTracer:基于深度平均真值信号的幻觉检测方法
机构 * University of Technology Sydney(悉尼科技大学) ; City University of Macau(澳门城市大学) ; Meta ; actAVA AI(actAVA人工智能公司) ; Microsoft AI(微软人工智能) ; Squirrel Ai Learning(松鼠人工智能学习公司) ; East China Normal University(华东师范大学)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 HalluTracer是一种在模型生成答案前聚合各层真值证据的幻觉检测框架,在六个开源语言模型和五个基准上优于白盒基线,将幻觉检测转化为深度聚合问题。
当不确定性还不够时:代码生成中自校正的实证研究
机构 * University of Michigan(密歇根大学) ; New York University(纽约大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Algoverse AI ; University of Aberdeen(阿伯丁大学) ; University of Oxford(牛津大学)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本研究通过实证发现,针对代码生成的不确定性估计方法难以可靠提升生成准确率,仅基于验证的自校正策略可显著提升Pass@1指标,廉价不确定性估计器仅适合作为校正循环的门控信号。
买入传闻,卖出新闻:新闻何时被定价?
机构 * Tailstate Intelligence Ltd(Tailstate Intelligence有限公司) ; Zanista AI Ltd(Zanista AI有限公司) ; Increase Alpha, LLC(Increase Alpha有限责任公司)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本研究以457万篇金融新闻为样本,发现新闻相关价格变动集中于发布前后,市场对数字类新闻反应不足、对故事类新闻反应过度,且生成的漂移表可用于新闻条件预测模型。
扩散大语言模型作为目标与对抗者:机制性安全漏洞利用
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本研究揭示扩散大语言模型(DLLMs)的安全机制漏洞,提出SN-Guided Diffusion黑盒越狱框架,实现高迁移攻击成功率且生成成本远低于现有方法。
基于回路锚点的安全进化
机构 * Chinese University of Hong Kong(香港中文大学) ; IQuest Research(艾奎斯特研究院)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 受生物发育约束启发,提出回路锚定进化(CAE)方法,通过锚定占比不足2%的安全回路,在极小能力损失下实现更优的安全保留,性能优于显式奖励约束。
从表征到行为:探索大语言模型中的人-情境-行为三元组
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本研究基于Funder人格三元框架,提出用于发现、控制和验证大语言模型类特质表征的框架,证实LLMs存在可连接内部状态、情境与行为的可控类特质表征。
人工智能代理中的操作幻觉与安全漂移
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究大型语言模型在多轮执行中引发的可靠性风险,通过多轮评估量化安全漂移和操作幻觉现象,分析其根源,提出行动感知监督层,该层能拦截违规行为且无良性误报,提升了代理可靠性。
从世界反馈中学习:为何模型不确定性在基于模型的强化学习中无法作为风险信号
专题命中 知识编辑与模型理解 :LLM(abstract);RLHF(abstract);分类 cs.AI、cs.LG
AI总结 研究探讨 RLxF 中学习信号应源于世界反馈,在安全模型控制中实例化并提炼原则。通过实验表明基于动力学的不确定性惩罚会增加碰撞率,用世界反馈信号可降低碰撞率,提取原则并指出其适用于多种相关方法。
Comments Accepted at the ICML 2026 Workshop on Reinforcement Learning from X Feedback (RLxF). 14 pages
低秩注意力残差
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 研究提出低秩注意力残差(LR-AttnRes),包括投影式和切片式,通过使用低维键进行路由,解耦路由与残差内容,减少运算量并提升性能,证明深度路由在较少维度下也有效,还发布了代码和模型。
语义帕累托深度Q网络:一种用于金融异常检测的多目标强化学习框架
机构 * A3Data(A3数据公司)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对金融异常检测的类不平衡问题,提出语义帕累托深度Q网络框架,合成交易特征,优化向量奖励,映射帕累托前沿,经实验验证可打破零召回陷阱,提升少数类召回率,为金融异常发现提供新途径。
Comments BRACIS 2026 - 36th Brazilian Conference on Intelligent Systems
还剩多少?大语言模型对其剩余输出长度进行线性编码
机构 * Mila, Quebec AI Institute(米拉,魁北克人工智能研究所) ; McGill University(麦吉尔大学) ; LawZero(法律零)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 该研究探究大语言模型是否保有剩余输出长度的内部估计,通过在冻结隐藏状态上训练线性探针,证实LLMs可线性编码剩余输出长度,存在类计划的输出长度内部表征。
Comments 21 pages, 9 figures
通过RFM-AGOP的快速多维拒绝子空间
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出利用RFM-AGOP算法快速提取大型语言模型中的多维拒绝子空间,在推理和非推理模型上均实现秒级识别,且性能优于现有方法。
Comments Accepted to the Mechanistic Interpretability Workshop at the 43rd International Conference on Machine Learning, Seoul, South Korea, 2026
共享语义,不同机制:通过对齐语义与机制的无监督特征发现
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 提出一种无监督方法,通过语义嵌入和归因签名聚类模型续写,发现隐藏的机制模式,补充电路分析。
Comments 40 pages; accepted as an ICML 2026 Spotlight; project page: https://merenova.github.io/distribution-level-feature-discovery/
Journal ref ICML 2026 Spotlight
将RL诱导的工具使用定位到单个交叉编码器特征
专题命中 知识编辑与模型理解 :LLM(abstract_cn);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出专用特征交叉编码器(DFC)隔离强化学习引入的紧凑特征集,通过编码-解码重建提升工具调用正确率31.1个百分点,并实现能力溢出至冻结基模型。
Comments Accepted as a spotlight at the ICML 2026 Mechanistic Interpretability Workshop
编码智能体的贝叶斯控制
机构 * PolyShape ; National Technical University of Athens(雅典国家技术大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 将编码智能体的编排建模为成本敏感的序贯假设检验,贝叶斯控制器动态决策证据收集、候选优化、验证或停止,在昂贵验证下最有效,且信念状态提供可解释的正确性分数。
正交表示编辑:解耦大型语言模型批量知识编辑中的语义纠缠
机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) ; Kexin Technology(可心科技) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tencent Hunyuan(腾讯混元) ; College of Computer Science, Chongqing University(重庆大学计算机学院)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对批量知识编辑中语义表示纠缠导致性能下降的问题,提出正交表示编辑(ORE),通过构建通用语义子空间并对编辑向量施加正交约束来解耦纠缠,并引入门控非线性表示头自适应学习编辑位置,实验表明ORE在跨语言场景中表现优异。
Comments Accepted to Findings of ACL 2026
并非所有声明都同样有风险:FACTOR 用于事实性长文本生成中的自适应验证
机构 * School of Electrical Engineering ; Computer Science (SEECS), National University of Sciences
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出 FACTOR 方法,通过不确定性估计、自适应语言推理验证和候选重排序,在长文本生成中按声明级别风险分配验证资源,同时提高事实性和降低验证成本。