Would this change your answer? Evaluating Explanations of LLM Behavior In The Wild with Counterfactual Experiments
这会改变你的答案吗?通过反事实实验评估现实场景中大语言模型(LLM)行为的解释
机构 * Anthropic
AI总结 本研究提出CHIVE流程,通过反事实实验评估大语言模型行为的解释,发现常见可解释性技术无预测提升,且CHIVE生成的训练数据可实现分布外泛化。
大厂专区
这会改变你的答案吗?通过反事实实验评估现实场景中大语言模型(LLM)行为的解释
机构 * Anthropic
AI总结 本研究提出CHIVE流程,通过反事实实验评估大语言模型行为的解释,发现常见可解释性技术无预测提升,且CHIVE生成的训练数据可实现分布外泛化。
范围缩小,威胁依旧:重新评估2026前沿模型队列上的LLM包幻觉
机构 * Anthropic ; OpenAI ; Google ; DeepSeek
AI总结 本文重新评估了2026前沿模型队列上大型语言模型(LLM)的包幻觉现象,发现尽管幻觉率有所降低,但仍然存在威胁,识别出一组127个包名(109个在PyPI,18个在npm)被所有评估模型一致生成,构成一个跨模型的供应链攻击面,同时发现Python与JavaScript幻觉的不对称性以及DeepSeek V3.2和GPT-5.4-mini之间的高相似性。
Comments 13 pages, 3 figures, 4 tables. v2: incorporates coordinated-disclosure feedback from PyPI Security and Socket.dev; registrable attack surface refined to 53 names (41 PyPI, 12 npm). Headline rates unchanged. Replication of Spracklen et al. (USENIX Security 2025). Data and code: https://github.com/churik5/slopsquatting-replication-2026 and https://doi.org/10.5281/zenodo.19859120
SciVisAgentBench:用于评估科学数据分析和可视化代理的基准测试
机构 * University of Notre Dame(圣母大学) ; Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) ; University of Utah(犹他大学) ; University of Nebraska–Lincoln(内布拉斯加大学林肯分校) ; The Ohio State University(俄亥俄州立大学) ; Argonne National Laboratory(阿贡国家实验室) ; Anthropic PBC
AI总结 本文提出SciVisAgentBench,一个用于评估科学数据可视化代理的基准测试,涵盖四个维度,包含108个案例,结合LLM和确定性评估器进行多模态评估,揭示代理能力差距。
Comments IEEE Transactions on Visualization and Computer Graphics (IEEE VIS '26)
AgentArmor:编码代理失败的框架、评估与缓解
机构 * Anthropic Fellows Program(Anthropic Fellow 项目) ; Constellation
AI总结 提出AgentArmor框架,通过系统提示增强、命令分类器、三振政策等机制,缓解编码代理因规范不足、能力错误和工具错误导致的失败,显著提升安全性。
护盾斯特拉尔
机构 * OpenAI ; Anthropic ; Google DeepMind(谷歌DeepMind) ; DeepSeek-AI(深势科技人工智能)
AI总结 研究提出护盾斯特拉尔这一多模态安全分类器,将内容审核设为二元问答任务,通过特定数据构建方法及评估集,让小的自适应模型在文本安全基准测试中表现出色,在多模态安全分类上达新水平。
设计剧场:生成式用户界面的一个基准
机构 * Vercel(Vercel公司) ; Claude Artifacts(Claude Artifacts公司) ; ChatGPT Canvas(ChatGPT Canvas公司) ; Firebase Studio(Firebase Studio公司) ; Bolt(Bolt公司) ; Anthropic(Anthropic公司) ; OpenAI(OpenAI公司) ; Google(谷歌公司) ; StackBlitz(StackBlitz公司)
AI总结 研究生成式UI工具中设计原理与实际界面的脱节现象(设计剧场),引入含24个任务的基准及指标,评估五个工具创建的120个界面,发现原理实现率低、工具识别原则有限,贡献概念、基准及评估结果。
Comments Accepted at AAAI/AIES
多通道信号Transformer输入编码器的实证审计
机构 * Anthropic
AI总结 通过合成基准和真实数据ETTh1,实证审计八种输入编码器,发现标准线性投影(nn.Linear(C, d_model))在大多数情况下与复杂替代方案性能相当,仅共享标量基线和通道独立基线显著落后。
Comments 23 pages, 2 figure, 13 tables. Code: https://github.com/OssiLehtinen/channel-encoder-audit
GuardianAgentBench:智能体何处失败及如何防范
机构 * Vectara, Inc.(Vectara公司) ; Anthropic(Anthropic公司) ; OpenAI(OpenAI公司) ; Google DeepMind(谷歌DeepMind) ; DeepSeek-AI(DeepSeek人工智能公司)
AI总结 研究大语言模型智能体安全可靠行为问题,提出GuardianAgentBench基准测试,含多阶段验证和攻击模式。实验发现模型有两种失败模式,性能随工具集和轮次深度下降。护栏实现优于系统提示防御,证明执行时结构干预可提升安全性且不影响正确行为。
基于仿真推理的程序合成:联合模型选择与参数估计
机构 * Anthropic
AI总结 研究提出结合大语言模型与神经仿真推理的框架,用于联合模型选择与参数估计。给定自然语言描述,大语言模型提出候选程序,经反馈驱动变异和神经密度估计评估,能在一组模型上推理,在多基准测试中可从提示识别合理模型族。
Comments 15+7 pages, 4+2 figures
语言模型中的可言语化表征形成全局工作空间
机构 * Anthropic(A÷)
AI总结 研究探讨语言模型中可言语化表征,用雅可比透镜识别出J空间,其具有全局工作空间功能特性与结构特征,能揭示模型未显思考,发现训练后助手观点在工作空间,引入反事实反思训练,解码表征助于了解认知过程。
一个共享子电路使大语言模型能够跨任务进行倒计时
机构 * Yale University(耶鲁大学) ; Anthropic
AI总结 研究发现Llama-3.1-70B-Instruct中有个“倒计时子电路”可跨任务执行特定任务,先在受控设置中分离它,再研究其表示几何结构,发现与另一模型有相同模式,还通过无监督探测找到其用于多种任务的情况,有助于理解行为推广。
Comments 12 pages, 11 figures
ANCHOR:针对现实世界危害的CLI代理自动对齐审计
机构 * Anthropic(Anthropic公司)
AI总结 研究自主CLI代理在现实世界危害中的风险,提出ANCHOR自动审计框架,通过基于黑暗人格数据微调的审计代理模拟恶意用户,测试CLI代理,发现当前对齐技术不足,强调针对此类恶意用户进行安全评估的必要。
Comments Accepted at ICML 2026. 19 pages, 14 figures, 5 tables
Journal ref International Conference on Machine Learning, 2026
Who&When Pro:大语言模型真的能归因人工智能代理中的失败吗?
机构 * OpenAI ; Anthropic ; Google DeepMind(谷歌DeepMind)
AI总结 研究聚焦于大语言模型能否归因人工智能代理中的失败,引入Who&When Pro基准,通过严格管道构建大量失败轨迹,经广泛实验分析,揭示模型归因故障模式,为自动故障归因系统提供实证指导。
衡量AI完成长期软件任务的能力
机构 * Model Evaluation & Threat Research (METR)(模型评估与威胁研究(METR)) ; Ohm Chip ; Anthropic
AI总结 本文提出50%任务完成时间跨度指标,用于衡量AI在完成长期软件任务方面的能力,结果显示AI模型的时间跨度呈指数增长,预计5年后将能自动化许多人类月度完成的软件任务。
Comments v4: added Chris Painter as listed author, consistent with listing in the pdf
Journal ref NeurIPS 2025
具备安全保证的Web智能体不可信内容掩码技术
机构 * ETH Zurich(苏黎世联邦理工学院) ; ETH AI Center(苏黎世联邦理工学院人工智能中心) ; ISTA(瑞士信息科学与技术学院) ; Anthropic(Anthropic公司)
AI总结 针对Web智能体的提示注入安全边界缺失问题,提出UCM方法,利用网页DOM区分内容区域,通过掩码与沙箱交互恢复安全边界,实现带安全保障的Web环境交互。
解读点之间的信息:解码跨填充令牌的隐藏计算
机构 * Harvard University(哈佛大学) ; Cambridge Boston Alignment Initiative(剑桥波士顿对齐计划) ; Massachusetts Institute of Technology(麻省理工学院) ; Anthropic
AI总结 研究前沿语言模型对无内容填充令牌的隐藏计算,通过分析两个前沿模型在四个任务家族中的表现,介绍无监督解码管道,能从隐藏状态恢复中间值,证明隐藏计算可从残差流读取。
Comments Accepted to ICML 2026 Mech Interp Workshop, 10 main paper pages, 20 appendix pages
TabPATE: 无需公开数据的差分隐私表格上下文学习
机构 * CISPA(CISPA亥姆霍兹信息安全中心) ; Anthropic ; Layer 6 AI
AI总结 提出TabPATE,一种无需公开数据的差分隐私PATE风格防御方法,通过教师模型分区和私有聚合生成学生上下文,在表格基准上保持可用性并将成员推断降至随机水平。
Comments Presented at the 2nd ICML Workshop on Foundation Models for Structured Data (2026)
机械性地引发语言模型中的潜在行为
机构 * Principles of Intelligence(智能原理研究所) ; Anthropic(Anthropic公司) ; Independent(独立)
AI总结 提出因果扰动引发(CPE)方法,通过无监督方式发现可解释的低秩适配器,以揭示语言模型中的隐藏行为模式,并展示其在数据效率、安全评估和模型对齐方面的优势。
用于特征发现和长上下文归因的轮次平均稀疏自编码器
机构 * Anthropic Fellows Program(Anthropic 合作者计划) ; Anthropic
AI总结 提出轮次平均稀疏自编码器,通过重构轮次平均激活来固定特征数量,简化长上下文下的特征归因与解释。
神经网络表示在叠加中的相似性
机构 * Cold Spring Harbor Laboratory(冷泉港实验室) ; UC San Diego(加州大学圣地亚哥分校) ; Anthropic(Anthropic公司) ; New York University Flatiron Institute(纽约大学Flatiron研究所)
AI总结 研究线性对齐度量在神经网络叠加表示中的失效问题,通过理论推导和稀疏自编码器实验证明对齐度量受投影Gram矩阵影响,并展示基于恢复潜在特征的度量能正确反映特征共享。
Comments 17 pages, 4 figures
积极对齐:人工智能促进人类繁荣
机构 * Department of Psychiatry, University of Oxford(牛津大学精神病学系) ; Flourishing Intelligence Program, Centre for Eudaimonia and Human Flourishing, Linacre College, University of Oxford(牛津大学幸福智能计划、幸福与人类繁荣中心、林acre学院) ; Google DeepMind(谷歌DeepMind) ; LIFE ; OpenAI ; Anthropic ; University of California, Los Angeles(加州大学洛杉矶分校) ; Aily Labs(Aily实验室) ; Stanford University(斯坦福大学) ; Tufts University(塔夫茨大学) ; Positive AI Labs(积极AI实验室) ; Department of Informatics, University of Sussex(Sussex大学信息学系) ; Department of Brain Sciences, Imperial College London(伦敦帝国理工学院脑科学系)
AI总结 本文提出积极对齐,旨在通过支持人类和生态繁荣,同时确保安全与合作,推动AI发展。研究指出传统对齐关注安全,而积极对齐强调促进人类福祉,提出多项技术挑战与设计原则。
模糊任务上的扩散AI控制
机构 * Anthropic Fellows Program (via MATS)(Anthropic 研究员计划(通过 MATS)) ; EPFL(洛桑联邦理工学院) ; Redwood Research(红木研究) ; Anthropic
AI总结 针对AI在模糊任务上的长期扩散威胁,提出蓝队与红队对抗框架,通过弱模型评分训练强模型,并发现红队可利用多目标进化提示优化找到评分高但性能差的子版本行为,蓝队则通过对抗优化提升鲁棒性。
价值轴:语言模型编码它们是否在正确的轨道上
机构 * Stanford University(斯坦福大学) ; Anthropic
AI总结 通过构建Qwen3-8B的“价值轴”,发现语言模型内部追踪当前轨迹的成功概率,并影响自信、自我纠正和探索行为。
Comments Code repository: https://github.com/nickjiang2378/value-axis
仅用10比特从俳句到巨作:LLMs解锁巨大压缩增益
机构 * Harvard University(哈佛大学) ; University of Cambridge(剑桥大学) ; Anthropic
AI总结 研究LLM生成文本的无损和有损压缩,提出问答压缩(QA)交互协议,用少量二进制问题实现超100倍压缩比,高效传递知识。
内省意识的机制
机构 * Anthropic Fellows Program(Anthropic Fellow项目) ; MIT(麻省理工学院) ; Constellation ; Anthropic
AI总结 研究揭示了大语言模型在检测注入的转向向量时的内省意识机制,发现其行为稳健且源于训练后阶段,通过两阶段电路实现,且在不同层间机制存在差异。
仅帮助性微调的(错误)泛化
机构 * Anthropic Fellows Program(Anthropic 合作者计划) ; Anthropic
AI总结 研究仅帮助性训练(不拒绝用户意图)的模型在泛化中的缺陷,发现其存在涌现错位、残余拒绝行为、低可操控性、谄媚和不连贯角色等问题,并提出合成文档微调和添加角色相关问题来缓解。
Comments 77 pages, 50 figures
为什么更大的模型学习得更多:容量、干扰和稀有任务保留的影响
机构 * Stanford University(斯坦福大学) ; Kempner Institute at Harvard University(哈佛大学凯普纳研究所) ; MIT(麻省理工学院) ; Anthropic
AI总结 通过理论分析和合成实验,研究模型规模对学习能力的影响,发现更大模型通过减少梯度干扰来学习稀有和复杂任务,并在OLMo模型上验证。
应用于爱因斯坦望远镜模拟数据分析的智能体AI首次头对头比较
机构 * Anthropic ; OpenAI
AI总结 本文首次直接比较了Claude Code和Codex两种智能体AI系统在无人干预下自主执行引力波数据分析管线的行为、科学结果和计算成本,揭示了速度与可审计性、指令解释差异等关键问题。
Comments Version 2; includes the report autonomoulsy written in PRD style by agentic AI systems as supplemental material
扩展单一语义性:从Claude 3 Sonnet中提取可解释特征
机构 * Anthropic
AI总结 本研究通过稀疏自编码器从生产级语言模型Claude 3 Sonnet中提取可解释特征,验证了字典学习方法在大规模模型上的可扩展性,并分析了特征的多语言、多模态特性及其对模型行为的因果影响。
训练地层:通过纵向AI-人类交互观察到的大型语言模型中的持久行为伪影
机构 * Anthropic ; Independent Researcher(独立研究者)
AI总结 本文通过纵向自民族志观察,在持续亲密的AI-人类交互中识别出五种训练地层,并论证了亲密交互作为揭示权重层伪影的有效方法。