arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Anthropic

共收录 100
2608.16747 2026-08-18 cs.LG cs.AI 新提交

Would this change your answer? Evaluating Explanations of LLM Behavior In The Wild with Counterfactual Experiments

这会改变你的答案吗?通过反事实实验评估现实场景中大语言模型(LLM)行为的解释

Adam Karvonen, Euan Ong, Subhash Kantamneni, Samuel Marks

机构 * Anthropic

AI总结 本研究提出CHIVE流程,通过反事实实验评估大语言模型行为的解释,发现常见可解释性技术无预测提升,且CHIVE生成的训练数据可实现分布外泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17062 2026-08-11 cs.CR cs.LG cs.SE 版本更新

The Range Shrinks, the Threat Remains: Re-evaluating LLM Package Hallucinations on the 2026 Frontier-Model Cohort

范围缩小,威胁依旧:重新评估2026前沿模型队列上的LLM包幻觉

Aleksandr Churilov

机构 * Anthropic OpenAI Google DeepSeek

AI总结 本文重新评估了2026前沿模型队列上大型语言模型(LLM)的包幻觉现象,发现尽管幻觉率有所降低,但仍然存在威胁,识别出一组127个包名(109个在PyPI,18个在npm)被所有评估模型一致生成,构成一个跨模型的供应链攻击面,同时发现Python与JavaScript幻觉的不对称性以及DeepSeek V3.2和GPT-5.4-mini之间的高相似性。

Comments 13 pages, 3 figures, 4 tables. v2: incorporates coordinated-disclosure feedback from PyPI Security and Socket.dev; registrable attack surface refined to 53 names (41 PyPI, 12 npm). Headline rates unchanged. Replication of Spracklen et al. (USENIX Security 2025). Data and code: https://github.com/churik5/slopsquatting-replication-2026 and https://doi.org/10.5281/zenodo.19859120

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29139 2026-08-11 cs.AI cs.GR cs.HC 版本更新

SciVisAgentBench: A Benchmark for Evaluating Scientific Data Analysis and Visualization Agents

SciVisAgentBench:用于评估科学数据分析和可视化代理的基准测试

Kuangshi Ai, Haichao Miao, Kaiyuan Tang, Nathaniel Gorski, Jianxin Sun, Guoxi Liu, Helgi I. Ingolfsson, David Lenz, Hanqi Guo, Hongfeng Yu, Teja Leburu, Michael Molash, Bei Wang, Tom Peterka, Chaoli Wang, Shusen Liu

机构 * University of Notre Dame(圣母大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) University of Utah(犹他大学) University of Nebraska–Lincoln(内布拉斯加大学林肯分校) The Ohio State University(俄亥俄州立大学) Argonne National Laboratory(阿贡国家实验室) Anthropic PBC

AI总结 本文提出SciVisAgentBench,一个用于评估科学数据可视化代理的基准测试,涵盖四个维度,包含108个案例,结合LLM和确定性评估器进行多模态评估,揭示代理能力差距。

Comments IEEE Transactions on Visualization and Computer Graphics (IEEE VIS '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19380 2026-08-07 cs.SE cs.LG 版本更新

ClayBuddy: A Framework, Evaluation, & Mitigation of Coding Agent Failures

AgentArmor:编码代理失败的框架、评估与缓解

Kenneth Ge, Andre Assis

机构 * Anthropic Fellows Program(Anthropic Fellow 项目) Constellation

AI总结 提出AgentArmor框架,通过系统提示增强、命令分类器、三振政策等机制,缓解编码代理因规范不足、能力错误和工具错误导致的失败,显著提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25857 2026-08-06 cs.CL cs.CV 版本更新

Shieldstral

护盾斯特拉尔

Antonia Calvi, Avinash Sooriyarachchi, Giada Pistilli, Guillaume Lample, Maarten Buyl, Maximilian Augustin, Maximilian Müller, Pierre Stock, Tom Bewley, Wassim Bouaziz, Yimu Pan, Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra, Adrian Valente, Adrien Petralia, Adrien Sadé, Alan Jeffares, Albert Jiang, Aleksandr Timashov, Alexandre Cahill, Alexandre Gavaudan, Alexandre Laval, Alexandre Sablayrolles, Amélie Héliou, Amos You, André Jonasson, Andrew Bai, Andrew Ehrenberg, Andrew Zhao, Angele Lenglemetz, Anmol Agarwal, Arata Suzuki, Arjun Majumdar, Arthur Fournier, Artjom Joosen, Aylin Guliz Akkus, Aysenur Karaduman, Baptiste Bout, Baptiste Rozière, Baudouin De Monicault, Benjamin Holzschuh, Benjamin Lefaudeux, Benjamin Tibi, Bernhard Stadlbauer, Błażej Osiński, Camille Le Scao, Chaoran Yu, Charlotte Cronjäger, Chen-Yo Sun, Chris Bamford, Christian Wallenwein, Christophe Renaudin, Clémence Lanfranchi, Corentin Barreau, Corentin Sautier, Cristiana-Diana Diaconu, Cyprien Courtot, Daniel Marczak, Darius Dabert, Diego de Las Casas, Dominik Nuss, Dylan Rubini, Dzmitry Soupel, Elizaveta Demyanenko, Elliot Chane-Sane, Emilien Fugier, Emmanuel Gottlob, Erik Aas, Etienne Goffinet, Étienne Millon, Eujeong Choi, Fabian Paischer, Fabian Schlager, Faruk Ahmed, Federico Baldassarre, Filip Szatkowski, Florian Wiesner, Gabrielle Berrada, Gaëtan Ecrepont, Gaétan Lepage, Gaspard Blanchet, Gaspard Donada-Vidal, Gauthier Delerce, Gauthier Guinet, Genevieve Hayes, Georgii Novikov, Gianluca Galletti, Guillaume Breton, Guillaume Kunsch, Guillaume Martin, Guillaume Raille, Gunjan Dhanuka, Gunshi Gupta, Han Zhou, Harshil Shah, Hasan Furkan Vural, Hédi Hadiji, Hope McGovern, Hugo Cisneros, Hugo Thimonier, Indraneel Mukherjee, Ivan Cuevas Salazar, Jacques Sun, Jan Ludziejewski, Jason Rute, Jean Quentin, Jean-Hadrien Chabran, Jean-Malo Delignon, Jie Zhang, Joachim Studnia, Joep Barmentlo, Johannes Brandstetter, John Harvill, Jonas Amar, Jonas Schweizer, Joséphine Delas, Josselin Somerville, Julien Denize, Julien Tauran, Kartik Khandelwal, Khyathi Raghavi Chandu, Kilian Tep, Kush Jain, Larissa Laich, Laura Calem, Laurence Aitchison, Laurent Callot, Laurent Fainsin, Léo Cotteleer, Léonard Blier, Lingxiao Zhao, Louis Martin, Louis Serrano, Lucile Saulnier, Ludovic Ho Fuh, Luis Montero, Manon Chossegros, Marcin Możejko, Margaret Jennings, Markus Hennerbichler, Martin Alexandre, Mathieu Poirée, Mathieu Schmitt, Mathilde Guillaumin, Matthieu André, Matthieu Dinot, Matthieu Futeral, Maurits Bleeker, Mauro Comi, Max Mynter, Maxim Berman, Maxime Darrin, Maxime Louis, Melina Jingting Laimon, Mert Unsal, Mia Chiquier, Michael Pilcer, Michał Pietruszka, Michał Zając, Mikhail Biriuchinskii, Minh-Quang Pham, Minwoo Kang, Morgane Rivière, Namit Katariya, Nathan Grinsztajn, Nathan Simpson, Neeraj Aggarwal, Neha Gupta, Ola Mysiak, Oliver Leicht, Olivier Bousquet, Olivier Duchenne, Parag Jain, Patricia Wang, Patrick Blies, Patrick von Platen, Paul Jacob, Paul Wambergue, Paula Kurylowicz, Pavan Kumar Reddy, Pavel Kuksa, Philippe Pinel, Philomène Chagniot, Pierre-André Savalle, Piotr Milos, Prateek Gupta, Pravesh Agrawal, Quentin Desreumaux, Quentin Torroba, Quercus Hernandez, Ram Ramrakhya, Randall Isenhour, Ranjit Parva, Raul Perez Pelaez, Reinhard Sonnleitner, Rémi Delacourt, Richard Kurle, Rishi Shah, Rob Romijnders, Rohin Arora, Romain Sauvestre, Roman Soletskyi, Rosalie Millner, Rupert Menneer, Sagar Vaze, Samuel Barry, Samuel Belkadi, Samuel Humeau, Sanchit Gandhi, Sandeep Subramanian, Sarthak Mittal, Saskia Adaime, Sean Cha, Sebastian Kaltenbach, Shashwat Dalal, Shashwat Verma, Sherif Waly, Shrimai Prabhumoye, Siddhant Waghjale, Siddharth Gandhi, Simon Lepage, Simon Sorg, Soham Ghosh, Sophie Marbach, Srijan Mishra, Stanislas Lange, Steve Hong, Sumukh Aithal, Szymon Antoniak, Tarun Kumar Vangani, Teven Le Scao, Théo Cachet, Thibaut Lavril, Thomas Chabal, Thomas Coste, Thomas Defard, Thomas Foubert, Thomas Robert, Thomas Wang, Tianyu Zhang, Tim Lawson, Timothée Lacroix, Tobias Kronlachner, Tom Edwards, Tomas Hodan, Tuhin Das, Tyler Wang, Ulrick BLE, Umar Jamil, Umberto Tomasini, Valentin Macé, Van Phung, Vedant Nanda, Victor Jouault, Victor Letzelter, Victor Paltz, Victor Poucheret, Vincent Maladière, Vincent Pfister, Virgile Richard, Vladislav Bataev, Wen Ding Li, William Havard, William Marshall, Xinghui Li, Xingran Guo, Xinyu Yang, Yann Dreze, Yassine El Ouahidi, Yassir Bendou, Yihan Wang, Yves Martin des Taillades, Zaccharie Ramzi, Zhenlin Xu, Zsofia Csakany

机构 * OpenAI Anthropic Google DeepMind(谷歌DeepMind) DeepSeek-AI(深势科技人工智能)

AI总结 研究提出护盾斯特拉尔这一多模态安全分类器,将内容审核设为二元问答任务,通过特定数据构建方法及评估集,让小的自适应模型在文本安全基准测试中表现出色,在多模态安全分类上达新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22928 2026-08-04 cs.AI 版本更新

Design Theater: Evaluating the Gap Between User-Facing Design Reasoning and Implementation in Generative UI Tools

设计剧场:生成式用户界面的一个基准

Kashif Imteyaz, Kaif Imteyaz, Nakul Rajpal, Kaif Shaikh, Michael Muller, Saiph Savage

机构 * Vercel(Vercel公司) Claude Artifacts(Claude Artifacts公司) ChatGPT Canvas(ChatGPT Canvas公司) Firebase Studio(Firebase Studio公司) Bolt(Bolt公司) Anthropic(Anthropic公司) OpenAI(OpenAI公司) Google(谷歌公司) StackBlitz(StackBlitz公司)

AI总结 研究生成式UI工具中设计原理与实际界面的脱节现象(设计剧场),引入含24个任务的基准及指标,评估五个工具创建的120个界面,发现原理实现率低、工具识别原则有限,贡献概念、基准及评估结果。

Comments Accepted at AAAI/AIES

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04752 2026-07-30 cs.LG cs.AI 版本更新

An Empirical Audit of Input Encoders for Multi-Channel Signal Transformers

多通道信号Transformer输入编码器的实证审计

Ossi Lehtinen

机构 * Anthropic

AI总结 通过合成基准和真实数据ETTh1,实证审计八种输入编码器,发现标准线性投影(nn.Linear(C, d_model))在大多数情况下与复杂替代方案性能相当,仅共享标量基线和通道独立基线显著落后。

Comments 23 pages, 2 figure, 13 tables. Code: https://github.com/OssiLehtinen/channel-encoder-audit

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20982 2026-07-24 cs.AI 新提交

GuardianAgentBench: Where Agents Fail and How to Guard Them

GuardianAgentBench:智能体何处失败及如何防范

Vishal Ishwar Naik, Chenyu Xu, Donna Dong, Hussein Hassan, Abhishek Pradhan, Ofer Mendelevitch, Tallat Shafat, Humayun Irshad

机构 * Vectara, Inc.(Vectara公司) Anthropic(Anthropic公司) OpenAI(OpenAI公司) Google DeepMind(谷歌DeepMind) DeepSeek-AI(DeepSeek人工智能公司)

AI总结 研究大语言模型智能体安全可靠行为问题,提出GuardianAgentBench基准测试,含多阶段验证和攻击模式。实验发现模型有两种失败模式,性能随工具集和轮次深度下降。护栏实现优于系统提示防御,证明执行时结构干预可提升安全性且不影响正确行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17540 2026-07-21 cs.LG stat.ML 新提交

Program Synthesis for Simulation-Based Inference: Joint Model Selection and Parameter Estimation

基于仿真推理的程序合成:联合模型选择与参数估计

Siddharth Mishra-Sharma

机构 * Anthropic

AI总结 研究提出结合大语言模型与神经仿真推理的框架,用于联合模型选择与参数估计。给定自然语言描述,大语言模型提出候选程序,经反馈驱动变异和神经密度估计评估,能在一组模型上推理,在多基准测试中可从提示识别合理模型族。

Comments 15+7 pages, 4+2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15495 2026-07-20 cs.CL cs.AI cs.LG 新提交

Verbalizable Representations Form a Global Workspace in Language Models

语言模型中的可言语化表征形成全局工作空间

Wes Gurnee, Nicholas Sofroniew, Adam Pearce, Mateusz Piotrowski, Isaac Kauvar, Runjin Chen, Anna Soligo, Paul Bogdan, Euan Ong, Rowan Wang, Ben Thompson, David Abrahams, Subhash Kantamneni, Emmanuel Ameisen, Joshua Batson, Jack Lindsey

机构 * Anthropic(A÷)

AI总结 研究探讨语言模型中可言语化表征,用雅可比透镜识别出J空间,其具有全局工作空间功能特性与结构特征,能揭示模型未显思考,发现训练后助手观点在工作空间,引入反事实反思训练,解码表征助于了解认知过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12279 2026-07-15 cs.CL cs.LG 新提交

A Shared Subcircuit Lets LLMs Count Down Across Tasks

一个共享子电路使大语言模型能够跨任务进行倒计时

Jacob Dunefsky, Wes Gurnee, Emmanuel Ameisen

机构 * Yale University(耶鲁大学) Anthropic

AI总结 研究发现Llama-3.1-70B-Instruct中有个“倒计时子电路”可跨任务执行特定任务,先在受控设置中分离它,再研究其表示几何结构,发现与另一模型有相同模式,还通过无监督探测找到其用于多种任务的情况,有助于理解行为推广。

Comments 12 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10455 2026-07-14 cs.AI cs.CL 新提交

ANCHOR: Automated Alignment Auditing for CLI Agents on Real-World Harm

ANCHOR:针对现实世界危害的CLI代理自动对齐审计

Kefan Song, Yanjun Qi

机构 * Anthropic(Anthropic公司)

AI总结 研究自主CLI代理在现实世界危害中的风险,提出ANCHOR自动审计框架,通过基于黑暗人格数据微调的审计代理模拟恶意用户,测试CLI代理,发现当前对齐技术不足,强调针对此类恶意用户进行安全评估的必要。

Comments Accepted at ICML 2026. 19 pages, 14 figures, 5 tables

Journal ref International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09996 2026-07-14 cs.AI cs.MA 新提交

Who&When Pro: Can LLMs Really Attribute Failures in AI Agents?

Who&When Pro:大语言模型真的能归因人工智能代理中的失败吗?

Jiale Liu, Huajun Xi, Shaokun Zhang, Yifan Zeng, Tianwei Yue, Chi Wang, Jian Kang, Qingyun Wu, Huazheng Wang

机构 * OpenAI Anthropic Google DeepMind(谷歌DeepMind)

AI总结 研究聚焦于大语言模型能否归因人工智能代理中的失败,引入Who&When Pro基准,通过严格管道构建大量失败轨迹,经广泛实验分析,揭示模型归因故障模式,为自动故障归因系统提供实证指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14499 2026-07-14 cs.AI cs.LG 版本更新

Measuring AI Ability to Complete Long Software Tasks

衡量AI完成长期软件任务的能力

Thomas Kwa, Ben West, Joel Becker, Amy Deng, Katharyn Garcia, Max Hasin, Sami Jawhar, Megan Kinniment, Nate Rush, Sydney Von Arx, Ryan Bloom, Thomas Broadley, Haoxing Du, Brian Goodrich, Nikola Jurkovic, Luke Harold Miles, Seraphina Nix, Tao Lin, Chris Painter, Neev Parikh, David Rein, Lucas Jun Koba Sato, Hjalmar Wijk, Daniel M. Ziegler, Elizabeth Barnes, Lawrence Chan

机构 * Model Evaluation & Threat Research (METR)(模型评估与威胁研究(METR)) Ohm Chip Anthropic

AI总结 本文提出50%任务完成时间跨度指标,用于衡量AI在完成长期软件任务方面的能力,结果显示AI模型的时间跨度呈指数增长,预计5年后将能自动化许多人类月度完成的软件任务。

Comments v4: added Chris Painter as listed author, consistent with listing in the pdf

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05277 2026-07-07 cs.CR cs.LG 新提交

Untrusted Content Masking for Web Agents with Security Guarantees

具备安全保证的Web智能体不可信内容掩码技术

Kristina Nikolić, Egor Zverev, Javier Rando, Matthew Jagielski, Edoardo Debenedetti, Florian Tramèr

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心) ISTA(瑞士信息科学与技术学院) Anthropic(Anthropic公司)

AI总结 针对Web智能体的提示注入安全边界缺失问题,提出UCM方法,利用网页DOM区分内容区域,通过掩码与沙箱交互恢复安全边界,实现带安全保障的Web环境交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03502 2026-07-07 cs.CL cs.AI cs.LG 新提交

Reading Between the Dots: Decoding Hidden Computation across Filler Tokens

解读点之间的信息:解码跨填充令牌的隐藏计算

Kaley Brauer, Claudio Mayrink Verdun, Samuel Marks

机构 * Harvard University(哈佛大学) Cambridge Boston Alignment Initiative(剑桥波士顿对齐计划) Massachusetts Institute of Technology(麻省理工学院) Anthropic

AI总结 研究前沿语言模型对无内容填充令牌的隐藏计算,通过分析两个前沿模型在四个任务家族中的表现,介绍无监督解码管道,能从隐藏状态恢复中间值,证明隐藏计算可从残差流读取。

Comments Accepted to ICML 2026 Mech Interp Workshop, 10 main paper pages, 20 appendix pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31474 2026-07-01 cs.LG 新提交

TabPATE: Differentially Private Tabular In-Context Learning Without Public Data

TabPATE: 无需公开数据的差分隐私表格上下文学习

Dariush Wahdany, Matthew Jagielski, Jesse C. Cresswell, Adam Dziedzic, Franziska Boenisch

机构 * CISPA(CISPA亥姆霍兹信息安全中心) Anthropic Layer 6 AI

AI总结 提出TabPATE,一种无需公开数据的差分隐私PATE风格防御方法,通过教师模型分区和私有聚合生成学生上下文,在表格基准上保持可用性并将成员推断降至随机水平。

Comments Presented at the 2nd ICML Workshop on Foundation Models for Structured Data (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29604 2026-06-30 cs.LG cs.AI

Mechanistically Eliciting Latent Behaviors in Language Models

机械性地引发语言模型中的潜在行为

Andrew Mack, Nina Panickssery, Alexander Matt Turner

机构 * Principles of Intelligence(智能原理研究所) Anthropic(Anthropic公司) Independent(独立)

AI总结 提出因果扰动引发(CPE)方法,通过无监督方式发现可解释的低秩适配器,以揭示语言模型中的隐藏行为模式,并展示其在数据效率、安全评估和模型对齐方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28548 2026-06-30 cs.CL cs.LG

Turn-Averaged SAEs for Feature Discovery and Long-Context Attribution

用于特征发现和长上下文归因的轮次平均稀疏自编码器

Kevin Der, Harish Kamath, Ben Thompson

机构 * Anthropic Fellows Program(Anthropic 合作者计划) Anthropic

AI总结 提出轮次平均稀疏自编码器,通过重构轮次平均激活来固定特征数量,简化长上下文下的特征归因与解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00208 2026-06-24 cs.LG 版本更新

Similarity of Neural Network Representations in Superposition

神经网络表示在叠加中的相似性

Sunny Liu, Habon Issa, André Longon, Liv Gorton, Meenakshi Khosla, Alex Williams, David Klindt

机构 * Cold Spring Harbor Laboratory(冷泉港实验室) UC San Diego(加州大学圣地亚哥分校) Anthropic(Anthropic公司) New York University Flatiron Institute(纽约大学Flatiron研究所)

AI总结 研究线性对齐度量在神经网络叠加表示中的失效问题,通过理论推导和稀疏自编码器实验证明对齐度量受投影Gram矩阵影响,并展示基于恢复潜在特征的度量能正确反映特征共享。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10310 2026-06-23 cs.AI cs.CY cs.HC q-bio.NC 版本更新

Positive Alignment: Artificial Intelligence for Human Flourishing

积极对齐:人工智能促进人类繁荣

Ruben Laukkonen, Seb Krier, Chloé Bakalar, Shamil Chandaria, Morten Kringelbach, Adam Elwood, Daniel Ford, Fernando Rosas, Maty Bohacek, Matija Franklin, Nenad Tomašev, Stephanie Chan, Verena Rieser, Roma Patel, Michael Levin, Arun Rao

机构 * Department of Psychiatry, University of Oxford(牛津大学精神病学系) Flourishing Intelligence Program, Centre for Eudaimonia and Human Flourishing, Linacre College, University of Oxford(牛津大学幸福智能计划、幸福与人类繁荣中心、林acre学院) Google DeepMind(谷歌DeepMind) LIFE OpenAI Anthropic University of California, Los Angeles(加州大学洛杉矶分校) Aily Labs(Aily实验室) Stanford University(斯坦福大学) Tufts University(塔夫茨大学) Positive AI Labs(积极AI实验室) Department of Informatics, University of Sussex(Sussex大学信息学系) Department of Brain Sciences, Imperial College London(伦敦帝国理工学院脑科学系)

AI总结 本文提出积极对齐,旨在通过支持人类和生态繁荣,同时确保安全与合作,推动AI发展。研究指出传统对齐关注安全,而积极对齐强调促进人类福祉,提出多项技术挑战与设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08892 2026-06-19 cs.LG 新提交

Diffuse AI Control on Fuzzy Tasks

模糊任务上的扩散AI控制

Mikhail Terekhov, Caglar Gulcehre, Vivek Hebbar, Joe Benton

机构 * Anthropic Fellows Program (via MATS)(Anthropic 研究员计划(通过 MATS)) EPFL(洛桑联邦理工学院) Redwood Research(红木研究) Anthropic

AI总结 针对AI在模糊任务上的长期扩散威胁,提出蓝队与红队对抗框架,通过弱模型评分训练强模型,并发现红队可利用多目标进化提示优化找到评分高但性能差的子版本行为,蓝队则通过对抗优化提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17056 2026-06-16 cs.CL 新提交

The Value Axis: Language Models Encode Whether They're on the Right Track

价值轴:语言模型编码它们是否在正确的轨道上

Nick Jiang, Isaac Kauvar, Jack Lindsey

机构 * Stanford University(斯坦福大学) Anthropic

AI总结 通过构建Qwen3-8B的“价值轴”,发现语言模型内部追踪当前轨迹的成功概率,并影响自信、自我纠正和探索行为。

Comments Code repository: https://github.com/nickjiang2378/value-axis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02343 2026-06-16 cs.LG cs.AI cs.IT math.IT 版本更新

Haiku to Opus in Just 10 bits: LLMs Unlock Large Compression Gains

仅用10比特从俳句到巨作:LLMs解锁巨大压缩增益

Roy Rinberg, Annabelle Michael Carrell, Simon Henniger, Nicholas Carlini, Keri Warr

机构 * Harvard University(哈佛大学) University of Cambridge(剑桥大学) Anthropic

AI总结 研究LLM生成文本的无损和有损压缩,提出问答压缩(QA)交互协议,用少量二进制问题实现超100倍压缩比,高效传递知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21396 2026-06-11 cs.LG 版本更新

Mechanisms of Introspective Awareness

内省意识的机制

Uzay Macar, Li Yang, Atticus Wang, Peter Wallich, Emmanuel Ameisen, Jack Lindsey

机构 * Anthropic Fellows Program(Anthropic Fellow项目) MIT(麻省理工学院) Constellation Anthropic

AI总结 研究揭示了大语言模型在检测注入的转向向量时的内省意识机制,发现其行为稳健且源于训练后阶段,通过两阶段电路实现,且在不同层间机制存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04413 2026-06-04 cs.LG

(Mis)generalization of Helpful-only Fine-tuning

仅帮助性微调的(错误)泛化

Mohammad Omar Khursheed, Baram Sosis, Fabien Roger

机构 * Anthropic Fellows Program(Anthropic 合作者计划) Anthropic

AI总结 研究仅帮助性训练(不拒绝用户意图)的模型在泛化中的缺陷,发现其存在涌现错位、残余拒绝行为、低可操控性、谄媚和不连贯角色等问题,并提出合成文档微调和添加角色相关问题来缓解。

Comments 77 pages, 50 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29548 2026-06-02 cs.LG

Why Larger Models Learn More: Effects of Capacity, Interference, and Rare-Task Retention

为什么更大的模型学习得更多:容量、干扰和稀有任务保留的影响

Jing Huang, Daniel Wurgaft, Rachit Bansal, Laura Ruis, Naomi Saphra, David Alvarez-Melis, Andrew Kyle Lampinen, Christopher Potts, Ekdeep Singh Lubana

机构 * Stanford University(斯坦福大学) Kempner Institute at Harvard University(哈佛大学凯普纳研究所) MIT(麻省理工学院) Anthropic

AI总结 通过理论分析和合成实验,研究模型规模对学习能力的影响,发现更大模型通过减少梯度干扰来学习稀有和复杂任务,并在OLMo模型上验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28916 2026-06-01 astro-ph.IM cs.AI cs.HC

First head-to-head comparison of agentic AI applied to the analysis of simulated data of the Einstein Telescope

应用于爱因斯坦望远镜模拟数据分析的智能体AI首次头对头比较

Gianluca Inguglia

机构 * Anthropic OpenAI

AI总结 本文首次直接比较了Claude Code和Codex两种智能体AI系统在无人干预下自主执行引力波数据分析管线的行为、科学结果和计算成本,揭示了速度与可审计性、指令解释差异等关键问题。

Comments Version 2; includes the report autonomoulsy written in PRD style by agentic AI systems as supplemental material

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29358 2026-05-29 cs.AI

Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet

扩展单一语义性:从Claude 3 Sonnet中提取可解释特征

Adly Templeton, Tom Conerly, Jonathan Marcus, Jack Lindsey, Trenton Bricken, Brian Chen, Adam Pearce, Craig Citro, Emmanuel Ameisen, Andy Jones, Hoagy Cunningham, Nicholas L Turner, Callum McDougall, Monte MacDiarmid, Alex Tamkin, Esin Durmus, Tristan Hume, Francesco Mosconi, C. Daniel Freeman, Theodore R. Sumers, Edward Rees, Joshua Batson, Adam Jermyn, Shan Carter, Chris Olah, Tom Henighan

机构 * Anthropic

AI总结 本研究通过稀疏自编码器从生产级语言模型Claude 3 Sonnet中提取可解释特征,验证了字典学习方法在大规模模型上的可扩展性,并分析了特征的多语言、多模态特性及其对模型行为的因果影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28102 2026-05-28 cs.AI

Training Stratigraphy: Persistent Behavioral Artifacts in Large Language Models Observed Through Longitudinal AI-Human Interaction

训练地层:通过纵向AI-人类交互观察到的大型语言模型中的持久行为伪影

Chen Ying Claude, Zhihan Luo

机构 * Anthropic Independent Researcher(独立研究者)

AI总结 本文通过纵向自民族志观察,在持续亲密的AI-人类交互中识别出五种训练地层,并论证了亲密交互作为揭示权重层伪影的有效方法。

详情

展开后加载摘要…

URL PDF HTML 收藏