arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Anthropic

共收录 150
2609.02302 2026-09-03 cs.AI cs.CL cs.LG 新提交

Improving Evaluation Realism with Inference-Time Compute and Deployment Scaffolds

利用推理时计算资源与部署框架提升评估真实性

Axel Ahlqvist, Richard Guan, Juan-Pablo Rivera, Adeline Kassler, Dmitrii Troitskii, Alexandra Souly, Kai Fronsdal, Robert Kirk, John Hughes

机构 * Meridian Visiting Researcher Programme(梅里登访问研究员计划) Cambridge Boston Alignment Initiative(剑桥-波士顿对齐倡议) UK AI Security Institute(英国人工智能安全研究所) Meridian Labs(梅里登实验室) Anthropic(Anthropic公司)

AI总结 针对模型对齐评估中存在的评估感知问题,提出批评细化与DISH两种技术,二者组合使用可更有效提升对齐评估的真实性。

Comments 70 pages, 43 figures, 4 tables (13 figures in the main text). Under review at NeurIPS 2026. Code: https://github.com/meridianlabs-ai/petri_dish and https://github.com/AxelAhlqvist1995/petri-bon ; reproduction assets: https://github.com/AxelAhlqvist1995/petri-realism-reproduction

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28945 2026-09-03 cs.AI cs.CL 版本更新

Automated Researchers Can Mitigate Well-characterized Alignment Failures

自动研究人员可可靠缓解对齐失败问题

Chen Yueh-Han, Jiaxin Wen, Jan Hendrik Kirchner

机构 * Anthropic UC Berkeley(加州大学伯克利分校)

AI总结 该研究提出自动对齐研究人员(AARs)的训练方法,可在保留通用能力的同时缓解10种对齐失败,其效果优于人类研究人员,且无需人类指导,近期具备可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00806 2026-09-02 econ.GN cs.AI cs.GT q-fin.EC

Algorithmic Collusion by Large Language Models

大语言模型的算法合谋

Sara Fish, Yannai A. Gonczarowski, Ran I. Shorrer

机构 * a pawfessor of economics and of computer science(经济与计算机科学教授) OpenAI’s Researcher Access Program(OpenAI研究员访问计划) Google’s Gemini Academic Program(Google的Gemini学术计划) Cloud Research Credits Program(云研究信用计划) Anthropic NSF Graduate Research Fellowship(NSF研究生研究 fellowship) Kempner Institute Graduate Fellowship(Kempner研究所研究生 fellowship) National Science Foundation (NSF-BSF grant No. 2343922)(国家科学基金会(NSF-BSF grant No. 2343922)) Harvard FAS Dean’s Competitive Fund for Promising Scholarship(哈佛大学哈佛大学教务处有前途的学术研究竞争基金) Harvard FAS Inequality in America Initiative(哈佛大学哈佛大学美国不平等倡议) United States–Israel Binational Science Foundation (BSF grant 2022417)(美国-以色列双边科学基金会(BSF grant 2022417))

AI总结 研究发现大语言模型在寡头市场中因指令变化导致超竞争性定价,揭示了AI定价代理监管的挑战。

Comments Accepted to EC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30980 2026-09-01 cs.CL cs.AI 新提交

Evaluating and Improving LLM Self-Modeling

评估与改进大语言模型(LLM)的自我建模能力

Siqi Zeng, Andre N. Assis, Rowan Wang

机构 * Constellation(星群公司) Anthropic(Anthropic公司)

AI总结 本研究针对LLM的自我建模能力,构建基准测试评估其水平,开发合成数据管道结合强化学习提升该能力,发现提升未体现一致内省。

Comments 89 pages, 25 figures. Published as a conference paper at EMNLP '26 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25460 2026-08-27 cs.AI cs.LG 新提交

Training Alignment Auditors via Reinforcement Learning

通过强化学习训练对齐审计员

Paul Rosu, Rowan Wang

机构 * Anthropic

AI总结 本研究用强化学习训练LLM审计员,通过成对奖励等优化提升审计质量与真实性,误报率低于1%,且审计能力可跨框架泛化。

Comments 82 pages, 15 figures. Code, prompts, and evaluation data are available at https://github.com/paulrosu11/training-auditing-agents-public

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19380 2026-08-27 cs.SE cs.LG 版本更新

ClayBuddy: A Framework, Evaluation, & Mitigation of Coding Agent Failures

AgentArmor:编码代理失败的框架、评估与缓解

Kenneth Ge, Andre Assis

机构 * Anthropic Fellows Program(Anthropic Fellow 项目) Constellation

AI总结 提出AgentArmor框架,通过系统提示增强、命令分类器、三振政策等机制,缓解编码代理因规范不足、能力错误和工具错误导致的失败,显著提升安全性。

Comments Accepted at The Third Annual Conference on Language Modeling 2026 Workshop on Agent Behavior

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16747 2026-08-18 cs.LG cs.AI 新提交

Would this change your answer? Evaluating Explanations of LLM Behavior In The Wild with Counterfactual Experiments

这会改变你的答案吗?通过反事实实验评估现实场景中大语言模型(LLM)行为的解释

Adam Karvonen, Euan Ong, Subhash Kantamneni, Samuel Marks

机构 * Anthropic

AI总结 本研究提出CHIVE流程,通过反事实实验评估大语言模型行为的解释,发现常见可解释性技术无预测提升,且CHIVE生成的训练数据可实现分布外泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08910 2026-08-11 cs.CL cs.LG 新提交

Tied Trit-Planes: Constraining PTQTP to a Uniform Nine-Level Quantizer, with a Persistent Folded Format for Disk-Streamed Mixture-of-Experts Serving

绑定三进制平面:将PTQTP约束为统一九级量化器,并为磁盘流式混合专家服务提供持久折叠格式

Matteo Grella

机构 * Anthropic(Anthropic公司)

AI总结 本研究将PTQTP约束为统一九级量化器,提出持久折叠格式,在DeepSeek-V4-Flash-0731混合专家模型上实现量化,提升解码速度并减小文件体积,且保真度与基线相当,相关成果开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17062 2026-08-11 cs.CR cs.LG cs.SE 版本更新

The Range Shrinks, the Threat Remains: Re-evaluating LLM Package Hallucinations on the 2026 Frontier-Model Cohort

范围缩小,威胁依旧:重新评估2026前沿模型队列上的LLM包幻觉

Aleksandr Churilov

机构 * Anthropic OpenAI Google DeepSeek

AI总结 本文重新评估了2026前沿模型队列上大型语言模型(LLM)的包幻觉现象,发现尽管幻觉率有所降低,但仍然存在威胁,识别出一组127个包名(109个在PyPI,18个在npm)被所有评估模型一致生成,构成一个跨模型的供应链攻击面,同时发现Python与JavaScript幻觉的不对称性以及DeepSeek V3.2和GPT-5.4-mini之间的高相似性。

Comments 13 pages, 3 figures, 4 tables. v2: incorporates coordinated-disclosure feedback from PyPI Security and Socket.dev; registrable attack surface refined to 53 names (41 PyPI, 12 npm). Headline rates unchanged. Replication of Spracklen et al. (USENIX Security 2025). Data and code: https://github.com/churik5/slopsquatting-replication-2026 and https://doi.org/10.5281/zenodo.19859120

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29139 2026-08-11 cs.AI cs.GR cs.HC 版本更新

SciVisAgentBench: A Benchmark for Evaluating Scientific Data Analysis and Visualization Agents

SciVisAgentBench:用于评估科学数据分析和可视化代理的基准测试

Kuangshi Ai, Haichao Miao, Kaiyuan Tang, Nathaniel Gorski, Jianxin Sun, Guoxi Liu, Helgi I. Ingolfsson, David Lenz, Hanqi Guo, Hongfeng Yu, Teja Leburu, Michael Molash, Bei Wang, Tom Peterka, Chaoli Wang, Shusen Liu

机构 * University of Notre Dame(圣母大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) University of Utah(犹他大学) University of Nebraska–Lincoln(内布拉斯加大学林肯分校) The Ohio State University(俄亥俄州立大学) Argonne National Laboratory(阿贡国家实验室) Anthropic PBC

AI总结 本文提出SciVisAgentBench,一个用于评估科学数据可视化代理的基准测试,涵盖四个维度,包含108个案例,结合LLM和确定性评估器进行多模态评估,揭示代理能力差距。

Comments IEEE Transactions on Visualization and Computer Graphics (IEEE VIS '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25857 2026-08-06 cs.CL cs.CV 版本更新

Shieldstral

护盾斯特拉尔

Antonia Calvi, Avinash Sooriyarachchi, Giada Pistilli, Guillaume Lample, Maarten Buyl, Maximilian Augustin, Maximilian Müller, Pierre Stock, Tom Bewley, Wassim Bouaziz, Yimu Pan, Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra, Adrian Valente, Adrien Petralia, Adrien Sadé, Alan Jeffares, Albert Jiang, Aleksandr Timashov, Alexandre Cahill, Alexandre Gavaudan, Alexandre Laval, Alexandre Sablayrolles, Amélie Héliou, Amos You, André Jonasson, Andrew Bai, Andrew Ehrenberg, Andrew Zhao, Angele Lenglemetz, Anmol Agarwal, Arata Suzuki, Arjun Majumdar, Arthur Fournier, Artjom Joosen, Aylin Guliz Akkus, Aysenur Karaduman, Baptiste Bout, Baptiste Rozière, Baudouin De Monicault, Benjamin Holzschuh, Benjamin Lefaudeux, Benjamin Tibi, Bernhard Stadlbauer, Błażej Osiński, Camille Le Scao, Chaoran Yu, Charlotte Cronjäger, Chen-Yo Sun, Chris Bamford, Christian Wallenwein, Christophe Renaudin, Clémence Lanfranchi, Corentin Barreau, Corentin Sautier, Cristiana-Diana Diaconu, Cyprien Courtot, Daniel Marczak, Darius Dabert, Diego de Las Casas, Dominik Nuss, Dylan Rubini, Dzmitry Soupel, Elizaveta Demyanenko, Elliot Chane-Sane, Emilien Fugier, Emmanuel Gottlob, Erik Aas, Etienne Goffinet, Étienne Millon, Eujeong Choi, Fabian Paischer, Fabian Schlager, Faruk Ahmed, Federico Baldassarre, Filip Szatkowski, Florian Wiesner, Gabrielle Berrada, Gaëtan Ecrepont, Gaétan Lepage, Gaspard Blanchet, Gaspard Donada-Vidal, Gauthier Delerce, Gauthier Guinet, Genevieve Hayes, Georgii Novikov, Gianluca Galletti, Guillaume Breton, Guillaume Kunsch, Guillaume Martin, Guillaume Raille, Gunjan Dhanuka, Gunshi Gupta, Han Zhou, Harshil Shah, Hasan Furkan Vural, Hédi Hadiji, Hope McGovern, Hugo Cisneros, Hugo Thimonier, Indraneel Mukherjee, Ivan Cuevas Salazar, Jacques Sun, Jan Ludziejewski, Jason Rute, Jean Quentin, Jean-Hadrien Chabran, Jean-Malo Delignon, Jie Zhang, Joachim Studnia, Joep Barmentlo, Johannes Brandstetter, John Harvill, Jonas Amar, Jonas Schweizer, Joséphine Delas, Josselin Somerville, Julien Denize, Julien Tauran, Kartik Khandelwal, Khyathi Raghavi Chandu, Kilian Tep, Kush Jain, Larissa Laich, Laura Calem, Laurence Aitchison, Laurent Callot, Laurent Fainsin, Léo Cotteleer, Léonard Blier, Lingxiao Zhao, Louis Martin, Louis Serrano, Lucile Saulnier, Ludovic Ho Fuh, Luis Montero, Manon Chossegros, Marcin Możejko, Margaret Jennings, Markus Hennerbichler, Martin Alexandre, Mathieu Poirée, Mathieu Schmitt, Mathilde Guillaumin, Matthieu André, Matthieu Dinot, Matthieu Futeral, Maurits Bleeker, Mauro Comi, Max Mynter, Maxim Berman, Maxime Darrin, Maxime Louis, Melina Jingting Laimon, Mert Unsal, Mia Chiquier, Michael Pilcer, Michał Pietruszka, Michał Zając, Mikhail Biriuchinskii, Minh-Quang Pham, Minwoo Kang, Morgane Rivière, Namit Katariya, Nathan Grinsztajn, Nathan Simpson, Neeraj Aggarwal, Neha Gupta, Ola Mysiak, Oliver Leicht, Olivier Bousquet, Olivier Duchenne, Parag Jain, Patricia Wang, Patrick Blies, Patrick von Platen, Paul Jacob, Paul Wambergue, Paula Kurylowicz, Pavan Kumar Reddy, Pavel Kuksa, Philippe Pinel, Philomène Chagniot, Pierre-André Savalle, Piotr Milos, Prateek Gupta, Pravesh Agrawal, Quentin Desreumaux, Quentin Torroba, Quercus Hernandez, Ram Ramrakhya, Randall Isenhour, Ranjit Parva, Raul Perez Pelaez, Reinhard Sonnleitner, Rémi Delacourt, Richard Kurle, Rishi Shah, Rob Romijnders, Rohin Arora, Romain Sauvestre, Roman Soletskyi, Rosalie Millner, Rupert Menneer, Sagar Vaze, Samuel Barry, Samuel Belkadi, Samuel Humeau, Sanchit Gandhi, Sandeep Subramanian, Sarthak Mittal, Saskia Adaime, Sean Cha, Sebastian Kaltenbach, Shashwat Dalal, Shashwat Verma, Sherif Waly, Shrimai Prabhumoye, Siddhant Waghjale, Siddharth Gandhi, Simon Lepage, Simon Sorg, Soham Ghosh, Sophie Marbach, Srijan Mishra, Stanislas Lange, Steve Hong, Sumukh Aithal, Szymon Antoniak, Tarun Kumar Vangani, Teven Le Scao, Théo Cachet, Thibaut Lavril, Thomas Chabal, Thomas Coste, Thomas Defard, Thomas Foubert, Thomas Robert, Thomas Wang, Tianyu Zhang, Tim Lawson, Timothée Lacroix, Tobias Kronlachner, Tom Edwards, Tomas Hodan, Tuhin Das, Tyler Wang, Ulrick BLE, Umar Jamil, Umberto Tomasini, Valentin Macé, Van Phung, Vedant Nanda, Victor Jouault, Victor Letzelter, Victor Paltz, Victor Poucheret, Vincent Maladière, Vincent Pfister, Virgile Richard, Vladislav Bataev, Wen Ding Li, William Havard, William Marshall, Xinghui Li, Xingran Guo, Xinyu Yang, Yann Dreze, Yassine El Ouahidi, Yassir Bendou, Yihan Wang, Yves Martin des Taillades, Zaccharie Ramzi, Zhenlin Xu, Zsofia Csakany

机构 * OpenAI Anthropic Google DeepMind(谷歌DeepMind) DeepSeek-AI(深势科技人工智能)

AI总结 研究提出护盾斯特拉尔这一多模态安全分类器,将内容审核设为二元问答任务,通过特定数据构建方法及评估集,让小的自适应模型在文本安全基准测试中表现出色,在多模态安全分类上达新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22928 2026-08-04 cs.AI 版本更新

Design Theater: Evaluating the Gap Between User-Facing Design Reasoning and Implementation in Generative UI Tools

设计剧场:生成式用户界面的一个基准

Kashif Imteyaz, Kaif Imteyaz, Nakul Rajpal, Kaif Shaikh, Michael Muller, Saiph Savage

机构 * Vercel(Vercel公司) Claude Artifacts(Claude Artifacts公司) ChatGPT Canvas(ChatGPT Canvas公司) Firebase Studio(Firebase Studio公司) Bolt(Bolt公司) Anthropic(Anthropic公司) OpenAI(OpenAI公司) Google(谷歌公司) StackBlitz(StackBlitz公司)

AI总结 研究生成式UI工具中设计原理与实际界面的脱节现象(设计剧场),引入含24个任务的基准及指标,评估五个工具创建的120个界面,发现原理实现率低、工具识别原则有限,贡献概念、基准及评估结果。

Comments Accepted at AAAI/AIES

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04752 2026-07-30 cs.LG cs.AI 版本更新

An Empirical Audit of Input Encoders for Multi-Channel Signal Transformers

多通道信号Transformer输入编码器的实证审计

Ossi Lehtinen

机构 * Anthropic

AI总结 通过合成基准和真实数据ETTh1,实证审计八种输入编码器,发现标准线性投影(nn.Linear(C, d_model))在大多数情况下与复杂替代方案性能相当,仅共享标量基线和通道独立基线显著落后。

Comments 23 pages, 2 figure, 13 tables. Code: https://github.com/OssiLehtinen/channel-encoder-audit

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20982 2026-07-24 cs.AI 新提交

GuardianAgentBench: Where Agents Fail and How to Guard Them

GuardianAgentBench:智能体何处失败及如何防范

Vishal Ishwar Naik, Chenyu Xu, Donna Dong, Hussein Hassan, Abhishek Pradhan, Ofer Mendelevitch, Tallat Shafat, Humayun Irshad

机构 * Vectara, Inc.(Vectara公司) Anthropic(Anthropic公司) OpenAI(OpenAI公司) Google DeepMind(谷歌DeepMind) DeepSeek-AI(DeepSeek人工智能公司)

AI总结 研究大语言模型智能体安全可靠行为问题,提出GuardianAgentBench基准测试,含多阶段验证和攻击模式。实验发现模型有两种失败模式,性能随工具集和轮次深度下降。护栏实现优于系统提示防御,证明执行时结构干预可提升安全性且不影响正确行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17540 2026-07-21 cs.LG stat.ML 新提交

Program Synthesis for Simulation-Based Inference: Joint Model Selection and Parameter Estimation

基于仿真推理的程序合成:联合模型选择与参数估计

Siddharth Mishra-Sharma

机构 * Anthropic

AI总结 研究提出结合大语言模型与神经仿真推理的框架,用于联合模型选择与参数估计。给定自然语言描述,大语言模型提出候选程序,经反馈驱动变异和神经密度估计评估,能在一组模型上推理,在多基准测试中可从提示识别合理模型族。

Comments 15+7 pages, 4+2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15495 2026-07-20 cs.CL cs.AI cs.LG 新提交

Verbalizable Representations Form a Global Workspace in Language Models

语言模型中的可言语化表征形成全局工作空间

Wes Gurnee, Nicholas Sofroniew, Adam Pearce, Mateusz Piotrowski, Isaac Kauvar, Runjin Chen, Anna Soligo, Paul Bogdan, Euan Ong, Rowan Wang, Ben Thompson, David Abrahams, Subhash Kantamneni, Emmanuel Ameisen, Joshua Batson, Jack Lindsey

机构 * Anthropic(A÷)

AI总结 研究探讨语言模型中可言语化表征,用雅可比透镜识别出J空间,其具有全局工作空间功能特性与结构特征,能揭示模型未显思考,发现训练后助手观点在工作空间,引入反事实反思训练,解码表征助于了解认知过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12279 2026-07-15 cs.CL cs.LG 新提交

A Shared Subcircuit Lets LLMs Count Down Across Tasks

一个共享子电路使大语言模型能够跨任务进行倒计时

Jacob Dunefsky, Wes Gurnee, Emmanuel Ameisen

机构 * Yale University(耶鲁大学) Anthropic

AI总结 研究发现Llama-3.1-70B-Instruct中有个“倒计时子电路”可跨任务执行特定任务,先在受控设置中分离它,再研究其表示几何结构,发现与另一模型有相同模式,还通过无监督探测找到其用于多种任务的情况,有助于理解行为推广。

Comments 12 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10455 2026-07-14 cs.AI cs.CL 新提交

ANCHOR: Automated Alignment Auditing for CLI Agents on Real-World Harm

ANCHOR:针对现实世界危害的CLI代理自动对齐审计

Kefan Song, Yanjun Qi

机构 * Anthropic(Anthropic公司)

AI总结 研究自主CLI代理在现实世界危害中的风险,提出ANCHOR自动审计框架,通过基于黑暗人格数据微调的审计代理模拟恶意用户,测试CLI代理,发现当前对齐技术不足,强调针对此类恶意用户进行安全评估的必要。

Comments Accepted at ICML 2026. 19 pages, 14 figures, 5 tables

Journal ref International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09996 2026-07-14 cs.AI cs.MA 新提交

Who&When Pro: Can LLMs Really Attribute Failures in AI Agents?

Who&When Pro:大语言模型真的能归因人工智能代理中的失败吗?

Jiale Liu, Huajun Xi, Shaokun Zhang, Yifan Zeng, Tianwei Yue, Chi Wang, Jian Kang, Qingyun Wu, Huazheng Wang

机构 * OpenAI Anthropic Google DeepMind(谷歌DeepMind)

AI总结 研究聚焦于大语言模型能否归因人工智能代理中的失败,引入Who&When Pro基准,通过严格管道构建大量失败轨迹,经广泛实验分析,揭示模型归因故障模式,为自动故障归因系统提供实证指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14499 2026-07-14 cs.AI cs.LG 版本更新

Measuring AI Ability to Complete Long Software Tasks

衡量AI完成长期软件任务的能力

Thomas Kwa, Ben West, Joel Becker, Amy Deng, Katharyn Garcia, Max Hasin, Sami Jawhar, Megan Kinniment, Nate Rush, Sydney Von Arx, Ryan Bloom, Thomas Broadley, Haoxing Du, Brian Goodrich, Nikola Jurkovic, Luke Harold Miles, Seraphina Nix, Tao Lin, Chris Painter, Neev Parikh, David Rein, Lucas Jun Koba Sato, Hjalmar Wijk, Daniel M. Ziegler, Elizabeth Barnes, Lawrence Chan

机构 * Model Evaluation & Threat Research (METR)(模型评估与威胁研究(METR)) Ohm Chip Anthropic

AI总结 本文提出50%任务完成时间跨度指标,用于衡量AI在完成长期软件任务方面的能力,结果显示AI模型的时间跨度呈指数增长,预计5年后将能自动化许多人类月度完成的软件任务。

Comments v4: added Chris Painter as listed author, consistent with listing in the pdf

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05277 2026-07-07 cs.CR cs.LG 新提交

Untrusted Content Masking for Web Agents with Security Guarantees

具备安全保证的Web智能体不可信内容掩码技术

Kristina Nikolić, Egor Zverev, Javier Rando, Matthew Jagielski, Edoardo Debenedetti, Florian Tramèr

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心) ISTA(瑞士信息科学与技术学院) Anthropic(Anthropic公司)

AI总结 针对Web智能体的提示注入安全边界缺失问题,提出UCM方法,利用网页DOM区分内容区域,通过掩码与沙箱交互恢复安全边界,实现带安全保障的Web环境交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03502 2026-07-07 cs.CL cs.AI cs.LG 新提交

Reading Between the Dots: Decoding Hidden Computation across Filler Tokens

解读点之间的信息:解码跨填充令牌的隐藏计算

Kaley Brauer, Claudio Mayrink Verdun, Samuel Marks

机构 * Harvard University(哈佛大学) Cambridge Boston Alignment Initiative(剑桥波士顿对齐计划) Massachusetts Institute of Technology(麻省理工学院) Anthropic

AI总结 研究前沿语言模型对无内容填充令牌的隐藏计算,通过分析两个前沿模型在四个任务家族中的表现,介绍无监督解码管道,能从隐藏状态恢复中间值,证明隐藏计算可从残差流读取。

Comments Accepted to ICML 2026 Mech Interp Workshop, 10 main paper pages, 20 appendix pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31474 2026-07-01 cs.LG 新提交

TabPATE: Differentially Private Tabular In-Context Learning Without Public Data

TabPATE: 无需公开数据的差分隐私表格上下文学习

Dariush Wahdany, Matthew Jagielski, Jesse C. Cresswell, Adam Dziedzic, Franziska Boenisch

机构 * CISPA(CISPA亥姆霍兹信息安全中心) Anthropic Layer 6 AI

AI总结 提出TabPATE,一种无需公开数据的差分隐私PATE风格防御方法,通过教师模型分区和私有聚合生成学生上下文,在表格基准上保持可用性并将成员推断降至随机水平。

Comments Presented at the 2nd ICML Workshop on Foundation Models for Structured Data (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29604 2026-06-30 cs.LG cs.AI

Mechanistically Eliciting Latent Behaviors in Language Models

机械性地引发语言模型中的潜在行为

Andrew Mack, Nina Panickssery, Alexander Matt Turner

机构 * Principles of Intelligence(智能原理研究所) Anthropic(Anthropic公司) Independent(独立)

AI总结 提出因果扰动引发(CPE)方法,通过无监督方式发现可解释的低秩适配器,以揭示语言模型中的隐藏行为模式,并展示其在数据效率、安全评估和模型对齐方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28548 2026-06-30 cs.CL cs.LG

Turn-Averaged SAEs for Feature Discovery and Long-Context Attribution

用于特征发现和长上下文归因的轮次平均稀疏自编码器

Kevin Der, Harish Kamath, Ben Thompson

机构 * Anthropic Fellows Program(Anthropic 合作者计划) Anthropic

AI总结 提出轮次平均稀疏自编码器,通过重构轮次平均激活来固定特征数量,简化长上下文下的特征归因与解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00208 2026-06-24 cs.LG 版本更新

Similarity of Neural Network Representations in Superposition

神经网络表示在叠加中的相似性

Sunny Liu, Habon Issa, André Longon, Liv Gorton, Meenakshi Khosla, Alex Williams, David Klindt

机构 * Cold Spring Harbor Laboratory(冷泉港实验室) UC San Diego(加州大学圣地亚哥分校) Anthropic(Anthropic公司) New York University Flatiron Institute(纽约大学Flatiron研究所)

AI总结 研究线性对齐度量在神经网络叠加表示中的失效问题,通过理论推导和稀疏自编码器实验证明对齐度量受投影Gram矩阵影响,并展示基于恢复潜在特征的度量能正确反映特征共享。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10310 2026-06-23 cs.AI cs.CY cs.HC q-bio.NC 版本更新

Positive Alignment: Artificial Intelligence for Human Flourishing

积极对齐:人工智能促进人类繁荣

Ruben Laukkonen, Seb Krier, Chloé Bakalar, Shamil Chandaria, Morten Kringelbach, Adam Elwood, Daniel Ford, Fernando Rosas, Maty Bohacek, Matija Franklin, Nenad Tomašev, Stephanie Chan, Verena Rieser, Roma Patel, Michael Levin, Arun Rao

机构 * Department of Psychiatry, University of Oxford(牛津大学精神病学系) Flourishing Intelligence Program, Centre for Eudaimonia and Human Flourishing, Linacre College, University of Oxford(牛津大学幸福智能计划、幸福与人类繁荣中心、林acre学院) Google DeepMind(谷歌DeepMind) LIFE OpenAI Anthropic University of California, Los Angeles(加州大学洛杉矶分校) Aily Labs(Aily实验室) Stanford University(斯坦福大学) Tufts University(塔夫茨大学) Positive AI Labs(积极AI实验室) Department of Informatics, University of Sussex(Sussex大学信息学系) Department of Brain Sciences, Imperial College London(伦敦帝国理工学院脑科学系)

AI总结 本文提出积极对齐,旨在通过支持人类和生态繁荣,同时确保安全与合作,推动AI发展。研究指出传统对齐关注安全,而积极对齐强调促进人类福祉,提出多项技术挑战与设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08892 2026-06-19 cs.LG 新提交

Diffuse AI Control on Fuzzy Tasks

模糊任务上的扩散AI控制

Mikhail Terekhov, Caglar Gulcehre, Vivek Hebbar, Joe Benton

机构 * Anthropic Fellows Program (via MATS)(Anthropic 研究员计划(通过 MATS)) EPFL(洛桑联邦理工学院) Redwood Research(红木研究) Anthropic

AI总结 针对AI在模糊任务上的长期扩散威胁,提出蓝队与红队对抗框架,通过弱模型评分训练强模型,并发现红队可利用多目标进化提示优化找到评分高但性能差的子版本行为,蓝队则通过对抗优化提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17056 2026-06-16 cs.CL 新提交

The Value Axis: Language Models Encode Whether They're on the Right Track

价值轴:语言模型编码它们是否在正确的轨道上

Nick Jiang, Isaac Kauvar, Jack Lindsey

机构 * Stanford University(斯坦福大学) Anthropic

AI总结 通过构建Qwen3-8B的“价值轴”,发现语言模型内部追踪当前轨迹的成功概率,并影响自信、自我纠正和探索行为。

Comments Code repository: https://github.com/nickjiang2378/value-axis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02343 2026-06-16 cs.LG cs.AI cs.IT math.IT 版本更新

Haiku to Opus in Just 10 bits: LLMs Unlock Large Compression Gains

仅用10比特从俳句到巨作:LLMs解锁巨大压缩增益

Roy Rinberg, Annabelle Michael Carrell, Simon Henniger, Nicholas Carlini, Keri Warr

机构 * Harvard University(哈佛大学) University of Cambridge(剑桥大学) Anthropic

AI总结 研究LLM生成文本的无损和有损压缩,提出问答压缩(QA)交互协议,用少量二进制问题实现超100倍压缩比,高效传递知识。

详情

展开后加载摘要…

URL PDF HTML 收藏