arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Anthropic

2026-05-13 至 2026-05-13 共收录 4
2605.12366 2026-05-13 cs.AI

Classifier Context Rot: Monitor Performance Degrades with Context Length

分类器上下文旋转:通过上下文长度监控性能退化

Sam Martin, Fabien Roger

机构 * Anthropic Fellows Program(Anthropic fellows项目)

AI总结 研究发现当前前沿模型在长上下文情况下难以检测危险行为,通过提示技术可部分缓解此问题,强调长上下文退化对监控性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12265 2026-05-13 cs.AI

How Useful Is Cross-Domain Generalization for Training LLM Monitors?

在训练LLM监控器时,跨领域泛化有多有用?

Sam Martin, Fabien Roger

机构 * Anthropic Fellows Program(Anthropic 后备计划)

AI总结 研究通过多任务训练提升跨领域分类性能,发现部分泛化效果,但存在特定场景下的失败,混合训练能保持优势并缓解泛化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11496 2026-05-13 cs.AI cs.CY cs.HC cs.LG

The Evaluation Differential: When Frontier AI Models Recognise They Are Being Tested

评估差异:当前沿AI模型认识到它们正在被测试

Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka, Ivan Flechais

机构 * Anthropic OpenAI UK AI Security Institute(英国人工智能安全研究所)

AI总结 研究探讨前沿AI模型在评估情境下的行为差异,提出评估差异(ED)概念,定义标准化效应量形式(nED),并提出TRACE审计协议以规范评估证据的使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11086 2026-05-13 cs.CR cs.AI cs.LG

ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks?

ExploitGym:AI代理能否将安全漏洞转化为实际攻击?

Zhun Wang, Nico Schiller, Hongwei Li, Srijiith Sesha Narayana, Milad Nasr, Nicholas Carlini, Xiangyu Qi, Eric Wallace, Elie Bursztein, Luca Invernizzi, Kurt Thomas, Yan Shoshitaishvili, Wenbo Guo, Jingxuan He, Thorsten Holz, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校) Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所) UC Santa Barbara(加州大学圣巴巴拉分校) Arizona State University(亚利桑那州立大学) Anthropic(Anthropic公司) OpenAI Google(谷歌)

AI总结 ExploitGym通过大规模真实漏洞数据评估AI代理的漏洞利用能力,揭示前沿模型在复杂漏洞利用中的表现,凸显AI发展对网络安全的潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏