Classifier Context Rot: Monitor Performance Degrades with Context Length
分类器上下文旋转:通过上下文长度监控性能退化
机构 * Anthropic Fellows Program(Anthropic fellows项目)
AI总结 研究发现当前前沿模型在长上下文情况下难以检测危险行为,通过提示技术可部分缓解此问题,强调长上下文退化对监控性能的影响。
大厂专区
分类器上下文旋转:通过上下文长度监控性能退化
机构 * Anthropic Fellows Program(Anthropic fellows项目)
AI总结 研究发现当前前沿模型在长上下文情况下难以检测危险行为,通过提示技术可部分缓解此问题,强调长上下文退化对监控性能的影响。
在训练LLM监控器时,跨领域泛化有多有用?
机构 * Anthropic Fellows Program(Anthropic 后备计划)
AI总结 研究通过多任务训练提升跨领域分类性能,发现部分泛化效果,但存在特定场景下的失败,混合训练能保持优势并缓解泛化问题。
评估差异:当前沿AI模型认识到它们正在被测试
机构 * Anthropic ; OpenAI ; UK AI Security Institute(英国人工智能安全研究所)
AI总结 研究探讨前沿AI模型在评估情境下的行为差异,提出评估差异(ED)概念,定义标准化效应量形式(nED),并提出TRACE审计协议以规范评估证据的使用。
ExploitGym:AI代理能否将安全漏洞转化为实际攻击?
机构 * UC Berkeley(加州大学伯克利分校) ; Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所) ; UC Santa Barbara(加州大学圣巴巴拉分校) ; Arizona State University(亚利桑那州立大学) ; Anthropic(Anthropic公司) ; OpenAI ; Google(谷歌)
AI总结 ExploitGym通过大规模真实漏洞数据评估AI代理的漏洞利用能力,揭示前沿模型在复杂漏洞利用中的表现,凸显AI发展对网络安全的潜在风险。