AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent
AgentLens: 通过机制子空间实现多轮编码代理的可解释安全引导
机构 * University of Georgia(佐治亚大学) ; University of South Florida(南佛罗里达大学) ; Rutgers University(罗格斯大学) ; University of Southern California(南加州大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出AgentLens框架,从内部表示层检测和缓解多轮编码代理的安全风险,通过单层10维子空间干预实现运行时安全控制,并在MAS基准上验证有效性。