Aligning Machiavellian Agents: Behavior Steering via Test-Time Policy Shaping
对 Machiavellian 代理进行对齐:通过测试时策略塑造实现行为引导
专题命中 AI治理与伦理 :alignment(abstract,comments);分类 cs.CL、cs.AI
AI总结 本文提出了一种测试时策略塑造方法,通过模型引导的策略调整,解决预训练代理在复杂环境中的伦理对齐问题,实现奖励最大化与伦理约束的平衡。
Comments Accepted to AAAI 2026 AI Alignment Track