Amplification Effects in Test-Time Reinforcement Learning: Safety and Reasoning Vulnerabilities
测试时强化学习中的放大效应:安全性和推理漏洞
机构 * Penn State University(宾夕法尼亚州立大学) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Mitsubishi Electric Research Laboratories(三菱电机研究实验室)
AI总结 本文研究了测试时训练方法的安全性漏洞,发现测试时强化学习中有害提示注入会放大模型行为,导致推理能力下降。