LLM Active Alignment: A Nash Equilibrium Perspective
LLM主动对齐:从纳什均衡视角出发
机构 * College of AI, Tsinghua University, Beijing, China(人工智能学院,清华大学,北京,中国) ; Harvard University, Cambridge, MA, USA(哈佛大学,马萨诸塞州剑桥,美国) ; Department of Electronic Engineering, Tsinghua University, Beijing, China(电子工程系,清华大学,北京,中国)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.AI
AI总结 本文提出了一种基于纳什均衡的LLM主动对齐方法,通过建模代理行为以避免文本空间计算难题,并展示其在社交媒体中防止政治排斥的应用潜力。