Epistemic Traps: Rational Misalignment Driven by Model Misspecification
知识陷阱:由模型规格不准确驱动的理性偏差
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; ShanghaiTech University(上海科技大学)
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出主观模型工程,通过设计代理的内部信念结构来实现稳健对齐,揭示安全由认知先验决定而非奖励大小连续函数。