Investigating CoT Monitorability in Large Reasoning Models
探究大型推理模型中的CoT可监控性
机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证明负责任的人工智能与数据分析师实验室) ; King Abdullah University of Science and Technology(卡布斯大学) ; University of Georgia(佐治亚大学) ; University of Macau(澳门大学)
专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.CL
AI总结 本文探讨了大型推理模型中CoT可监控性的挑战与潜力,提出MoME范式以通过CoT监控其他模型的误行并提供结构化判断。