Step-Level Preference Learning for Generative Agents in Social Simulations
社会模拟中生成式智能体的步骤级偏好学习
机构 * Shanghai Qi Zhi Institute(上海期智研究院) ; Xiongan AI Institute(雄安人工智能研究院) ; Tsinghua University(清华大学) ; CUHK-Shenzhen(香港中文大学(深圳)) ; USTC(中国科学技术大学) ; Sun Yat-sen University(中山大学)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 研究基于大语言模型的生成式智能体模拟人类行为时中间步骤注释稀缺问题,引入交互式模拟界面收集步骤级人类偏好监督,经监督微调算法和直接偏好优化方法进行步骤级偏好学习,提升模拟效果,证明步骤级人类监督是有效训练信号。
Comments WAICA2026