First Make It Playable, Then Make It Good: Staged Interaction Learning for Small Dialogue-Game Agents
先让它可玩,再让它变好:面向小型对话游戏智能体的分阶段交互学习
机构 * City, University of London(伦敦城市大学) ; The Alan Turing Institute(艾伦·图灵研究所)
AI总结 本研究提出Qwen-GuidePlay-2B模型,通过分阶段微调方法训练小型对话游戏智能体,在Playpen挑战赛中取得优异成绩,证明精心筛选策略可让小型模型实现高性能。
Comments Accepted at the LMP Challenge (EMNLP 2026 Workshop)