Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning
Switch-Reasoner:通过强化学习在多任务混合中学习何时思考
机构 * Wuhan University(武汉大学) ; Xiaomi Inc(小米公司) ; Wuhan University of Technology(武汉理工大学) ; Nanyang Technological University(南洋理工大学) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 研究针对多模态大语言模型在异构多任务中“先思考后回答”范式的低效及训练后学习何时思考不稳定的问题,提出基于GRPO的Switch-Reasoner框架,通过双层调节机制实现推理模式自适应选择,实验验证其能减少不必要推理并平衡准确率与效率。