H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation
H-OPD:置信感知异构多教师多模态在线策略蒸馏
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; ByteDance(字节跳动) ; USTC(中国科学技术大学) ; Beijing Key Laboratory of Network System and Network Culture(北京网络系统与网络文化重点实验室) ; Key Laboratory of Interactive Technology and Experience System, Ministry of Culture and Tourism(文化和旅游部互动技术与体验系统重点实验室) ; Zhongguancun Academy(中关村科学城)
AI总结 研究多模态推理的在线策略蒸馏问题,提出H-OPD框架,通过验证异构教师互补性,以令牌级教师仲裁取代任务或样本级路由,结合视觉与文本教师,在多基准测试中性能优越。
Comments EMNLP2026