CORD: Bridging the Audio-Text Reasoning Gap via Weighted On-policy Cross-modal Distillation
CORD:通过加权在线跨模态蒸馏弥合音频-文本推理差距
机构 * ERNIE Team, Baidu(百度ERNIE团队) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)
专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.AI、eess.AS
AI总结 CORD通过加权在线跨模态蒸馏方法,有效弥合音频与文本推理之间的差距,提升音频条件推理能力。
Comments 13 pages, 4 figures