Cross-Modal Binary Attention: An Energy-Efficient Fusion Framework for Audio-Visual Learning
跨模态二进制注意力:面向音频视觉学习的高效融合框架
机构 * Peter L. Reichertz Institute for Medical Informatics of TU Braunschweig and Hannover Medical School(图林根工业大学和汉诺威医学院医学信息学研究所) ; Lower Saxony Center for AI and Causal Methods in Medicine (CAIMed)(下萨克森人工智能与因果医学方法中心)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);audio-visual fusion(abstract);分类 cs.CV、cs.MM
AI总结 提出CMQKA和SNNergy,通过高效二进制操作实现线性复杂度的跨模态融合,显著提升音频视觉任务的能耗效率和性能