Achieving Fine-grained Cross-modal Understanding through Brain-inspired Hierarchical Representation Learning
通过脑启发的分层表征学习实现细粒度跨模态理解
机构 * School of Computing, University of Georgia, Athens, GA, USA(计算学院,佐治亚大学,亚特兰大,GA,USA)
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV
AI总结 NeuroAlign通过脑启发的分层表征学习,在fMRI-视频对齐中实现细粒度跨模态理解,提升跨模态检索性能。