Multimodal and Multiscale Spatial-Temporal Semantic Search and Recommendation with AI Foundation Models
基于AI基础模型的多模态与多尺度时空语义搜索与推荐
机构 * School of Geographical Sciences and Urban Planning, Arizona State University(地理科学与城市规划学院,亚利桑那州立大学) ; Alaska Native Tribal Health Consortium(阿拉斯加原住民部落健康联盟) ; Woodwell Climate Research Center(伍德沃德气候研究中心) ; School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学)
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI
AI总结 提出融合大语言模型和视觉-语言模型的框架,通过CAMERA算法融合文本与视觉信息生成更丰富嵌入,以及ASTRA算法结合尺度依赖的时空相关性与语义相似性进行重排序,在环境事件文档检索中优于单模态方法。
Comments 17 pages, accepted for publication in the ACM Transactions on Spatial Algorithms and Systems