DynaMind: Reconstructing Dynamic Visual Scenes from EEG by Aligning Temporal Dynamics and Multimodal Semantics to Guided Diffusion
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
Comments 14 pages, 6 figures
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
Comments 14 pages, 6 figures
机构 * Hong Kong Institute of Science & Innovation(香港科学与工业创新研究院) ; CAMP, Technische Universität München(CAMP,慕尼黑技术大学) ; Department of Surgery, Faculty of Medicine, The Chinese University of Hong Kong(香港中文大学医学院外科部)
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
机构 * University of Trieste, Trieste, Italy(特里埃斯特大学) ; University of Southern California, Los Angeles, California(南加州大学) ; King's College London, London, United Kingdom(伦敦国王学院)
专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI
机构 * OpenGVLab, Shanghai AI Laboratory, China(OpenGVLab,上海人工智能实验室) ; University of Science and Technology of China(中国科学技术大学) ; Honor Device Co.,Ltd(荣耀设备有限公司) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) ; Nanjing University(南京大学)
专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV
机构 * Department of Computer Science, The University of Auckland(计算机科学系,奥克兰大学) ; School of Information Systems, Queensland University of Technology(信息系统学院,昆士兰技术大学) ; Department of Economics, The University of Auckland(经济学系,奥克兰大学)
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL
机构 * School of Computer Science University of Bristol(计算机科学学院英国布里斯托尔大学)
专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV
Comments Accepted at BMVC 2025
机构 * Computer and Information Science, University of Arkansas - Little Rock(计算机与信息科学,亚拉荷马州立大学) ; ICSI, University of California, Berkeley(ICSI,加州大学伯克利分校) ; COSMOS Research Center, University of Arkansas - Little Rock(COSMOS研究中心,亚拉荷马州立大学)
专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.MM
机构 * Stanford University(斯坦福大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
机构 * Sensetime(秒氏科技)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
机构 * University of Science and Technology of China(中国科学技术大学) ; MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学脑启发式智能感知与认知实验室) ; Zhejiang Gongshang University(浙江工商大学) ; ReLER, CCAI, Zhejiang University(ReLER,中国计算机学会,浙江大学)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.MM
Comments Accepted at EMNLP 2025
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
Comments arXiv admin note: text overlap with arXiv:2403.07815 by other authors
Journal ref Ocean Engineering, Volume 341, Part 2, 1 December 2025, Article 122502
机构 * Cornell University(康奈尔大学) ; UC San Diego(南加州大学)
专题命中 视频多模态 :multi-modal(abstract)
Comments Conference on Robot Learning, Oral