ImageBind-LLM: Multi-modality Instruction Tuning
专题命中 多模态训练与对齐 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.MM
Comments Code is available at https://github.com/OpenGVLab/LLaMA-Adapter
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态训练与对齐 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.MM
Comments Code is available at https://github.com/OpenGVLab/LLaMA-Adapter
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
Comments BMVC 2022
专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV
Comments Authors are from Fudan University, China. Under Review
专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
CM-MAE:面向视觉-无线应用的物理引导跨模态自监督学习框架
专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV、cs.AI
AI总结 本文提出CM-MAE框架,通过软对比对齐损失等技术实现视觉-无线跨场景表征迁移,在DeepSense 6G数据集上提升了跨场景任务的准确率。
解决AI中的叠加问题以实现可解释性与患者-神经元图像的跨模态对齐
机构 * KAIST(韩国科学技术院) ; Konyang University(建阳大学) ; Chang Gung University(长庚大学) ; UCL Queen Square Institute of Neurology & The Francis Crick Institute(伦敦大学学院皇后广场神经病学研究所与弗朗西斯·克里克研究所)
专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV、cs.AI
AI总结 利用稀疏自编码器解决高维生物数据中神经网络表示空间的叠加问题,恢复几何保真度,并通过Gromov-Wasserstein最优传输实现图像与单细胞RNA测序数据的跨模态对齐。
Comments 10 pages, 7 figures (plus 14 in appendix), 1 table, preprint
TurtleAI:海龟图形学中视觉编程的多模态模型基准测试
机构 * MPI-SWS(马克斯·普朗克研究所-斯图加特)
专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV、cs.AI
AI总结 提出TurtleAI基准,包含823个基于海龟图形学真实任务的视觉编程任务,评估20多个多模态模型发现成功率低于30%,并通过少量种子样本生成合成数据微调Qwen2-VL-72B提升约20%性能。
Comments ACL Findings 2026 paper
难以阅读,却容易被破解:视觉退化如何绕过大语言模型的安全对齐
机构 * AGI Lab, Westlake University, China(西lake大学AGI实验室,中国) ; University of California, Merced, USA(加州大学默塞德分校,美国)
专题命中 多模态训练与对齐 :MLLM(title);分类 cs.CV、cs.AI
AI总结 研究发现视觉退化会削弱大语言模型的安全防御,提出结构化认知卸载策略以缓解风险。
Comments Accepted to Findings of ACL 2026
Q-Zoom:基于查询的自适应感知以实现高效多模态大语言模型
机构 * University of Sydney(悉尼大学) ; Sun Yat-sen University(中山大学) ; City University of Hong Kong(香港城市大学)
专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV、cs.AI
AI总结 Q-Zoom通过高效粗到细的框架优化多模态大语言模型的高分辨率感知,提升推理速度并保持精度,实验表明其在文档识别和高分辨率场景中表现优异。
Comments 16 pages, 9 figures
融合后鸟瞰图特征稳定化用于鲁棒多模态3D检测
机构 * Department of Electrical Engineering, University of South Florida(佛罗里达州立大学电气工程系) ; Department of Mechanical Engineering, University of South Florida(佛罗里达州立大学机械工程系)
专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV、cs.AI
AI总结 本文提出了一种轻量级模块PFS,通过稳定特征统计、抑制传感器退化区域和残差校正,提升多模态3D检测在域转移和传感器故障下的鲁棒性。
MotionTeller: 多模态整合可穿戴时间序列与大语言模型用于健康和行为理解
专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CL、cs.AI
AI总结 MotionTeller通过整合可穿戴时间序列与大语言模型,实现高精度的自然语言行为摘要生成,提升健康和行为理解的效率与准确性。
光谱偏差与跨模态语义一致性学习用于超光谱图像的目标检测
机构 * School of Computer, Wuhan University(武汉大学计算机学院) ; School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) ; school of computer, National University of Defense Technology(国防科技大学计算机学院) ; Shandong Provincial Key Laboratory of Computer Networks, Shandong Computer Science Center (National Supercomputing Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(山东省计算机网络重点实验室、山东省计算机科学中心(国家超级计算中心济南中心)、齐鲁工业大学(山东省科学院)) ; School of Computer and Artificial Intelligence, Zhengzhou University(郑州大学计算机与人工智能学院) ; School of Information and Communication Engineering, North University of China(北方大学信息与通信工程学院) ; National Key Laboratory of Electromagnetic Energy, Naval University of Engineering(电磁能国家重点实验室、海军工程大学) ; Hexagon AB
专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV、cs.AI
AI总结 本文提出SDCM网络,通过光谱偏差与跨模态语义一致性学习,提升超光谱图像目标检测的性能。
机构 * Department of Software \& Microelectronics, Peking University, Beijing, China ; Economic Law School, China University of Political Science ; Financial Media, Peking University, ChangSha, China
专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CL、cs.AI
机构 * Department of Orthopaedics and Traumatology, The University of Hong Kong(香港大学骨科与创伤学系) ; Department of Joint Surgery, Shandong Provincial Hospital Affiliated to Shandong First Medical University(山东省第一医科大学附属山东省人民医院骨科)
专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV、cs.AI
Comments 8 pages, 6 figures
机构 * Department of Computer Science and Engineering, BRAC University(计算机科学与工程系,布拉克大学) ; Department of Electrical and Electronic Engineering, Bangladesh University of Engineering and Technology(电气与电子工程系,孟加拉国工程与技术大学)
专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV、cs.AI
Comments Submitted to IEEE Journal of Biomedical and Health Informatics (JBHI). This preprint includes few additional details not present in the journal submission
机构 * Boston University(波士顿大学)
专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV、cs.AI
Comments Accepted to EMNLP 2025. Data and code to be released at https://github.com/wdqin/VLN-NAP
机构 * The University of Edinburgh(爱丁堡大学) ; Imperial College London(帝国理工学院) ; Shenzhen Yinwang Intelligent Technology Co., Ltd(深圳英伟达智能技术有限公司)
专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CL、cs.AI
Comments Findings of The 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)
机构 * Tel Aviv University(特拉维夫大学) ; Google Research(谷歌研究)
专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV、cs.CL
Comments Accepted to NAACL 2025
Journal ref Proceedings of the 2025 Conference of the North American Chapter of the Association for Computational Linguistics, Human Language Technologies, Long Papers, pp. 10497-10518
机构 * Michigan State University(密歇根州立大学) ; Tsinghua University(清华大学)
专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV、cs.AI
Comments In Proceedings of ACM MobiCom (2024)
机构 * Flipkart Data Science(Flipkart数据科学)
专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV、cs.AI
机构 * University of Strasbourg, CNRS, INSERM, ICube, UMR7357, Strasbourg, France(斯特拉斯堡大学,法国国家科学研究中心(CNRS),法国国家卫生研究院(INSERM),ICube,UMR7357,斯特拉斯堡) ; Institute of Image-Guided Surgery, IHU Strasbourg, Strasbourg, France(影像引导手术研究所,斯特拉斯堡IHU,斯特拉斯堡)
专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV、cs.AI
机构 * Department of Automation, Tsinghua University(自动化系,清华大学)
专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV、cs.AI
Comments Accepted to CVPR 2025
专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV、cs.AI
Journal ref Pattern Recognition Letters 193 (2025) 86-93
机构 * City University of Hong Kong, Dongguan Campus(香港城市大学东莞校区) ; The University of Melbourne(墨尔本大学) ; Tsinghua University(清华大学) ; Baidu Inc.(百度公司) ; University of Chinese Academy of Science(中国科学院大学) ; National University of Singapore(新加坡国立大学)
专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV、cs.AI
Comments 11 pages, 4 figures, Submitted to ACM MM 2025
专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV、cs.AI
Comments Accepted by CVPR 2025
专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV、cs.AI
Comments Accepted in the 2025 WACV workshop GeoCV
专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV、cs.AI
Comments CVPR GeolifeCLEF
专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV、cs.AI
Comments Accepted by AAAI 2025
专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV、cs.AI
Comments Accepted for publication in AAAI 2025 (Main Track)