arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-12 至 2025-12-12 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 3 篇

2411.10036 2025-12-12 cs.CV cs.AI 81%

Rethinking Normalization Strategies and Convolutional Kernels for Multimodal Image Fusion

重新思考归一化策略和卷积核在多模态图像融合中的作用

Dan He, Guofen Wang, Weisheng Li, Yucheng Shu, Wenbo Li, Lijian Yang, Yuping Huang, Feiyan Li

机构 * Chongqing University of Posts and Telecommunications(重庆邮电大学) Chongqing Normal University(重庆师范大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种改进的UNet架构,通过混合实例和组归一化以及多路径自适应融合模块,提升多模态图像融合的性能和细节保留能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04519 2025-12-12 cs.CV 79%

l0-Regularized Sparse Coding-based Interpretable Network for Multi-Modal Image Fusion

基于l0正则化稀疏编码的可解释网络用于多模态图像融合

Gargi Panda, Soumitra Kundu, Saumik Bhattacharya, Aurobinda Routray

机构 * Department of EE, IIT Kharagpur, India(印度IIT Kharagpur电子工程系) Rekhi Centre of Excellence for the Science of Happiness, IIT Kharagpur, India(印度IIT Kharagpur幸福科学卓越中心) Department of E&ECE, IIT Kharagpur, India(印度IIT Kharagpur电子工程与电子学系)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出基于l0正则化稀疏编码的可解释网络FNet,用于多模态图像融合,通过分离独特和共同特征提升融合质量并增强下游任务性能。

Comments Accetped by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17552 2025-12-12 cs.CL cs.AI 62%

Can LLMs Reason Over Non-Text Modalities in a Training-Free Manner? A Case Study with In-Context Representation Learning

LLMs能否在无训练模式下推理非文本模态?一种基于上下文表示学习的案例研究

Tianle Zhang, Wanlong Fang, Jonathan Woo, Paridhi Latawa, Deepak A. Subramanian, Alvin Chan

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) AI-X, Interdisciplinary Graduate Programme, Nanyang Technological University(南洋理工大学人工智能交叉研究生项目) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科钦医学院) Centre of AI in Medicine (C-AIM), Nanyang Technological University(南洋理工大学医学人工智能中心) University of Toronto(多伦多大学) Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里洛妇女医院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ICRL框架,使LLMs在无训练情况下利用非文本模态表示,通过少量学习实现多模态推理,为适应性泛化提供新方向。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏