arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-05 至 2026-01-05 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 3 篇

2601.00352 2026-01-05 cs.CV 83%

OmniVaT: Single Domain Generalization for Multimodal Visual-Tactile Learning

OmniVaT:单域泛化用于多模态视觉-触觉学习

Liuxiang Qiu, Hui Da, Yuzhen Niu, Tiesong Zhao, Yang Cao, Zheng-Jun Zha

机构 * Fujian Key Laboratory for Intelligent Processing and Wireless Transmission of Media Information(福建智能媒体信息处理与无线传输重点实验室) College of Physics and Information Engineering(物理与信息工程学院) Fuzhou University(福州市大学) College of Computer and Data Science(计算机与数据科学学院) MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition(MoE脑启发智能感知与认知重点实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 OmniVaT通过多模态分数傅里叶适配器和离散树生成模块,首次实现单域泛化多模态视觉-触觉学习任务,提升跨领域适应性与泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00670 2026-01-05 cs.HC 82%

Wave2Word: A Multimodal Transformer Framework for Joint EEG-Text Alignment and Multi-Task Representation Learning in Neurocritical Care

Wave2Word: 一种多模态Transformer框架,用于神经重症监护中的联合EEG-文本对齐和多任务表示学习

Argha Kamal Samanta, Deepak Mewada, Monalisa Sarma, Debasis Samanta

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 Wave2Word提出一种多模态Transformer框架,通过整合信号域建模与结构化临床语言监督,实现EEG-文本对齐和多任务表示学习,提升神经重症监护中的EEG分析效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00273 2026-01-05 eess.IV cs.CV 79%

UKAN-EP: Enhancing U-KAN with Efficient Attention and Pyramid Aggregation for 3D Multi-Modal MRI Brain Tumor Segmentation

UKAN-EP: 通过高效的注意力和金字塔聚合增强U-KAN以实现3D多模态MRI脑肿瘤分割

Yanbing Chen, Tianze Tang, Taehyo Kim, Hai Shu

机构 * Department of Biostatistics, School of Global Public Health, New York University(生物统计学系,全球公共卫生学院,纽约大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 UKAN-EP通过引入高效的通道注意力和金字塔特征聚合模块,提升3D多模态MRI脑肿瘤分割的准确性和效率。

Journal ref BMC Medical Imaging, Volume 25, article number 517, (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏