arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-18 至 2025-09-18 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6 篇

2509.13676 2025-09-18 cs.CV cs.AI 84%

Re-purposing SAM into Efficient Visual Projectors for MLLM-Based Referring Image Segmentation

Xiaobo Yang, Xiaojin Gong

机构 * Zhejiang University(浙江大学)

专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04758 2025-09-18 cs.MM 79%

Music2Palette: Emotion-aligned Color Palette Generation via Cross-Modal Representation Learning

Jiayun Hu, Yueyi He, Tianyi Liang, Changbo Wang, Chenhui Li

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13636 2025-09-18 cs.LG 78%

Multimodal signal fusion for stress detection using deep neural networks: a novel approach for converting 1D signals to unified 2D images

Yasin Hasanpoor, Bahram Tarvirdizadeh, Khalil Alipour, Mohammad Ghamari

专题命中 多模态训练与对齐 :multimodal(title,abstract)

Comments 14 pages 7 images 2 tables

Journal ref 11760_2025_4734_Article

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14061 2025-09-18 cs.LG cs.AI 57%

Queen Detection in Beehives via Environmental Sensor Fusion for Low-Power Edge Computing

Chiara De Luca, Elisa Donati

机构 * Institute of Neuroinformatics University of Zurich and ETH Zurich(神经信息学研究所(苏黎世大学和苏黎世联邦理工学院)) Digital Society Initiative University of Zurich(数字社会倡议(苏黎世大学))

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18131 2025-09-18 cs.CV 57%

UniPLV: Towards Label-Efficient Open-World 3D Scene Understanding by Regional Visual Language Supervision

Yuru Wang, Pei Liu, Songtao Wang, Zehan Zhang, Xinyan Lu, Changwei Cai, Hao Li, Fu Liu, Peng Jia, Xianpeng Lang

机构 * Li Auto Inc.(力汽车公司) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.01052 2025-09-18 cs.LG cs.AI stat.ML 57%

Joint data imputation and mechanistic modelling for simulating heart-brain interactions in incomplete datasets

Jaume Banus, Maxime Sermesant, Oscar Camara, Marco Lorenzi

机构 * Inria(法国国家信息与自动化技术研究所) Université Côte d’Azur(蔚蓝海岸大学) PhySense(PhySense公司) Department of Information and Communication Technologies(信息与通信技术系) Universitat Pompeu Fabra(庞培法布拉大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏