arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-12 至 2026-02-12 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 4 篇

2504.09221 2026-02-12 cs.HC cs.LG 82%

CMCRD: Cross-Modal Contrastive Representation Distillation for Emotion Recognition

CMCRD:跨模态对比表示蒸馏用于情绪识别

Siyuan Kan, Huanyu Wu, Zhenyao Cui, Fan Huang, Xiaolong Xu, Dongrui Wu

机构 * Key Laboratory of Image Processing and Intelligent Control, Ministry of Education, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(图像处理与智能控制重点实验室、教育部、自动化学院、华中科技大学) Wuhan Institute of Digital Engineering(武汉数字工程研究所) Shanghai Jiao Tong University(上海交通大学)

专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract)

AI总结 CMCRD通过跨模态对比表示蒸馏提升情绪识别准确性,减少多模态数据需求,实验表明在EEG和眼动数据间相互辅助训练可提高分类准确率约6.2%。

Journal ref IEEE Trans. on Affective Computing, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00653 2026-02-12 cs.CV cs.AI 62%

Non-Contrastive Vision-Language Learning with Predictive Embedding Alignment

非对比视觉语言学习与预测嵌入对齐

Lukas Kuhn, Giuseppe Serra, Florian Buettner

机构 * Goethe University Frankfurt(法兰克福歌德大学) German Cancer Research Center (DKFZ)(德国癌症研究中心(DKFZ)) German Cancer Consortium (DKTK)(德国癌症联合会(DKTK))

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 NOVA通过联合嵌入预测与分布正则化,实现非对比视觉语言学习,简化训练目标并提升稳定性与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10553 2026-02-12 cs.LG cs.AI 57%

Contrastive Learning for Multi Label ECG Classification with Jaccard Score Based Sigmoid Loss

基于Jaccard分数的Sigmoid损失的多标签ECG分类对比学习

Junichiro Takahashi, Masataka Sato, Satoshi Kodeta, Norihiko Takeda

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出基于Jaccard分数的Sigmoid损失的对比学习方法,用于提升多标签ECG分类的性能,通过改进损失函数和数据增强技术提高诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23050 2026-02-12 cs.LG cs.AI 57%

Understanding Language Prior of LVLMs by Contrasting Chain-of-Embedding

通过对比嵌入链理解LVLMs的语言先验

Lin Long, Changdae Oh, Seongheon Park, Sharon Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 通过对比嵌入链分析,揭示LVLMs中视觉信息整合的关键层及影响响应生成的强度量化方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏