arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-21 至 2025-11-21 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6 篇

2511.16229 2025-11-21 cs.CR cs.AI 89%

Q-MLLM: Vector Quantization for Robust Multimodal Large Language Model Security

Q-MLLM:向量量化用于鲁棒多模态大语言模型安全

Wei Zhao, Zhe Li, Yige Li, Jun Sun

机构 * Singapore Management University(新加坡管理大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 Q-MLLM通过两级向量量化提升多模态大语言模型的安全性,有效防御对抗性攻击并保持模型实用性。

Comments Accepted by NDSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15741 2025-11-21 cs.AI cs.HC cs.LG 88%

Uncertainty-Resilient Multimodal Learning via Consistency-Guided Cross-Modal Transfer

通过一致性引导的跨模态转移实现不确定性鲁棒的多模态学习

Hyo-Jeong Jang

机构 * Brain and Cognitive Engineering(脑科学与认知工程)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.AI

AI总结 本论文提出通过一致性引导的跨模态转移实现不确定性鲁棒的多模态学习,旨在提高模型的稳定性和鲁棒性。

Comments Master's thesis, Korea University, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11706 2025-11-21 cs.LG cs.CV 74%

Context-Aware Multimodal Representation Learning for Spatio-Temporally Explicit Environmental Modelling

面向情境的多模态表示学习用于时空明确的环境建模

Julia Peters, Karin Mora, Miguel D. Mahecha, Chaonan Ji, David Montero, Clemens Mosig, Guido Kraemer

机构 * Environmental Data Science and Remote Sensing Group(环境数据科学与遥感小组) Institute for Earth System Science and Remote Sensing(地球系统科学与遥感研究所) Leipzig University(莱比锡大学) German Centre for Integrative Biodiversity Research (iDiv)(整合生物多样性研究德国中心(iDiv))

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

AI总结 本文提出一种面向情境的多模态表示学习框架,整合不同地球观测模态以高时空分辨率建模环境,提升生态分析的精度与效率。

Comments 10 pages (incliding 2 pages of references), 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16435 2025-11-21 cs.CV 70%

Beyond Visual Cues: Leveraging General Semantics as Support for Few-Shot Segmentation

超越视觉线索:利用通用语义作为少样本分割的支持

Jin Wang, Bingfeng Zhang, Jian Pang, Mengyu Liu, Honglong Chen, Weifeng Liu

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出语言驱动属性泛化架构,通过多属性增强和多模态对齐提升少样本分割性能,实现新的最佳效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15967 2025-11-21 cs.CV 57%

InfoCLIP: Bridging Vision-Language Pretraining and Open-Vocabulary Semantic Segmentation via Information-Theoretic Alignment Transfer

InfoCLIP: 通过信息论对齐转移连接视觉语言预训练与开放词汇语义分割

Muyao Yuan, Yuanhong Zhang, Weizhan Zhang, Lan Ma, Yuan Gao, Jiangyong Ying, Yudeng Xin

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

AI总结 InfoCLIP通过信息论对齐转移提升开放词汇语义分割的性能,有效解决预训练CLIP在微调过程中的过拟合问题。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15669 2025-11-21 cs.CV 57%

UINO-FSS: Unifying Representation Learning and Few-shot Segmentation via Hierarchical Distillation and Mamba-HyperCorrelation

UINO-FSS: 通过层次化蒸馏和Mamba-超相关性统一表示学习与少样本分割

Wei Zhuo, Zhiyue Tang, Wufeng Xue, Hao Ding, Junkai Ji, Linlin Shen

机构 * School of Artificial Intelligence and the National Engineering Laboratory of Big Data System Computing Technology, Shenzhen University(人工智能学院和大数据系统计算技术国家工程实验室,深圳大学) Guangdong Provincial Key Laboratory of Intelligent Information Processing, China(广东省智能信息处理重点实验室,中国) School of Biomedical Engineering, Shenzhen University Medical School, Shenzhen University(生物医学工程学院,深圳大学医学院,深圳大学) Department of Computer Science, University of Nottingham Ningbo China(计算机科学系,宁波大学中国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 UINO-FSS通过层次化蒸馏和Mamba-超相关性整合不同基础模型知识,实现少样本分割的统一学习框架,取得新SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏