arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-24 至 2025-12-24 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 3 篇

2512.20257 2025-12-24 cs.CV 83%

LADLE-MM: Limited Annotation based Detector with Learned Ensembles for Multimodal Misinformation

LADLE-MM:基于有限标注的多模态虚假信息检测器

Daniele Cardullo, Simone Teglia, Irene Amerini

机构 * Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 LADLE-MM是一种基于有限标注的多模态虚假信息检测器,通过学习的集成方法在有限资源下实现高效检测,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20088 2025-12-24 cs.CV cs.AI 62%

Item Region-based Style Classification Network (IRSN): A Fashion Style Classifier Based on Domain Knowledge of Fashion Experts

基于物品区域的风格分类网络(IRSN):一种基于时尚专家领域知识的时尚风格分类器

Jinyoung Choi, Youngchae Kwon, Injung Kim

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 IRSN通过分析物品区域特征和组合,结合双主干架构提升时尚风格分类准确率

Comments This is a pre-print of an article published in Applied Intelligence. The final authenticated version is available online at: https://doi.org/10.1007/s10489-024-05683-9

Journal ref Applied Intelligence, Vol. 54, pp. 6197-6209 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17004 2025-12-24 cs.CV cs.CL 62%

Vision Language Models are Confused Tourists

视觉语言模型是困惑的游客

Patrick Amadeus Irawan, Ikhlasul Akmal Hanif, Muhammad Dehan Al Kautsar, Genta Indra Winata, Fajri Koto, Alham Fikri Aji

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本研究提出ConfusedTourist,通过文化对抗鲁棒性测试揭示视觉语言模型在文化线索干扰下的稳定性问题,发现其在简单扰动下表现显著下降,凸显了多文化环境下模型鲁棒性的关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏