arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-27 至 2026-01-27 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 6 篇

2510.26861 2026-01-27 cs.IR cs.CL 83%

Evaluating Perspectival Biases in Cross-Modal Retrieval

评估跨模态检索中的视角偏差

Teerapol Saengsukhiran, Peerawat Chomphooyod, Narabodee Rodjananant, Chompakorn Chaksangchaichot, Patawee Prakrankamanant, Witthawin Sripheanpol, Pak Lovichit, Sarana Nutanong, Ekapol Chuangsuwanich

机构 * Department of Computer Engineering, Chulalongkorn University(楚莱隆坤大学计算机工程系) School of Information Science and Technology, VISTEC(信息科学与技术学院,VISTEC)

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 本文提出3XCM基准,揭示跨模态检索中语言和文化偏见的影响,强调需通过解耦策略实现公平检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16984 2026-01-27 cs.LG cs.AI cs.CL cs.CV cs.IR cs.MM 83%

TelcoAI: Advancing 3GPP Technical Specification Search through Agentic Multi-Modal Retrieval-Augmented Generation

TelcoAI: 通过代理多模态检索增强生成技术推进3GPP技术规范搜索

Rahul Ghosh, Chun-Hao Liu, Gaurav Rele, Vidya Sagar Ravipati, Hazar Aouad

机构 * Generative AI Innovation Center, Amazon Web Services (AWS)(生成式AI创新中心,亚马逊网络服务)

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 TelcoAI通过代理多模态检索增强生成技术,提升3GPP技术规范搜索的准确性和效率,实现87%的召回率和16%的性能提升。

Comments Accepted to IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15434 2026-01-27 cs.CE 78%

ManuRAG: Multi-modal Retrieval Augmented Generation for Manufacturing Question Answering (Early Version)

ManuRAG:面向制造业问答的多模态检索增强生成

Yunqing Li, Zihan Dong, Farhad Ameri, Jianbang Zhang

专题命中 跨模态检索 :multi-modal(title,abstract)

AI总结 ManuRAG通过多模态检索增强生成技术,提升制造业问答的准确性与可靠性,适用于多种领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17905 2026-01-27 cs.CV cs.AI stat.ML 62%

Feature-Space Generative Models for One-Shot Class-Incremental Learning

特征空间生成模型用于单样本类增量学习

Jack Foster, Kirill Paramonov, Mete Ozay, Umberto Michieli

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 Gen1S通过特征空间生成模型提升单样本类增量学习中的新类识别性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18195 2026-01-27 cs.CV 57%

QualiRAG: Retrieval-Augmented Generation for Visual Quality Understanding

QualiRAG:用于视觉质量理解的检索增强生成

Linhan Cao, Wei Sun, Weixia Zhang, Xiangyang Zhu, Kaiwei Zhang, Jun Jia, Dandan Zhu, Guangtao Zhai, Xiongkuo Min

机构 * Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 QualiRAG通过检索增强生成框架,利用大模型的潜在感知知识,实现无需训练的视觉质量理解与比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05293 2026-01-27 cs.CV 57%

Cross-domain EEG-based Emotion Recognition with Contrastive Learning

跨领域EEG情感识别与对比学习

Rui Yan, Yibo Li, Han Ding, Fei Wang

机构 * School of Software Engineering, Xi'an Jiaotong University, China(西安交通大学软件工程学院) School of Computer Science and Technology, Xi'an Jiaotong University, China(西安交通大学计算机科学与技术学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 EmotionCLIP通过多模态对比学习提升EEG情感识别的跨领域泛化能力,实现跨受试者和跨时间的高准确率

Comments Accepted by IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏