arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3484 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3484 篇

2509.09681 2026-01-13 cs.IR cs.AI cs.CL cs.LG 62%

DB3 Team's Solution For Meta KDD Cup' 25

DB3团队的Meta KDD杯'25解决方案

Yikuan Xia, Jiazun Chen, Yirui Zhan, Suifeng Zhao, Weipeng Jiang, Chaorui Zhang, Wei Han, Bo Bai, Jun Gao

机构 * Key Laboratory of High Confidence Software Technologies, CS, Peking University, China(高可信软件技术重点实验室,中国科学院,北京大学) Theory Lab, Central Research Institute, 2012 Labs, Huawei Technologies Co., Ltd, Shenzhen, China(理论实验室,中央研究院,2012实验室,华为技术有限公司,深圳)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 DB3团队通过多模态检索框架和拒绝训练方法,在KDD杯'25的CRAG-MM挑战中取得优异成绩,尤其在处理第一人称视角问题上表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01513 2026-01-08 cs.CV cs.AI 62%

FastV-RAG: Towards Fast and Fine-Grained Video QA with Retrieval-Augmented Generation

FastV-RAG: 向快速且细粒度的视频问答迈进:基于检索增强生成的框架

Gen Li, Peiyu Liu

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) University of International Business and Economics(国际商务经济大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 FastV-RAG通过引入推测解码和基于相似性的过滤策略,提升视频问答任务的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03270 2026-01-08 cs.CL cs.AI math.OC 62%

Advances and Challenges in Semantic Textual Similarity: A Comprehensive Survey

语义文本相似性的发展与挑战:全面综述

Lokendra Kumar, Neelesh S. Upadhye, Kannan Piedy

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了语义文本相似性在变压器模型、对比学习、领域适应等六个方面的最新进展,探讨了多模态、图方法和知识增强技术,并指出现有挑战与未来发展方向。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13164 2025-12-17 cs.CV cs.AI 62%

A Semantically Enhanced Generative Foundation Model Improves Pathological Image Synthesis

语义增强的生成基础模型提升病理图像合成

Xianchao Guan, Zhiyuan Fan, Yifeng Wang, Fuqiang Chen, Yanjiang Zhou, Zengyang Che, Hongxue Meng, Xin Li, Yaowei Wang, Hongpeng Wang, Min Zhang, Heng Tao Shen, Zheng Zhang, Yongbing Zhang

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 CRAFTS通过语义增强的生成基础模型提升病理图像合成质量,生成多样化病理图像并增强多种临床任务性能。

Comments 68 pages, 9 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16313 2025-12-17 cs.LG cs.AI cs.CL 62%

Retrieval Enhanced Feedback via In-context Neural Error-book

通过上下文神经错误本增强的检索反馈

Jongyeop Hyun, Bumsoo Kim

机构 * School of CSE Chung-Ang University(计算机科学与工程学院 Chung-Ang 大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 REFINE通过结构化反馈框架,系统分析并缓解多模态推理中的错误,提升推理效率和可扩展性。

Comments Accepted at EMNLP 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10596 2025-12-12 cs.CV cs.AI 62%

Beyond Pixels: A Training-Free, Text-to-Text Framework for Remote Sensing Image Retrieval

超越像素:一种无训练的文本到文本框架用于遥感图像检索

J. Xiao, Y. Guo, X. Zi, K. Thiyagarajan, C. Moreira, M. Prasad

机构 * Information Technology University of Technology Sydney Sydney, Australia(信息科技技术大学悉尼分校悉尼澳大利亚) Robotics Laboratory (SensR Lab) Centre for Advanced Manufacturing Technology Western Sydney University Sydney, Australia(机器人实验室(SensR实验室)先进制造技术中心西悉尼大学悉尼澳大利亚) The Data Science Institute Faculty of Engineering(数据科学学院工程学院)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出无训练的文本到文本框架TRSLLaVA,通过结构化文本实现高效遥感图像检索,实验表明其性能优于现有监督模型。

Comments 6 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02603 2025-12-11 eess.AS cs.CL cs.SD 62%

SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation

SEAL:用于带有检索增强生成的语音大语言模型的语音嵌入对齐学习

Chunyu Sun, Bingyu Liu, Zhichao Cui, Junhan Shi, Anbin Qi, Tian-hao Zhang, Dinghao Zhou, Lewei Lu

机构 * SenseTime Research(商汤科技研究院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 SEAL通过统一的语音和文本嵌入框架,提升语音大语言模型的检索效率与准确性,减少延迟并增强多模态检索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06105 2025-12-09 cs.CV cs.AI 62%

Explainable Melanoma Diagnosis with Contrastive Learning and LLM-based Report Generation

基于对比学习和大语言模型的可解释性黑色素瘤诊断

Junwen Zheng, Xinran Xu, Li Rong Wang, Chang Cai, Lucinda Siyun Tan, Dingyuan Wang, Hong Liang Tey, Xiuyi Fan

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于对比学习和大语言模型的可解释性黑色素瘤诊断框架,通过将临床标准映射到视觉Transformer空间,实现图像与临床解释的透明连接,提升模型可解释性与临床信任度。

Comments AAAI-26-AIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05908 2025-12-08 cs.SE cs.AI cs.CL cs.IR 62%

Natural Language Summarization Enables Multi-Repository Bug Localization by LLMs in Microservice Architectures

自然语言摘要通过LLM在微服务架构中多仓库Bug定位

Amirkia Rafiei Oskooei, S. Selcan Yukcu, Mehmet Cevheri Bozoglan, Mehmet S. Aktas

机构 * Yildiz Technical University, Dept. of Computer Eng.(Yildiz技术大学,计算机工程系) Yildiz Technical University, Department of Computer Engineering(Yildiz技术大学,计算机工程系)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 利用自然语言摘要和LLM技术,通过多仓库微服务架构实现更高效的Bug定位,显著提升定位准确率和透明度。

Comments Accepted at LLM4Code Workshop, ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00294 2025-12-02 cs.CV cs.AI cs.HC 62%

Words into World: A Task-Adaptive Agent for Language-Guided Spatial Retrieval in AR

词语进入世界:一种任务自适应代理用于增强现实中的语言引导空间检索

Lixing Guo, Tobias Höllerer

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种任务自适应AR代理,结合多模态大语言模型和视觉模型,实现语言引导的空间检索,支持复杂查询和真实世界交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07221 2025-11-25 cs.CV cs.AI 62%

Exploring the Use of Contrastive Language-Image Pre-Training for Human Posture Classification: Insights from Yoga Pose Analysis

探索对比语言-图像预训练在人体姿态分类中的应用:从瑜伽姿势分析获得的见解

Andrzej D. Dobrzycki, Ana M. Bernardos, Luca Bergesio, Andrzej Pomirski, Daniel Sáez-Trigueros

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究利用CLIP模型在瑜伽姿势分类中取得高准确率,展示其在人体姿态识别中的潜力,并验证其在自动化系统中的应用可行性。

Journal ref Mathematics 2024, 12(1), 76

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15488 2025-11-20 cs.CV cs.AI 62%

FQ-PETR: Fully Quantized Position Embedding Transformation for Multi-View 3D Object Detection

Jiangyong Yu, Changyong Shu, Sifan Zhou, Zichen Yu, Xing Hu, Yan Chen, Dawei Yang

机构 * HOUMO AI

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments This paper is acceptted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09228 2025-11-13 cs.CV cs.CL 62%

Taming Object Hallucinations with Verified Atomic Confidence Estimation

Jiarui Liu, Weihao Xuan, Zhijing Jin, Mona Diab

机构 * CMU(卡内基梅隆大学) The University of Tokyo(东京大学) The University of Toronto(多伦多大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08369 2025-11-12 cs.CV cs.AI 62%

Text-based Aerial-Ground Person Retrieval

Xinyu Zhou, Yu Wu, Jiayao Ma, Wenhao Wang, Min Cao, Mang Ye

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20354 2025-11-11 cs.CL cs.AI 62%

Rethinking Text-based Protein Understanding: Retrieval or LLM?

Juntong Wu, Zijing Liu, He Cao, Hao Li, Bin Feng, Zishan Shu, Ke Yu, Li Yuan, Yu Li

机构 * Peking University, Shenzhen Graduate School(北京大学深圳研究生院) International Digital Economy Academy (IDEA)(国际数字经济学院)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL、cs.AI

Comments Accepted by Empirical Methods in Natural Language Processing 2025 (EMNLP 2025) Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17685 2025-10-21 cs.CV cs.AI 62%

Multilingual Text-to-Image Person Retrieval via Bidirectional Relation Reasoning and Aligning

Min Cao, Xinyu Zhou, Ding Jiang, Bo Du, Mang Ye, Min Zhang

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Key Laboratory of New Generation Artificial Intelligence Technology & Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新 generation 人工智能技术及交叉应用重点实验室(东南大学),教育部,中国)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Final version published in IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Xplore link: https://ieeexplore.ieee.org/document/11199360

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13366 2025-10-16 cs.CL cs.AI 62%

Document Intelligence in the Era of Large Language Models: A Survey

Weishi Wang, Hengchang Hu, Zhijie Zhang, Zhaochen Li, Hongxin Shao, Daniel Dahlmeier

机构 * SAP, Singapore(新加坡SAP)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10426 2025-10-14 cs.CV cs.AI 62%

Taming a Retrieval Framework to Read Images in Humanlike Manner for Augmenting Generation of MLLMs

Suyang Xi, Chenxi Yang, Hong Ding, Yiqing Ni, Catherine C. Liu, Yunhao Liu, Chengqi Zhang

机构 * Emory University(埃默里大学) University of Electronic Science and Technology of China(电子科技大学) University of Illinois Chicago(伊利诺伊大学香槟分校) The Hong Kong Polytechnic University(香港理工大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05949 2025-10-08 cs.LG cs.AI cs.CV stat.ML 62%

Gaussian Embeddings: How JEPAs Secretly Learn Your Data Density

Randall Balestriero, Nicolas Ballas, Mike Rabbat, Yann LeCun

机构 * Meta-FAIR Brown University(布朗大学) NYU(纽约大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05016 2025-10-08 astro-ph.IM cs.AI cs.CL 62%

Large Language Models Achieve Gold Medal Performance at the International Olympiad on Astronomy & Astrophysics (IOAA)

Lucas Carrit Delgado Pinheiro, Ziru Chen, Bruno Caixeta Piazza, Ness Shroff, Yingbin Liang, Yuan-Sen Ting, Huan Sun

机构 * The Ohio State University(俄亥俄州立大学) Universidade de São Paulo(圣保罗大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 6 figures, to be submitted, comments are welcome. Reproducibility details can be found at: https://github.com/OSU-NLP-Group/LLM-IOAA

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02328 2025-10-06 cs.CL cs.AI cs.MA 62%

AMANDA: Agentic Medical Knowledge Augmentation for Data-Efficient Medical Visual Question Answering

Ziqing Wang, Chengsheng Mao, Xiaole Wen, Yuan Luo, Kaize Ding

机构 * Northwestern University(西北大学) Microsoft(微软公司)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

Comments EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24823 2025-09-30 cs.CR cs.AI cs.CV cs.LG 62%

Of-SemWat: High-payload text embedding for semantic watermarking of AI-generated images with arbitrary size

Benedetta Tondi, Andrea Costanzo, Mauro Barni

机构 * University of Siena(锡耶纳大学)

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV、cs.AI

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21356 2025-09-29 cs.CV cs.AI 62%

Phrase-grounded Fact-checking for Automatically Generated Chest X-ray Reports

Razi Mahmood, Diego Machado-Reyes, Joy Wu, Parisa Kaviani, Ken C. L. Wong, Niharika D'Souza, Mannudeep Kalra, Ge Wang, Pingkun Yan, Tanveer Syeda-Mahmood

机构 * Rensselaer Polytechnic Institute, NY, USA(罗文学院) IBM Research, Almaden, CA, USA(IBM研究院) Stanford University, CA, USA(斯坦福大学) Massachusetts General Hospital (MGH), Boston, USA(麻省总医院)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments In proceedings MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06290 2025-09-25 cs.LG cs.AI cs.CV 62%

CellCLIP -- Learning Perturbation Effects in Cell Painting via Text-Guided Contrastive Learning

Mingyu Lu, Ethan Weinberger, Chanwoo Kim, Su-In Lee

机构 * Paul G. Allen School of Computer Science & Engineering University of Washington(保罗·G·艾伦计算机科学与工程学院华盛顿大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05930 2025-09-24 cs.CL cs.CV cs.LG 62%

WebLINX: Real-World Website Navigation with Multi-Turn Dialogue

Xing Han Lù, Zdeněk Kasner, Siva Reddy

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17802 2025-09-23 cs.CV cs.AI 62%

TS-P$^2$CL: Plug-and-Play Dual Contrastive Learning for Vision-Guided Medical Time Series Classification

Qi'ao Xu, Pengfei Wang, Bo Zhong, Tianwen Qian, Xiaoling Wang, Ye Wang, Hong Yu

机构 * East China Normal University(东华大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11587 2025-09-16 cs.CV cs.AI 62%

Hierarchical Identity Learning for Unsupervised Visible-Infrared Person Re-Identification

Haonan Shi, Yubin Wang, De Cheng, Lingfeng He, Nannan Wang, Xinbo Gao

机构 * IEEE Publication Technology Department(IEEE出版技术部门) State Key Laboratory of Integrated Services Networks, School of Telecommunications Engineering, Xidian University(信息服务网络国家重点实验室,电信工程学院,西安电子科技大学) Department of Computer Science and Technology, Tongji University(计算机科学与技术系,同济大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08624 2025-09-11 cs.CV cs.AI 62%

UOPSL: Unpaired OCT Predilection Sites Learning for Fundus Image Diagnosis Augmentation

Zhihao Zhao, Yinzheng Zhao, Junjie Yang, Xiangtong Yao, Quanmin Liang, Daniel Zapp, Kai Huang, Nassir Navab, M. Ali Nasseri

机构 * Technical University of Munich(慕尼黑技术大学) Sun Yat-Sen University(中山大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

Comments BIBM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10559 2025-09-10 cs.CV cs.AI cs.ET 62%

From Images to Insights: Explainable Biodiversity Monitoring with Plain Language Habitat Explanations

Yutong Zhou, Masahiro Ryo

机构 * Leibniz Centre for Agricultural Landscape Research (ZALF)(莱比锡农业景观研究中心(ZALF)) Brandenburg University of Technology Cottbus–Senftenberg(勃兰登堡技术大学科特博斯-森芬根堡)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

Comments AISE workshop camera-ready version @ ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06020 2025-09-08 cs.AI cs.CV 62%

ArtRAG: Retrieval-Augmented Generation with Structured Context for Visual Art Understanding

Shuai Wang, Ivona Najdenkoska, Hongyi Zhu, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学) College of Business(商学院) Economics, University of Johannesburg(经济系,约翰内斯堡大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏