arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3484 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3484 篇

2505.03242 2025-05-07 cs.CV cs.AI 62%

Seeing the Abstract: Translating the Abstract Language for Vision Language Models

Davide Talon, Federico Girella, Ziyue Liu, Marco Cristani, Yiming Wang

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted to CVPR25. Project page: https://davidetalon.github.io/fashionact-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12309 2025-04-21 cs.CY cs.AI cs.CL cs.IR 62%

Large Language Model-Based Knowledge Graph System Construction for Sustainable Development Goals: An AI-Based Speculative Design Perspective

Yi-De Lin, Guan-Ze Liao

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

Comments This is a minor revision: fixed a typo in the abstract (time range) and corrected minor textual errors

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02064 2025-04-18 cs.CV cs.AI 62%

ArtCrafter: Text-Image Aligning Style Transfer via Embedding Reframing

Nisha Huang, Kaer Huang, Yifan Pu, Jiangshan Wang, Jie Guo, Yiqiang Yan, Xiu Li, Tong-Yee Lee

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 13 pages, 17 figures, submitted to a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05316 2025-04-09 cs.IR cs.AI cs.CV 62%

Scale Up Composed Image Retrieval Learning via Modification Text Generation

Yinan Zhou, Yaxiong Wang, Haokun Lin, Chen Ma, Li Zhu, Zhedong Zheng

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07766 2025-04-09 cs.CL cs.AI 62%

Large Language Models for Knowledge Graph Embedding: A Survey

Bingchen Liu, Yuanyuan Fang, Naixing Xu, Shihao Hou, Xin Li, Qian Li

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21309 2025-03-28 cs.CV cs.AI 62%

FineCIR: Explicit Parsing of Fine-Grained Modification Semantics for Composed Image Retrieval

Zixu Li, Zhiheng Fu, Yupeng Hu, Zhiwei Chen, Haokun Wen, Liqiang Nie

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19296 2025-03-26 cs.CV cs.MM 62%

Fine-grained Textual Inversion Network for Zero-Shot Composed Image Retrieval

Haoqiang Lin, Haokun Wen, Xuemeng Song, Meng Liu, Yupeng Hu, Liqiang Nie

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09387 2025-03-25 cs.CV cs.AI cs.LG 62%

RankCLIP: Ranking-Consistent Language-Image Pretraining

Yiming Zhang, Zhuokai Zhao, Zhaorun Chen, Zhili Feng, Zenghui Ding, Yining Sun

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Code and model checkpoints are available at https://github.com/Jam1ezhang/RankCLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17871 2025-03-25 cs.CV cs.AI 62%

good4cir: Generating Detailed Synthetic Captions for Composed Image Retrieval

Pranavi Kolouju, Eric Xing, Robert Pless, Nathan Jacobs, Abby Stylianou

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14733 2025-03-24 cs.LG cs.AI cs.CL 62%

Knowledge Graph Embeddings: A Comprehensive Survey on Capturing Relation Properties

Guanglin Niu

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 22 pages, 8 figures, 3 tables, this paper is a modified English version of our article already published in Computer Science journal (in Chinese), released to facilitate communication among international researchers in the relevant fields

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08722 2025-03-18 cs.CV cs.AI cs.LG 62%

A Recipe for Improving Remote Sensing VLM Zero Shot Generalization

Aviad Barzilai, Yotam Gigi, Amr Helmy, Vered Silverman, Yehonathan Refael, Bolous Jaber, Tomer Shekel, George Leifman, Genady Beryozkin

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04287 2025-03-07 cs.CV cs.AI 62%

MARS: Paying more attention to visual attributes for text-based person search

Alex Ergasti, Tomaso Fontanini, Claudio Ferrari, Massimo Bertozzi, Andrea Prati

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00793 2025-03-04 cs.CV cs.AI cs.RO 62%

Bridging Spectral-wise and Multi-spectral Depth Estimation via Geometry-guided Contrastive Learning

Ukcheol Shin, Kyunghyun Lee, Jean Oh

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted at ICRA 2025, Github link: https://github.com/UkcheolShin/BridgeMultiSpectralDepth

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00361 2025-03-04 cs.CV cs.AI 62%

Octopus: Alleviating Hallucination via Dynamic Contrastive Decoding

Wei Suo, Lijun Zhang, Mengyang Sun, Lin Yuanbo Wu, Peng Wang, Yanning Zhang

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16641 2025-02-25 cs.CV cs.CL cs.IR 62%

Retrieval-Augmented Visual Question Answering via Built-in Autoregressive Search Engines

Xinwei Long, Zhiyuan Ma, Ermo Hua, Kaiyan Zhang, Biqing Qi, Bowen Zhou

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments AAAI-25

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11301 2025-02-24 cs.CL cs.AI 62%

Question-to-Question Retrieval for Hallucination-Free Knowledge Access: An Approach for Wikipedia and Wikidata Question Answering

Santhosh Thottingal

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14113 2025-02-21 cs.CV cs.AI 62%

Object-centric Binding in Contrastive Language-Image Pretraining

Rim Assouel, Pietro Astolfi, Florian Bordes, Michal Drozdzal, Adriana Romero-Soriano

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10735 2025-02-11 cs.AI cs.CL 62%

Embedding Self-Correction as an Inherent Ability in Large Language Models for Enhanced Mathematical Reasoning

Kuofeng Gao, Huanqia Cai, Qingyao Shuai, Dihong Gong, Zhifeng Li

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06224 2025-02-07 cs.CV cs.AI 62%

Detection, Retrieval, and Explanation Unified: A Violence Detection System Based on Knowledge Graphs and GAT

Wen-Dong Jiang, Chih-Yung Chang, Diptendu Sinha Roy

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01549 2025-02-04 cs.IR cs.AI cs.CV 62%

VideoRAG: Retrieval-Augmented Generation with Extreme Long-Context Videos

Xubin Ren, Lingrui Xu, Long Xia, Shuaiqiang Wang, Dawei Yin, Chao Huang

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01056 2025-02-04 cs.CV cs.CL 62%

Mitigating Hallucinations in Large Vision-Language Models with Internal Fact-based Contrastive Decoding

Chao Wang, Xuancheng Zhou, Weiwei Fu, Yang Zhou

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11667 2025-02-04 cs.LG cs.AI cs.CV 62%

Dissecting Representation Misalignment in Contrastive Learning via Influence Function

Lijie Hu, Chenyang Ren, Huanyi Xie, Khouloud Saadi, Shu Yang, Zhen Tan, Jingfeng Zhang, Di Wang

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09827 2025-01-24 cs.CL cs.CV cs.DC cs.LG 62%

A Training-free Sub-quadratic Cost Transformer Model Serving Framework With Hierarchically Pruned Attention

Heejun Lee, Geon Park, Youngwan Lee, Jaduk Suh, Jina Kim, Wonyoung Jeong, Bumsik Kim, Hyemin Lee, Myeongjae Jeon, Sung Ju Hwang

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05128 2025-01-23 cs.CL cs.AI 62%

Enhancing textual textbook question answering with large language models and retrieval augmented generation

Hessa Abdulrahman Alawwad, Areej Alhothali, Usman Naseem, Ali Alkhathlan, Amani Jamal

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

Journal ref Pattern Recognition, Volume 162, 2025, Article 111332

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05238 2025-01-13 cs.CV cs.AI cs.LG 62%

FOCUS: Towards Universal Foreground Segmentation

Zuyao You, Lingyu Kong, Lingchen Meng, Zuxuan Wu

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02285 2025-01-08 cs.CV cs.AI 62%

Hyperbolic Contrastive Learning for Hierarchical 3D Point Cloud Embedding

Yingjie Liu, Pengyu Zhang, Ziyao He, Mingsong Chen, Xuan Tang, Xian Wei

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09472 2025-01-07 cs.SD cs.AI eess.AS 62%

DRCap: Decoding CLAP Latents with Retrieval-Augmented Generation for Zero-shot Audio Captioning

Xiquan Li, Wenxi Chen, Ziyang Ma, Xuenan Xu, Yuzhe Liang, Zhisheng Zheng, Qiuqiang Kong, Xie Chen

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05831 2024-12-24 cs.MM cs.SD eess.AS 62%

Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval

Shanti Stewart, Gouthaman KV, Lie Lu, Andrea Fanelli

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.MM、eess.AS

Comments Accepted at ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15262 2024-12-23 cs.CL cs.AI cs.IR 62%

Advanced ingestion process powered by LLM parsing for RAG system

Arnau Perez, Xavier Vizcaino

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14384 2024-12-20 cs.LG cs.AI cs.CV 62%

I0T: Embedding Standardization Method Towards Zero Modality Gap

Na Min An, Eunki Kim, James Thorne, Hyunjung Shim

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV、cs.AI

Comments 16 figures, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏