arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3496 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3496 篇

2405.04771 2024-05-09 cs.CV 57%

Exploring Vision Transformers for 3D Human Motion-Language Models with Motion Patches

Qing Yu, Mikihiro Tanaka, Kent Fujiwara

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

Comments Accepted to CVPR 2024, Project website: https://yu1ut.com/MotionPatches-HP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18836 2024-04-25 cs.CV 57%

ChatPose: Chatting about 3D Human Pose

Yao Feng, Jing Lin, Sai Kumar Dwivedi, Yu Sun, Priyanka Patel, Michael J. Black

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Comments Home page: https://yfeng95.github.io/ChatPose/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10795 2024-04-18 cs.SI cs.AI cs.CY cs.IR 57%

Intelligent Message Behavioral Identification System

Yuvaraju Chinnam, Bosubabu Sambana

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07993 2024-04-12 cs.CV 57%

Connecting NeRFs, Images, and Text

Francesco Ballerini, Pierluigi Zama Ramirez, Roberto Mirabella, Samuele Salti, Luigi Di Stefano

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Comments Accepted at CVPRW-INRV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15288 2024-04-09 cs.CV stat.ML 57%

Understanding normalization in contrastive representation learning and out-of-distribution detection

Tai Le-Gia, Jaehyun Ahn

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04667 2024-04-09 cs.AI q-bio.TO 57%

Autonomous Artificial Intelligence Agents for Clinical Decision Making in Oncology

Dyke Ferber, Omar S. M. El Nahhas, Georg Wölflein, Isabella C. Wiest, Jan Clusmann, Marie-Elisabeth Leßman, Sebastian Foersch, Jacqueline Lammert, Maximilian Tschochohei, Dirk Jäger, Manuel Salto-Tellez, Nikolaus Schultz, Daniel Truhn, Jakob Nikolas Kather

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

Comments 91 pages, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00262 2024-04-02 cs.CV 57%

Image-to-Image Matching via Foundation Models: A New Perspective for Open-Vocabulary Semantic Segmentation

Yuan Wang, Rui Sun, Naisong Luo, Yuwen Pan, Tianzhu Zhang

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

Comments Accepted to CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18178 2024-03-28 cs.RO cs.CV 57%

Online Embedding Multi-Scale CLIP Features into 3D Maps

Shun Taguchi, Hideki Deguchi

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01629 2024-03-28 cs.CV 57%

CLAMP: Contrastive LAnguage Model Prompt-tuning

Piotr Teterwak, Ximeng Sun, Bryan A. Plummer, Kate Saenko, Ser-Nam Lim

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11708 2024-03-27 cs.CV 57%

Implicit Discriminative Knowledge Learning for Visible-Infrared Person Re-Identification

Kaijie Ren, Lei Zhang

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16005 2024-03-26 cs.CV 57%

Knowledge-Enhanced Dual-stream Zero-shot Composed Image Retrieval

Yucheng Suo, Fan Ma, Linchao Zhu, Yi Yang

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08924 2024-03-26 cs.CV 57%

Training-free Zero-shot Composed Image Retrieval with Local Concept Reranking

Shitong Sun, Fanghua Ye, Shaogang Gong

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12053 2024-03-21 cs.MM 57%

PiGW: A Plug-in Generative Watermarking Framework

Rui Ma, Mengxi Guo, Li Yuming, Hengyuan Zhang, Cong Ma, Yuan Li, Xiaodong Xie, Shanghang Zhang

专题命中 跨模态检索 :multimodal(abstract);分类 cs.MM

Comments Improve experimental content

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12747 2024-03-20 cs.CV 57%

N-Modal Contrastive Losses with Applications to Social Media Data in Trimodal Space

William Theisen, Walter Scheirer

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02628 2024-03-20 cs.CV cs.LG 57%

Interactive Continual Learning: Fast and Slow Thinking

Biqing Qi, Xingquan Chen, Junqi Gao, Dong Li, Jianxing Liu, Ligang Wu, Bowen Zhou

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Comments Accepted to CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04183 2024-03-08 cs.CV 57%

YYDS: Visible-Infrared Person Re-Identification with Coarse Descriptions

Yunhao Du, Zhicheng Zhao, Fei Su

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05203 2024-03-06 cs.CL 57%

From Artificially Real to Real: Leveraging Pseudo Data from Large Language Models for Low-Resource Molecule Discovery

Yuhan Chen, Nuwa Xi, Yanrui Du, Haochun Wang, Jianyu Chen, Sendong Zhao, Bing Qin

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CL

Comments AAAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.08229 2024-03-04 cs.CR cs.CV cs.LG 57%

CorruptEncoder: Data Poisoning based Backdoor Attacks to Contrastive Learning

Jinghuai Zhang, Hongbin Liu, Jinyuan Jia, Neil Zhenqiang Gong

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.19014 2024-03-01 cs.CV 57%

Enhancing Visual Document Understanding with Contrastive Learning in Large Visual-Language Models

Xin Li, Yunfei Wu, Xinghua Jiang, Zhihao Guo, Mingming Gong, Haoyu Cao, Yinsong Liu, Deqiang Jiang, Xing Sun

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09291 2024-02-27 cs.CV 57%

Vision-by-Language for Training-Free Compositional Image Retrieval

Shyamgopal Karthik, Karsten Roth, Massimiliano Mancini, Zeynep Akata

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16350 2024-02-27 cs.CV 57%

Impression-CLIP: Contrastive Shape-Impression Embedding for Fonts

Yugo Kubota, Daichi Haraguchi, Seiichi Uchida

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.07843 2024-02-27 cs.CL 57%

Error-Robust Retrieval for Chinese Spelling Check

Xunjian Yin, Xinyu Hu, Jin Jiang, Xiaojun Wan

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10894 2024-02-19 cs.CV cs.LG 57%

Fusion of Diffusion Weighted MRI and Clinical Data for Predicting Functional Outcome after Acute Ischemic Stroke with Deep Contrastive Learning

Chia-Ling Tsai, Hui-Yun Su, Shen-Feng Sung, Wei-Yang Lin, Ying-Ying Su, Tzu-Hsien Yang, Man-Lin Mai

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Comments 12 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07418 2024-02-13 cs.AI 57%

SemTra: A Semantic Skill Translator for Cross-Domain Zero-Shot Policy Adaptation

Sangwoo Shin, Minjong Yoo, Jeongwoo Lee, Honguk Woo

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

Comments AAAI 2024 Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14826 2024-01-29 cs.SD cs.IR eess.AS 57%

Expressivity-aware Music Performance Retrieval using Mid-level Perceptual Features and Emotion Word Embeddings

Shreyan Chowdhury, Gerhard Widmer

专题命中 跨模态检索 :cross-modal(abstract);分类 eess.AS

Comments Presented at FIRE 2023 (Forum for Information Retrieval Evaluation) conference, Goa, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14148 2024-01-26 cs.CV 57%

LanDA: Language-Guided Multi-Source Domain Adaptation

Zhenbin Wang, Lei Zhang, Lituan Wang, Minjuan Zhu

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07207 2024-01-17 cs.CV 57%

Unsupervised Domain Adaptation Using Compact Internal Representations

Mohammad Rostami

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05628 2024-01-17 cs.CL cs.CE cs.CY 57%

Glitter or Gold? Deriving Structured Insights from Sustainability Reports via Large Language Models

Marco Bronzini, Carlo Nicolini, Bruno Lepri, Andrea Passerini, Jacopo Staiano

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04860 2024-01-11 cs.CV 57%

Modality-Aware Representation Learning for Zero-shot Sketch-based Image Retrieval

Eunyi Lyou, Doyeon Lee, Jooeun Kim, Joonseok Lee

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

Comments Accepted at WACV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01181 2024-01-03 cs.CV 57%

Query-Based Knowledge Sharing for Open-Vocabulary Multi-Label Classification

Xuelin Zhu, Jian Liu, Dongqi Tang, Jiawei Ge, Weijia Liu, Bo Liu, Jiuxin Cao

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏