arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6929 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6929 篇

2310.10371 2023-10-17 cs.CV cs.RO 57%

Camera-LiDAR Fusion with Latent Contact for Place Recognition in Challenging Cross-Scenes

Yan Pan, Jiapeng Xie, Jiajie Wu, Bo Zhou

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.01523 2023-10-17 cs.LG cs.AI cs.CE 57%

Towards Unified AI Drug Discovery with Multiple Knowledge Modalities

Yizhen Luo, Xing Yi Liu, Kai Yang, Kui Huang, Massimo Hong, Jiahuan Zhang, Yushuai Wu, Zaiqing Nie

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06291 2023-10-11 eess.IV cs.CV physics.med-ph 57%

Three-Dimensional Medical Image Fusion with Deformable Cross-Attention

Lin Liu, Xinxin Fan, Chulong Zhang, Jingjing Dai, Yaoqin Xie, Xiaokun Liang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06008 2023-10-11 cs.CV 57%

CoBEVFusion: Cooperative Perception with LiDAR-Camera Bird's-Eye View Fusion

Donghao Qiao, Farhana Zulkernine

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05257 2023-10-10 cs.CV 57%

FusionFormer: A Multi-sensory Fusion in Bird's-Eye-View and Temporal Consistent Transformer for 3D Object Detection

Chunyong Hu, Hang Zheng, Kun Li, Jianyun Xu, Weibo Mao, Maochun Luo, Lingxuan Wang, Mingxia Chen, Qihao Peng, Kaixuan Liu, Yiru Zhao, Peihan Hao, Minzhe Liu, Kaicheng Yu

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01251 2023-10-03 cs.CV cs.LG 57%

Generating 3D Brain Tumor Regions in MRI using Vector-Quantization Generative Adversarial Networks

Meng Zhou, Matthias W Wagner, Uri Tabori, Cynthia Hawkins, Birgit B Ertl-Wagner, Farzad Khalvati

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Preprint, In Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01218 2023-10-03 cs.CV 57%

Making LLaMA SEE and Draw with SEED Tokenizer

Yuying Ge, Sijie Zhao, Ziyun Zeng, Yixiao Ge, Chen Li, Xintao Wang, Ying Shan

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Project released at: https://github.com/AILab-CVC/SEED. arXiv admin note: substantial text overlap with arXiv:2307.08041

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17102 2023-10-03 cs.CV 57%

GeoVLN: Learning Geometry-Enhanced Visual Representation with Slot Attention for Vision-and-Language Navigation

Jingyang Huo, Qiang Sun, Boyan Jiang, Haitao Lin, Yanwei Fu

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments Accepted by CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.14880 2023-09-28 cs.CV 57%

SGAligner : 3D Scene Alignment with Scene Graphs

Sayan Deb Sarkar, Ondrej Miksik, Marc Pollefeys, Daniel Barath, Iro Armeni

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Accepted at ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10158 2023-09-20 cs.CV 57%

Offline Detection of Misspelled Handwritten Words by Convolving Recognition Model Features with Text Labels

Andrey Totev, Tomas Ward

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.09592 2023-09-19 cs.CV 57%

Multi-Semantic Fusion Model for Generalized Zero-Shot Skeleton-Based Action Recognition

Ming-Zhe Li, Zhen Jia, Zhang Zhang, Zhanyu Ma, Liang Wang

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments Accepted by ICIG 2023 (The code has been released at https://github.com/EHZ9NIWI7/MSF-GZSSAR.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17297 2023-09-19 cs.CV cs.CR 57%

Understanding the Robustness of 3D Object Detection with Bird's-Eye-View Representations in Autonomous Driving

Zijian Zhu, Yichi Zhang, Hai Chen, Yinpeng Dong, Shu Zhao, Wenbo Ding, Jiachen Zhong, Shibao Zheng

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments 8 pages, CVPR2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.01283 2023-09-19 cs.CV 57%

Cross Modal Transformer: Towards Fast and Robust 3D Object Detection

Junjie Yan, Yingfei Liu, Jianjian Sun, Fan Jia, Shuailin Li, Tiancai Wang, Xiangyu Zhang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.07913 2023-09-15 cs.CV 57%

A Survivor in the Era of Large-Scale Pretraining: An Empirical Study of One-Stage Referring Expression Comprehension

Gen Luo, Yiyi Zhou, Jiamu Sun, Xiaoshuai Sun, Rongrong Ji

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05914 2023-09-13 cs.CV 57%

Medical Image Segmentation with Belief Function Theory and Deep Learning

Ling Huang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Ph.D. Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.02527 2023-09-07 cs.CV 57%

A skeletonization algorithm for gradient-based optimization

Martin J. Menten, Johannes C. Paetzold, Veronika A. Zimmer, Suprosanna Shit, Ivan Ezhov, Robbie Holland, Monika Probst, Julia A. Schnabel, Daniel Rueckert

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Accepted at ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.15609 2023-08-31 cs.LG cs.AI 57%

InstaTune: Instantaneous Neural Architecture Search During Fine-Tuning

Sharath Nittur Sridhar, Souvik Kundu, Sairam Sundaresan, Maciej Szankin, Anthony Sarah

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.14023 2023-08-29 cs.CV 57%

Domain-Specificity Inducing Transformers for Source-Free Domain Adaptation

Sunandini Sanyal, Ashish Ramayee Asokan, Suvaansh Bhambri, Akshay Kulkarni, Jogendra Nath Kundu, R. Venkatesh Babu

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments ICCV 2023. Project page: http://val.cds.iisc.ac.in/DSiT-SFDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.10859 2023-08-29 eess.IV cs.CV cs.LG 57%

SF2Former: Amyotrophic Lateral Sclerosis Identification From Multi-center MRI Data Using Spatial and Frequency Fusion Transformer

Rafsanjany Kushol, Collin C. Luk, Avyarthana Dey, Michael Benatar, Hannah Briemberg, Annie Dionne, Nicolas Dupré, Richard Frayne, Angela Genge, Summer Gibson, Simon J. Graham, Lawrence Korngut, Peter Seres, Robert C. Welsh, Alan Wilman, Lorne Zinman, Sanjay Kalra, Yee-Hong Yang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments 17 pages, 8 figures

Journal ref Computerized Medical Imaging and Graphics Volume 108, September 2023, 102279

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.10685 2023-08-23 cs.CV 57%

Pre-train, Adapt and Detect: Multi-Task Adapter Tuning for Camouflaged Object Detection

Yinghui Xing, Dexuan Kong, Shizhou Zhang, Geng Chen, Lingyan Ran, Peng Wang, Yanning Zhang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09629 2023-08-22 eess.IV cs.CV q-bio.NC 57%

Fusing Structural and Functional Connectivities using Disentangled VAE for Detecting MCI

Qiankun Zuo, Yanfei Zhu, Libin Lu, Zhi Yang, Yuhui Li, Ning Zhang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10172 2023-08-22 cs.CV 57%

VLN-PETL: Parameter-Efficient Transfer Learning for Vision-and-Language Navigation

Yanyuan Qiao, Zheng Yu, Qi Wu

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments Accepted by ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04912 2023-08-22 cs.CV 57%

Cross-view Semantic Alignment for Livestreaming Product Recognition

Wenjie Yang, Yiyi Chen, Yan Li, Yanhua Cheng, Xudong Liu, Quan Chen, Han Li

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Accepted to ICCV2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.05755 2023-08-21 cs.CV 57%

ALADIN-NST: Self-supervised disentangled representation learning of artistic style through Neural Style Transfer

Dan Ruta, Gemma Canet Tarres, Alexander Black, Andrew Gilbert, John Collomosse

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07504 2023-08-16 cs.CV 57%

ICAFusion: Iterative Cross-Attention Guided Feature Fusion for Multispectral Object Detection

Jifeng Shen, Yifei Chen, Yue Liu, Xin Zuo, Heng Fan, Wankou Yang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments submitted to Pattern Recognition Journal, minor revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08492 2023-08-15 cs.CV 57%

SVDFormer: Complementing Point Cloud via Self-view Augmentation and Self-structure Dual-generator

Zhe Zhu, Honghua Chen, Xing He, Weiming Wang, Jing Qin, Mingqiang Wei

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments Accepted by ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06024 2023-08-14 cs.CV 57%

Spatial-information Guided Adaptive Context-aware Network for Efficient RGB-D Semantic Segmentation

Yang Zhang, Chenyun Xiong, Junjie Liu, Xuhui Ye, Guodong Sun

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments Accepted by IEEE Sensors Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.15157 2023-08-14 cs.CV cs.LG 57%

HRFuser: A Multi-resolution Sensor Fusion Architecture for 2D Object Detection

Tim Broedermann, Christos Sakaridis, Dengxin Dai, Luc Van Gool

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments IEEE International Conference on Intelligent Transportation Systems (ITSC) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.05550 2023-08-11 cs.CV 57%

Cross-Domain Product Representation Learning for Rich-Content E-Commerce

Xuehan Bai, Yan Li, Yanhua Cheng, Wenjie Yang, Quan Chen, Han Li

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments ICCV23

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.05358 2023-08-11 cs.CV 57%

Fine-grained building roof instance segmentation based on domain adapted pretraining and composite dual-backbone

Guozhang Liu, Baochai Peng, Ting Liu, Pan Zhang, Mengke Yuan, Chaoran Lu, Ningning Cao, Sen Zhang, Simin Huang, Tao Wang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏