arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6929 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6929 篇

2405.19620 2024-06-03 cs.CV 57%

SparseDrive: End-to-End Autonomous Driving via Sparse Scene Representation

Wenchao Sun, Xuewu Lin, Yining Shi, Chuang Zhang, Haoran Wu, Sifa Zheng

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18945 2024-05-30 cs.CV cs.LG 57%

WTTFNet: A Weather-Time-Trajectory Fusion Network for Pedestrian Trajectory Prediction in Urban Complex

Ho Chun Wu, Esther Hoi Shan Lau, Paul Yuen, Kevin Hung, John Kwok Tai Chui, Andrew Kwok Fai Lui

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18831 2024-05-30 cs.CV cs.LG 57%

Evaluating Zero-Shot GPT-4V Performance on 3D Visual Question Answering Benchmarks

Simranjit Singh, Georgios Pavlakos, Dimitrios Stamoulis

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Accepted at 1st Workshop on Multimodalities for 3D Scenes CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18511 2024-05-30 cs.CV 57%

Feasibility and benefits of joint learning from MRI databases with different brain diseases and modalities for segmentation

Wentian Xu, Matthew Moffat, Thalia Seale, Ziyun Liang, Felix Wagner, Daniel Whitehouse, David Menon, Virginia Newcombe, Natalie Voets, Abhirup Banerjee, Konstantinos Kamnitsas

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Accepted to MIDL 2024

Journal ref Proceedings of Machine Learning Research, MIDL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18253 2024-05-29 cs.CV cs.LG 57%

Efficient Remote Sensing with Harmonized Transfer Learning and Modality Alignment

Tengjun Huang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Accepted by the Twelfth International Conference on Learning Representations (ICLR) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06773 2024-05-28 cs.CV 57%

Adapting LLaMA Decoder to Vision Transformer

Jiahao Wang, Wenqi Shao, Mengzhao Chen, Chengyue Wu, Yong Liu, Taiqiang Wu, Kaipeng Zhang, Songyang Zhang, Kai Chen, Ping Luo

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15783 2024-05-28 cs.IR cs.AI 57%

Multimodality Invariant Learning for Multimedia-Based New Item Recommendation

Haoyue Bai, Le Wu, Min Hou, Miaomiao Cai, Zhuangzhuang He, Yuyang Zhou, Richang Hong, Meng Wang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15442 2024-05-27 eess.IV cs.CV cs.LG 57%

Towards Precision Healthcare: Robust Fusion of Time Series and Image Data

Ali Rasekh, Reza Heidari, Amir Hosein Haji Mohammad Rezaie, Parsa Sharifi Sedeh, Zahra Ahmadi, Prasenjit Mitra, Wolfgang Nejdl

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14780 2024-05-27 cs.CV 57%

ContextualFusion: Context-Based Multi-Sensor Fusion for 3D Object Detection in Adverse Operating Conditions

Shounak Sural, Nishad Sahu, Ragunathan Rajkumar

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14788 2024-05-24 cs.CV 57%

Masked Image Modelling for retinal OCT understanding

Theodoros Pissas, Pablo Márquez-Neila, Sebastian Wolf, Martin Zinkernagel, Raphael Sznitman

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14203 2024-05-24 cs.LG cs.AI physics.chem-ph 57%

GLaD: Synergizing Molecular Graphs and Language Descriptors for Enhanced Power Conversion Efficiency Prediction in Organic Photovoltaic Devices

Thao Nguyen, Tiara Torres-Flores, Changhyun Hwang, Carl Edwards, Ying Diao, Heng Ji

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

Comments In progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12850 2024-05-22 cs.CV 57%

Weakly supervised alignment and registration of MR-CT for cervical cancer radiotherapy

Jjahao Zhang, Yin Gu, Deyu Sun, Yuhua Gao, Ming Gao, Ming Cui, Teng Zhang, He Ma

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12781 2024-05-22 cs.CV cs.LG 57%

Self-Supervised Modality-Agnostic Pre-Training of Swin Transformers

Abhiroop Talasila, Maitreya Maity, U. Deva Priyakumar

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12318 2024-05-22 eess.IV cs.CV 57%

Hierarchical SegNet with Channel and Context Attention for Accurate Lung Segmentation in Chest X-ray Images

Mohammad Ali Labbaf Khaniki, Nazanin Mahjourian, Mohammad Manthouri

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11180 2024-05-21 cs.CV cs.HC 57%

GestFormer: Multiscale Wavelet Pooling Transformer Network for Dynamic Hand Gesture Recognition

Mallika Garg, Debashis Ghosh, Pyari Mohan Pradhan

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06663 2024-05-14 q-bio.BM cs.AI cs.LG 57%

Protein Representation Learning by Capturing Protein Sequence-Structure-Function Relationship

Eunji Ko, Seul Lee, Minseon Kim, Dongki Kim

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

Comments ICLR 2024 MLGenX Workshop (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04112 2024-05-14 cs.RO cs.CV 57%

Multi-Object Tracking with Camera-LiDAR Fusion for Autonomous Driving

Riccardo Pieroni, Simone Specchia, Matteo Corno, Sergio Matteo Savaresi

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Published at IEEE European Control Conference 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06536 2024-05-13 cs.CV 57%

Mesh Denoising Transformer

Wenbo Zhao, Xianming Liu, Deming Zhai, Junjun Jiang, Xiangyang Ji

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18193 2024-05-13 cs.CV 57%

Middle Fusion and Multi-Stage, Multi-Form Prompts for Robust RGB-T Tracking

Qiming Wang, Yongqiang Bai, Hongxing Song

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01517 2024-05-09 cs.CV 57%

MatchU: Matching Unseen Objects for 6D Pose Estimation from RGB-D Images

Junwen Huang, Hao Yu, Kuan-Ting Yu, Nassir Navab, Slobodan Ilic, Benjamin Busam

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04121 2024-05-08 cs.CV 57%

ELiTe: Efficient Image-to-LiDAR Knowledge Transfer for Semantic Segmentation

Zhibo Zhang, Ximing Yang, Weizhong Zhang, Cheng Jin

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments 9 pages, 6 figures, ICME 2024 oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02717 2024-05-07 cs.CV 57%

AFter: Attention-based Fusion Router for RGBT Tracking

Andong Lu, Wanyu Wang, Chenglong Li, Jin Tang, Bin Luo

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.12310 2024-04-30 cs.CV 57%

Fully Sparse Fusion for 3D Object Detection

Yingyan Li, Lue Fan, Yang Liu, Zehao Huang, Yuntao Chen, Naiyan Wang, Zhaoxiang Zhang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments TPMAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18892 2024-04-29 cs.CV cs.RO 57%

Aligning Knowledge Graph with Visual Perception for Object-goal Navigation

Nuo Xu, Wen Wang, Rong Yang, Mengjie Qin, Zheyuan Lin, Wei Song, Chunlong Zhang, Jason Gu, Chao Li

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Accepted to ICRA 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14326 2024-04-23 cs.LG cs.CV 57%

Machine Learning Techniques for MRI Data Processing at Expanding Scale

Taro Langner

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Book chapter pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13808 2024-04-23 cs.IR cs.LG cs.MM 57%

General Item Representation Learning for Cold-start Content Recommendations

Jooeun Kim, Jinri Kim, Kwangeun Yeo, Eungi Kim, Kyoung-Woon On, Jonghwan Mun, Joonseok Lee

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.MM

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12216 2024-04-23 cs.CV 57%

ProTA: Probabilistic Token Aggregation for Text-Video Retrieval

Han Fang, Xianghao Zang, Chao Ban, Zerun Feng, Lanxiang Zhou, Zhongjiang He, Yongxiang Li, Hao Sun

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11395 2024-04-23 cs.CV 57%

UniM-OV3D: Uni-Modality Open-Vocabulary 3D Scene Understanding with Fine-Grained Feature Representation

Qingdong He, Jinlong Peng, Zhengkai Jiang, Kai Wu, Xiaozhong Ji, Jiangning Zhang, Yabiao Wang, Chengjie Wang, Mingang Chen, Yunsheng Wu

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Accepted by IJCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11706 2024-04-19 cs.AI 57%

Pretraining Billion-scale Geospatial Foundational Models on Frontier

Aristeidis Tsaris, Philipe Ambrozio Dias, Abhishek Potnis, Junqi Yin, Feiyi Wang, Dalton Lunga

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11443 2024-04-17 cs.CV 57%

Equivariant Multi-Modality Image Fusion

Zixiang Zhao, Haowen Bai, Jiangshe Zhang, Yulun Zhang, Kai Zhang, Shuang Xu, Dongdong Chen, Radu Timofte, Luc Van Gool

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏