arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6918 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6918 篇

2407.00959 2024-07-02 cs.AI cs.RO 57%

Tokenize the World into Object-level Knowledge to Address Long-tail Events in Autonomous Driving

Ran Tian, Boyi Li, Xinshuo Weng, Yuxiao Chen, Edward Schmerling, Yue Wang, Boris Ivanovic, Marco Pavone

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00935 2024-07-02 cs.LG cs.CL 57%

Look Ahead or Look Around? A Theoretical Comparison Between Autoregressive and Masked Pretraining

Qi Zhang, Tianqi Du, Haotian Huang, Yifei Wang, Yisen Wang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19379 2024-07-02 cs.CV cs.RO 57%

SemanticFormer: Holistic and Semantic Traffic Scene Representation for Trajectory Prediction using Knowledge Graphs

Zhigang Sun, Zixu Wang, Lavdim Halilaj, Juergen Luettin

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments 8 pages, 7 figures, has been accepted for publication in the IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18864 2024-06-28 cs.CV 57%

Learning Modality Knowledge Alignment for Cross-Modality Transfer

Wenxuan Ma, Shuang Li, Lincan Cai, Jingxuan Kang

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15785 2024-06-28 cs.CV 57%

BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning

Ruyang Liu, Chen Li, Yixiao Ge, Ying Shan, Thomas H. Li, Ge Li

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17838 2024-06-27 cs.LG cs.AI cs.HC 57%

InFiConD: Interactive No-code Fine-tuning with Concept-based Knowledge Distillation

Jinbin Huang, Wenbin He, Liang Gou, Liu Ren, Chris Bryan

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17319 2024-06-26 cs.CV 57%

DMF-Net: Image-Guided Point Cloud Completion with Dual-Channel Modality Fusion and Shape-Aware Upsampling Transformer

Aihua Mao, Yuxuan Tang, Jiangtao Huang, Ying He

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13498 2024-06-21 cs.CV 57%

Semantic Enhanced Few-shot Object Detection

Zheng Wang, Yingjie Gao, Qingjie Liu, Yunhong Wang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Accepted by ICIP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12756 2024-06-19 cs.LG cs.CV 57%

GFM4MPM: Towards Geospatial Foundation Models for Mineral Prospectivity Mapping

Angel Daruna, Vasily Zadorozhnyy, Georgina Lukoczki, Han-Pang Chiu

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments 12 pages, 16 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11249 2024-06-18 cs.AI cs.LG 57%

Relational Learning in Pre-Trained Models: A Theory from Hypergraph Recovery Perspective

Yang Chen, Cong Fang, Zhouchen Lin, Bing Liu

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10581 2024-06-18 cs.CV 57%

CrossFuse: A Novel Cross Attention Mechanism based Infrared and Visible Image Fusion Approach

Hui Li, Xiao-Jun Wu

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments 11 pages, 16 fuigures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17053 2024-06-18 cs.NI cs.AI cs.LG 57%

WirelessLLM: Empowering Large Language Models Towards Wireless Intelligence

Jiawei Shao, Jingwen Tong, Qiong Wu, Wei Guo, Zijian Li, Zehong Lin, Jun Zhang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08634 2024-06-14 eess.IV cs.CV cs.LG 57%

Unveiling Incomplete Modality Brain Tumor Segmentation: Leveraging Masked Predicted Auto-Encoder and Divergence Learning

Zhongao Sun, Jiameng Li, Yuhan Wang, Jiarong Cheng, Qing Zhou, Chun Li

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06361 2024-06-14 cs.CV cs.HC 57%

See Through Their Minds: Learning Transferable Neural Representation from Cross-Subject fMRI

Yulong Liu, Yongqiang Ma, Guibo Zhu, Haodong Jing, Nanning Zheng

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments A versatile brain decoding method learning from cross-subject fMRI data

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20764 2024-06-13 cs.CV 57%

CoMoFusion: Fast and High-quality Fusion of Infrared and Visible Image with Consistency Model

Zhiming Meng, Hui Li, Zeyang Zhang, Zhongwei Shen, Yunlong Yu, Xiaoning Song, Xiaojun Wu

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07485 2024-06-13 cs.SD eess.AS 57%

MINT: Boosting Audio-Language Model via Multi-Target Pre-Training and Instruction Tuning

Hang Zhao, Yifei Xin, Zhesong Yu, Bilei Zhu, Lu Lu, Zejun Ma

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04342 2024-06-07 cs.CV 57%

Learning 1D Causal Visual Representation with De-focus Attention Networks

Chenxin Tao, Xizhou Zhu, Shiqian Su, Lewei Lu, Changyao Tian, Xuan Luo, Gao Huang, Hongsheng Li, Yu Qiao, Jie Zhou, Jifeng Dai

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02395 2024-06-05 cs.LG cs.CV 57%

GrootVL: Tree Topology is All You Need in State Space Model

Yicheng Xiao, Lin Song, Shaoli Huang, Jiangshan Wang, Siyu Song, Yixiao Ge, Xiu Li, Ying Shan

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments The code is available at https://github.com/EasonXiao-888/GrootVL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02177 2024-06-05 cs.LG cs.AI cs.DC stat.ML 57%

One-Shot Federated Learning with Bayesian Pseudocoresets

Tim d'Hondt, Mykola Pechenizkiy, Robert Peharz

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19620 2024-06-03 cs.CV 57%

SparseDrive: End-to-End Autonomous Driving via Sparse Scene Representation

Wenchao Sun, Xuewu Lin, Yining Shi, Chuang Zhang, Haoran Wu, Sifa Zheng

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18945 2024-05-30 cs.CV cs.LG 57%

WTTFNet: A Weather-Time-Trajectory Fusion Network for Pedestrian Trajectory Prediction in Urban Complex

Ho Chun Wu, Esther Hoi Shan Lau, Paul Yuen, Kevin Hung, John Kwok Tai Chui, Andrew Kwok Fai Lui

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18831 2024-05-30 cs.CV cs.LG 57%

Evaluating Zero-Shot GPT-4V Performance on 3D Visual Question Answering Benchmarks

Simranjit Singh, Georgios Pavlakos, Dimitrios Stamoulis

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Accepted at 1st Workshop on Multimodalities for 3D Scenes CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18511 2024-05-30 cs.CV 57%

Feasibility and benefits of joint learning from MRI databases with different brain diseases and modalities for segmentation

Wentian Xu, Matthew Moffat, Thalia Seale, Ziyun Liang, Felix Wagner, Daniel Whitehouse, David Menon, Virginia Newcombe, Natalie Voets, Abhirup Banerjee, Konstantinos Kamnitsas

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Accepted to MIDL 2024

Journal ref Proceedings of Machine Learning Research, MIDL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18253 2024-05-29 cs.CV cs.LG 57%

Efficient Remote Sensing with Harmonized Transfer Learning and Modality Alignment

Tengjun Huang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Accepted by the Twelfth International Conference on Learning Representations (ICLR) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06773 2024-05-28 cs.CV 57%

Adapting LLaMA Decoder to Vision Transformer

Jiahao Wang, Wenqi Shao, Mengzhao Chen, Chengyue Wu, Yong Liu, Taiqiang Wu, Kaipeng Zhang, Songyang Zhang, Kai Chen, Ping Luo

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15783 2024-05-28 cs.IR cs.AI 57%

Multimodality Invariant Learning for Multimedia-Based New Item Recommendation

Haoyue Bai, Le Wu, Min Hou, Miaomiao Cai, Zhuangzhuang He, Yuyang Zhou, Richang Hong, Meng Wang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15442 2024-05-27 eess.IV cs.CV cs.LG 57%

Towards Precision Healthcare: Robust Fusion of Time Series and Image Data

Ali Rasekh, Reza Heidari, Amir Hosein Haji Mohammad Rezaie, Parsa Sharifi Sedeh, Zahra Ahmadi, Prasenjit Mitra, Wolfgang Nejdl

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14780 2024-05-27 cs.CV 57%

ContextualFusion: Context-Based Multi-Sensor Fusion for 3D Object Detection in Adverse Operating Conditions

Shounak Sural, Nishad Sahu, Ragunathan Rajkumar

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14788 2024-05-24 cs.CV 57%

Masked Image Modelling for retinal OCT understanding

Theodoros Pissas, Pablo Márquez-Neila, Sebastian Wolf, Martin Zinkernagel, Raphael Sznitman

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14203 2024-05-24 cs.LG cs.AI physics.chem-ph 57%

GLaD: Synergizing Molecular Graphs and Language Descriptors for Enhanced Power Conversion Efficiency Prediction in Organic Photovoltaic Devices

Thao Nguyen, Tiara Torres-Flores, Changhyun Hwang, Carl Edwards, Ying Diao, Heng Ji

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

Comments In progress

详情

展开后加载摘要…

URL PDF HTML 收藏