arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6929 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6929 篇

2304.14275 2023-04-28 cs.CL cs.LG 57%

What's in a Name? Evaluating Assembly-Part Semantic Knowledge in Language Models through User-Provided Names in CAD Files

Peter Meltzer, Joseph G. Lambourne, Daniele Grandi

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.13979 2023-04-28 cs.CV cs.RO 57%

Adaptive-Mask Fusion Network for Segmentation of Drivable Road and Negative Obstacle With Untrustworthy Features

Zhen Feng, Yuchao Feng, Yanning Guo, Yuxiang Sun

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments This paper has been accepted by 2023 IEEE Intelligent Vehicles Symposium (IV) (IEEE IV 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.12880 2023-04-28 cs.CV 57%

Center Feature Fusion: Selective Multi-Sensor Fusion of Center-based Objects

Philip Jacobson, Yiyang Zhou, Wei Zhan, Masayoshi Tomizuka, Ming C. Wu

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Accepted by ICRA 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.12269 2023-04-25 cs.CL 57%

Enriching Source Code with Contextual Data for Code Completion Models: An Empirical Study

Tim van Dam, Maliheh Izadi, Arie van Deursen

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

Comments 13 pages. To appear in the Proceedings of the 20th International Conference on Mining Software Repositories (MSR 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14778 2023-04-25 cs.CV 57%

RGBT Tracking via Progressive Fusion Transformer with Dynamically Guided Learning

Yabin Zhu, Chenglong Li, Xiao Wang, Jin Tang, Zhixiang Huang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Incorrect experimental setup on the LasHeR dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10994 2023-04-24 cs.CL 57%

Information Extraction from Documents: Question Answering vs Token Classification in real-world setups

Laurent Lam, Pirashanth Ratnamogan, Joël Tang, William Vanhuffel, Fabien Caspani

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.10642 2023-04-18 cs.CV 57%

FUTR3D: A Unified Sensor Fusion Framework for 3D Detection

Xuanyao Chen, Tianyuan Zhang, Yue Wang, Yilun Wang, Hang Zhao

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Journal ref CVPR 2023 workshop on autonomous driving

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.04514 2023-04-11 cs.CV 57%

DetCLIPv2: Scalable Open-Vocabulary Object Detection Pre-training via Word-Region Alignment

Lewei Yao, Jianhua Han, Xiaodan Liang, Dan Xu, Wei Zhang, Zhenguo Li, Hang Xu

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

Comments Accepted to CVPR2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.04179 2023-04-11 cs.CV 57%

Sparse Dense Fusion for 3D Object Detection

Yulu Gao, Chonghao Sima, Shaoshuai Shi, Shangzhe Di, Si Liu, Hongyang Li

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03542 2023-04-10 cs.CV 57%

Better "CMOS" Produces Clearer Images: Learning Space-Variant Blur Estimation for Blind Image Super-Resolution

Xuhai Chen, Jiangning Zhang, Chao Xu, Yabiao Wang, Chengjie Wang, Yong Liu

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments Accepted by CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.02906 2023-04-10 cs.CV 57%

MemeFier: Dual-stage Modality Fusion for Image Meme Classification

Christos Koutlis, Manos Schinas, Symeon Papadopoulos

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments 8 pages, 2 figures, ICMR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.15083 2023-03-28 cs.CV 57%

UniDistill: A Universal Cross-Modality Knowledge Distillation Framework for 3D Object Detection in Bird's-Eye View

Shengchao Zhou, Weizhou Liu, Chen Hu, Shuchang Zhou, Chao Ma

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12417 2023-03-28 cs.CV 57%

CLIP$^2$: Contrastive Language-Image-Point Pretraining from Real-World Point Cloud Data

Yihan Zeng, Chenhan Jiang, Jiageng Mao, Jianhua Han, Chaoqiang Ye, Qingqiu Huang, Dit-Yan Yeung, Zhen Yang, Xiaodan Liang, Hang Xu

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments To appear at CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13582 2023-03-27 cs.CV 57%

SCADE: NeRFs from Space Carving with Ambiguity-Aware Depth Estimates

Mikaela Angelina Uy, Ricardo Martin-Brualla, Leonidas Guibas, Ke Li

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.07888 2023-03-24 cs.CV cs.RO 57%

TwistSLAM++: Fusing multiple modalities for accurate dynamic semantic SLAM

Mathieu Gonzalez, Eric Marchand, Amine Kacete, Jérôme Royan

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09210 2023-03-17 cs.AI cs.HC 57%

A Dual Branch Network for Emotional Reaction Intensity Estimation

Jun Yu, Jichao Zhu, Wangyuan Zhu, Zhongpeng Cai, Guochen Xie, Renda Li, Gongpeng Zhao

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.00319 2023-03-02 cs.CV 57%

RIFT2: Speeding-up RIFT with A New Rotation-Invariance Technique

Jiayuan Li, Pengcheng Shi, Qingwu Hu, Yongjun Zhang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.11082 2023-02-23 cs.CV 57%

BB-GCN: A Bi-modal Bridged Graph Convolutional Network for Multi-label Chest X-Ray Recognition

Guoli Wang, Pingping Wang, Jinyu Cong, Kunmeng Liu, Benzheng Wei

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments under Computers in Biology and Medicine submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.07693 2023-02-17 cs.CV 57%

Fine-tuning of sign language recognition models: a technical report

Maxim Novopoltsev, Leonid Verkhovtsev, Ruslan Murtazin, Dmitriy Milevich, Iuliia Zemtsova

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.08534 2023-02-14 cs.CV 57%

Vision Transformer Adapter for Dense Predictions

Zhe Chen, Yuchen Duan, Wenhai Wang, Junjun He, Tong Lu, Jifeng Dai, Yu Qiao

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Accepted to ICLR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.17067 2023-02-14 cs.CV 57%

CADG: A Model Based on Cross Attention for Domain Generalization

Cheng Dai, Yingqiao Lin, Fan Li, Xiyao Li, Donglin Xie

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.02700 2023-02-08 cs.CV 57%

Language-aware Domain Generalization Network for Cross-Scene Hyperspectral Image Classification

Yuxiang Zhang, Mengmeng Zhang, Wei Li, Shuai Wang, Ran Tao

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:2209.01634

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.07301 2023-01-19 cs.CV cs.LG 57%

PTA-Det: Point Transformer Associating Point cloud and Image for 3D Object Detection

Rui Wan, Tianyun Zhao, Wei Zhao

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.13258 2022-12-29 cs.LG cs.AI cs.SY eess.SY 57%

Intelligent Feature Extraction, Data Fusion and Detection of Concrete Bridge Cracks: Current Development and Challenges

Di Wang, Simon X. Yang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

Comments Published at Intelligence & Robotics; Its copyright belongs to authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.11958 2022-12-23 cs.CV cs.NI 57%

Asymmetric Cross-Scale Alignment for Text-Based Person Search

Zhong Ji, Junhua Hu, Deyin Liu, Lin Yuanbo Wu, Ye zhao

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.07885 2022-12-21 cs.CV 57%

Clover: Towards A Unified Video-Language Alignment and Fusion Model

Jingjia Huang, Yinan Li, Jiashi Feng, Xinglong Wu, Xiaoshuai Sun, Rongrong Ji

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments Update Tri-modal Alignment task

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.04437 2022-12-20 cs.LG cs.AI q-bio.QM 57%

Multi-task Joint Strategies of Self-supervised Representation Learning on Biomedical Networks for Drug Discovery

Xiaoqi Wang, Yingjie Cheng, Yaning Yang, Yue Yu, Fei Li, Shaoliang Peng

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

Comments 44 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.08356 2022-12-13 cs.LG cs.AI cs.CY 57%

DouFu: A Double Fusion Joint Learning Method For Driving Trajectory Representation

Han Wang, Zhou Huang, Xiao Zhou, Ganmin Yin, Yi Bao, Yi Zhang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.01447 2022-12-06 cs.CV cs.LG 57%

Compound Tokens: Channel Fusion for Vision-Language Representation Learning

Maxwell Mbabilla Aladago, AJ Piergiovanni

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.16632 2022-12-01 cs.CV cs.LG 57%

Hierarchical Transformer for Survival Prediction Using Multimodality Whole Slide Images and Genomics

Chunyuan Li, Xinliang Zhu, Jiawen Yao, Junzhou Huang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments accepted by ICPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏