arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6903 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6903 篇

2205.11785 2022-05-25 cs.CV cs.AI 62%

AFNet-M: Adaptive Fusion Network with Masks for 2D+3D Facial Expression Recognition

Mingzhe Sui, Hanting Li, Zhaoqing Zhu, Feng Zhao

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 6 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.07124 2022-05-17 cs.CV cs.AI cs.LG 62%

Classification of Astronomical Bodies by Efficient Layer Fine-Tuning of Deep Neural Networks

Sabeesh Ethiraj, Bharath Kumar Bolla

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted at 5th Conference on Information and Communication Technology (CICT), 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.10904 2022-05-17 cs.CV cs.CL cs.LG 62%

SimVLM: Simple Visual Language Model Pretraining with Weak Supervision

Zirui Wang, Jiahui Yu, Adams Wei Yu, Zihang Dai, Yulia Tsvetkov, Yuan Cao

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Published at ICLR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.10939 2022-04-29 cs.CL cs.CV 62%

Unified Pretraining Framework for Document Understanding

Jiuxiang Gu, Jason Kuen, Vlad I. Morariu, Handong Zhao, Nikolaos Barmpalios, Rajiv Jain, Ani Nenkova, Tong Sun

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

Comments 12 pages, 4 figures, NeurIPS 2021 (Updated Camera Ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.00397 2022-04-28 cs.CV cs.AI cs.LG 62%

SeqDialN: Sequential Visual Dialog Networks in Joint Visual-Linguistic Representation Space

Liu Yang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

Comments This submission has been withdrawn by arXiv administrators due to an unresolvable authorship dispute

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.03109 2022-04-04 cs.CV cs.CL 62%

General Facial Representation Learning in a Visual-Linguistic Manner

Yinglin Zheng, Hao Yang, Ting Zhang, Jianmin Bao, Dongdong Chen, Yangyu Huang, Lu Yuan, Dong Chen, Ming Zeng, Fang Wen

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV、cs.CL

Comments CVPR2022 Oral; 16 pages, 6 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.08377 2022-04-01 cs.CV cs.AI cs.IR cs.LG 62%

Omnivore: A Single Model for Many Visual Modalities

Rohit Girdhar, Mannat Singh, Nikhila Ravi, Laurens van der Maaten, Armand Joulin, Ishan Misra

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted at CVPR 2022 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.15442 2022-03-30 cs.CV cs.MM 62%

Shifting More Attention to Visual Backbone: Query-modulated Refinement Networks for End-to-End Visual Grounding

Jiabo Ye, Junfeng Tian, Ming Yan, Xiaoshan Yang, Xuwu Wang, Ji Zhang, Liang He, Xin Lin

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.09510 2022-03-18 cs.CV cs.AI cs.LG cs.RO 62%

DetMatch: Two Teachers are Better Than One for Joint 2D and 3D Semi-Supervised Object Detection

Jinhyung Park, Chenfeng Xu, Yiyang Zhou, Masayoshi Tomizuka, Wei Zhan

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments https://github.com/Divadi/DetMatch

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.07511 2022-03-16 cs.CL cs.AI cs.CY cs.LG 62%

Contrastive Visual Semantic Pretraining Magnifies the Semantics of Natural Language Representations

Robert Wolfe, Aylin Caliskan

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

Comments To be published in ACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.06822 2022-03-15 cs.CV cs.CL cs.RO 62%

Grounding Commands for Autonomous Vehicles via Layer Fusion with Region-specific Dynamic Layer Attention

Hou Pong Chan, Mingxi Guo, Cheng-Zhong Xu

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Submitted to IROS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.04537 2022-03-10 cs.CV cs.AI 62%

Fast Road Segmentation via Uncertainty-aware Symmetric Network

Yicong Chang, Feng Xue, Fei Sheng, Wenteng Liang, Anlong Ming

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by ICRA 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.04006 2022-03-09 cs.CV cs.CL 62%

Visual-Language Navigation Pretraining via Prompt-based Environmental Self-exploration

Xiwen Liang, Fengda Zhu, Lingling Li, Hang Xu, Xiaodan Liang

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted by ACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.12949 2022-03-01 eess.SP cs.AI cs.CV cs.LG 62%

Multi-View Fusion Transformer for Sensor-Based Human Activity Recognition

Yimu Wang, Kun Yu, Yan Wang, Hui Xue

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.11095 2022-01-27 cs.CV cs.SD eess.AS 62%

Self-attention fusion for audiovisual emotion recognition with incomplete data

Kateryna Chumachenko, Alexandros Iosifidis, Moncef Gabbouj

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.09106 2021-12-17 cs.CV cs.AI cs.LG 62%

RegionCLIP: Region-based Language-Image Pretraining

Yiwu Zhong, Jianwei Yang, Pengchuan Zhang, Chunyuan Li, Noel Codella, Liunian Harold Li, Luowei Zhou, Xiyang Dai, Lu Yuan, Yin Li, Jianfeng Gao

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV、cs.AI

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.04453 2021-12-09 cs.CV cs.CL cs.LG 62%

MLP Architectures for Vision-and-Language Modeling: An Empirical Study

Yixin Nie, Linjie Li, Zhe Gan, Shuohang Wang, Chenguang Zhu, Michael Zeng, Zicheng Liu, Mohit Bansal, Lijuan Wang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.04983 2021-11-24 cs.LG cs.AI cs.CV cs.RO 62%

Driving Behavior Explanation with Multi-level Fusion

Hédi Ben-Younes, Éloi Zablocki, Patrick Pérez, Matthieu Cord

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted at NeurIPS Workshop ML4AD 2020

Journal ref Pattern Recognition, Volume 123, March 2022, 108421

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.08896 2021-11-22 cs.CL cs.CV 62%

Achieving Human Parity on Visual Question Answering

Ming Yan, Haiyang Xu, Chenliang Li, Junfeng Tian, Bin Bi, Wei Wang, Weihua Chen, Xianzhe Xu, Fan Wang, Zheng Cao, Zhicheng Zhang, Qiyu Zhang, Ji Zhang, Songfang Huang, Fei Huang, Luo Si, Rong Jin

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.10152 2021-11-10 eess.SP cs.AI cs.LG cs.MM 62%

Emotion Recognition from Multiple Modalities: Fundamentals and Methodologies

Sicheng Zhao, Guoli Jia, Jufeng Yang, Guiguang Ding, Kurt Keutzer

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI、cs.MM

Comments Accepted by IEEE Signal Processing Magazine (SPM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.09302 2021-10-19 cs.LG cs.AI cs.CV eess.IV 62%

A Prior Guided Adversarial Representation Learning and Hypergraph Perceptual Network for Predicting Abnormal Connections of Alzheimer's Disease

Qiankun Zuo, Baiying Lei, Shuqiang Wang, Yong Liu, Bingchuan Wang, Yanyan Shen

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.11778 2021-09-27 cs.CV cs.CL 62%

Dense Contrastive Visual-Linguistic Pretraining

Lei Shi, Kai Shuang, Shijie Geng, Peng Gao, Zuohui Fu, Gerard de Melo, Yunpeng Chen, Sen Su

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted by ACM Multimedia 2021. arXiv admin note: text overlap with arXiv:2007.13135

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.07149 2021-09-16 cs.MM cs.AI cs.LG cs.SD 62%

Fusion with Hierarchical Graphs for Mulitmodal Emotion Recognition

Shuyun Tang, Zhaojie Luo, Guoshun Nan, Yuichiro Yoshikawa, Ishiguro Hiroshi

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.05433 2021-09-14 cs.CV cs.CL 62%

Are Gender-Neutral Queries Really Gender-Neutral? Mitigating Gender Bias in Image Search

Jialu Wang, Yang Liu, Xin Eric Wang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

Comments 14 pages, EMNLP 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.04422 2021-09-10 cs.CV cs.CL 62%

TxT: Crossmodal End-to-End Learning with Transformers

Jan-Martin O. Steitz, Jonas Pfeiffer, Iryna Gurevych, Stefan Roth

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

Comments To appear at the 43rd DAGM German Conference on Pattern Recognition (GCPR) 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.02040 2021-09-07 cs.CL cs.CV cs.LG 62%

Data Efficient Masked Language Modeling for Vision and Language

Yonatan Bitton, Gabriel Stanovsky, Michael Elhadad, Roy Schwartz

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted to Findings of EMNLP 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.12375 2021-08-30 cs.CV cs.AI cs.LG cs.RO 62%

A Pedestrian Detection and Tracking Framework for Autonomous Cars: Efficient Fusion of Camera and LiDAR Data

Muhammad Mobaidul Islam, Abdullah Al Redwan Newaz, Ali Karimoddini

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.06453 2021-08-26 cs.CV cs.AI 62%

Episodic Transformer for Vision-and-Language Navigation

Alexander Pashevich, Cordelia Schmid, Chen Sun

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

Comments ICCV 2021; 19 pages; Code available at https://github.com/alexpashevich/E.T

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.09980 2021-08-24 cs.CV cs.AI cs.LG 62%

TACo: Token-aware Cascade Contrastive Learning for Video-Text Alignment

Jianwei Yang, Yonatan Bisk, Jianfeng Gao

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by ICCV 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.03704 2021-08-10 cs.CV cs.AI 62%

OVIS: Open-Vocabulary Visual Instance Search via Visual-Semantic Aligned Representation Learning

Sheng Liu, Kevin Lin, Lijuan Wang, Junsong Yuan, Zicheng Liu

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏