arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4672 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4672 篇

2012.07061 2020-12-15 cs.CV 57%

Improving Image Captioning by Leveraging Intra- and Inter-layer Global Representation in Transformer Network

Jiayi Ji, Yunpeng Luo, Xiaoshuai Sun, Fuhai Chen, Gen Luo, Yongjian Wu, Yue Gao, Rongrong Ji

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted at AAAI 2021 (preprint version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.04638 2020-12-09 cs.CV 57%

TAP: Text-Aware Pre-training for Text-VQA and Text-Caption

Zhengyuan Yang, Yijuan Lu, Jianfeng Wang, Xi Yin, Dinei Florencio, Lijuan Wang, Cha Zhang, Lei Zhang, Jiebo Luo

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.10966 2020-08-26 cs.CV 57%

In-Home Daily-Life Captioning Using Radio Signals

Lijie Fan, Tianhong Li, Yuan Yuan, Dina Katabi

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments ECCV 2020. The first two authors contributed equally to this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.11693 2020-08-13 cs.CV 57%

Dense-Captioning Events in Videos: SYSU Submission to ActivityNet Challenge 2020

Teng Wang, Huicheng Zheng, Mingjing Yu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Second-place solution to TASK 2 (Dense video captioning) in ActivityNet Challenge 2020. Code is available at https://github.com/ttengwang/dense-video-captioning-pytorch

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.03098 2020-07-21 cs.CV 57%

Connecting Vision and Language with Localized Narratives

Jordi Pont-Tuset, Jasper Uijlings, Soravit Changpinyo, Radu Soricut, Vittorio Ferrari

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments ECCV 2020 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.07883 2020-04-02 cs.CV 57%

Vision-Language Navigation with Self-Supervised Auxiliary Reasoning Tasks

Fengda Zhu, Yi Zhu, Xiaojun Chang, Xiaodan Liang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.14080 2020-04-01 cs.CV 57%

X-Linear Attention Networks for Image Captioning

Yingwei Pan, Ting Yao, Yehao Li, Tao Mei

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments CVPR 2020; The source code and model are publicly available at: https://github.com/Panda-Peter/image-captioning

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.09536 2020-02-25 cs.CV 57%

Image to Language Understanding: Captioning approach

Madhavan Seshadri, Malavika Srikanth, Mikhail Belov

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.08960 2019-12-20 cs.CL 57%

Going Beneath the Surface: Evaluating Image Captioning for Grammaticality, Truthfulness and Diversity

Huiyuan Xie, Tom Sherborne, Alexander Kuhnle, Ann Copestake

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.08360 2019-12-19 cs.CL 57%

DMRM: A Dual-channel Multi-hop Reasoning Model for Visual Dialog

Feilong Chen, Fandong Meng, Jiaming Xu, Peng Li, Bo Xu, Jie Zhou

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

Comments Accepted at AAAI 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.03083 2019-12-09 cs.CV 57%

Visual-Textual Association with Hardest and Semi-Hard Negative Pairs Mining for Person Search

Jing Ge, Guangyu Gao, Zhen Liu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.09796 2019-12-09 cs.CV 57%

A Novel Technique for Evidence based Conditional Inference in Deep Neural Networks via Latent Feature Perturbation

Dinesh Khandelwal, Suyash Agrawal, Parag Singla, Chetan Arora

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.11059 2019-12-05 cs.CV 57%

Unified Vision-Language Pre-Training for Image Captioning and VQA

Luowei Zhou, Hamid Palangi, Lei Zhang, Houdong Hu, Jason J. Corso, Jianfeng Gao

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments AAAI 2020 camera-ready version. The code and the pre-trained models are available at https://github.com/LuoweiZhou/VLP

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.06475 2019-10-16 cs.CV 57%

Exploring Overall Contextual Information for Image Captioning in Human-Like Cognitive Style

Hongwei Ge, Zehang Yan, Kai Zhang, Mingde Zhao, Liang Sun

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments ICCV 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.03609 2019-07-09 cs.CV 57%

Variational Context: Exploiting Visual and Textual Context for Grounding Referring Expressions

Yulei Niu, Hanwang Zhang, Zhiwu Lu, Shih-Fu Chang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted as regular paper in IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Substantial text overlap with arXiv:1712.01892

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.01892 2019-07-03 cs.CV 57%

Grounding Referring Expressions in Images by Variational Context

Hanwang Zhang, Yulei Niu, Shih-Fu Chang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments in 2018 Conference on Computer Vision and Pattern Recognition (CVPR'18)

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.06619 2019-06-18 cs.LG cs.CV stat.ML 57%

Generating Diverse and Informative Natural Language Fashion Feedback

Gil Sadeh, Lior Fritz, Gabi Shalev, Eduard Oks

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.06784 2019-05-17 cs.CV 57%

Harvesting Information from Captions for Weakly Supervised Semantic Segmentation

Johann Sawatzky, Debayan Banerjee, Juergen Gall

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.09544 2019-04-23 cs.CV 57%

3G structure for image caption generation

Aihong Yuan, Xuelong Li, Xiaoqiang Lu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments 35 pages, 7 figures, magazine

Journal ref Neurocomputing 330: 17-28 (2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.02755 2019-04-08 cs.CL 57%

ExCL: Extractive Clip Localization Using Natural Language Descriptions

Soham Ghosh, Anuva Agarwal, Zarana Parekh, Alexander Hauptmann

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CL

Comments Accepted at NAACL 2019, Short Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.06275 2019-03-18 cs.CV 57%

Show, Translate and Tell

Dheeraj Peri, Shagan Sah, Raymond Ptucha

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.06706 2019-01-23 cs.CV 57%

Visual Entailment: A Novel Task for Fine-Grained Image Understanding

Ning Xie, Farley Lai, Derek Doran, Asim Kadav

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.03570 2018-12-11 cs.CV 57%

Learning Style Compatibility for Furniture

Divyansh Aggarwal, Elchin Valiyev, Fadime Sener, Angela Yao

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments German Conference on Pattern Recognition(GCPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.03213 2018-12-11 cs.CV 57%

PIRC Net : Using Proposal Indexing, Relationships and Context for Phrase Grounding

Rama Kovvuri, Ram Nevatia

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted in ACCV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.06245 2018-10-16 cs.CL 57%

Bringing back simplicity and lightliness into neural image captioning

Jean-Benoit Delbrouck, Stéphane Dupont

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.08205 2018-07-24 cs.CV 57%

Equal But Not The Same: Understanding the Implicit Relationship Between Persuasive Images and Text

Mingda Zhang, Rebecca Hwa, Adriana Kovashka

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments To appear in BMVC2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.05526 2018-07-19 cs.CV 57%

Unpaired Image Captioning by Language Pivoting

Jiuxiang Gu, Shafiq Joty, Jianfei Cai, Gang Wang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 17 pages, 4 figures, Accepted at ECCV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.00545 2018-05-03 cs.CV 57%

Weakly Supervised Attention Learning for Textual Phrases Grounding

Zhiyuan Fang, Shu Kong, Tianshu Yu, Yezhou Yang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 4 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.06047 2017-11-17 cs.CV stat.ML 57%

Deep Matching Autoencoders

Tanmoy Mukherjee, Makoto Yamada, Timothy M. Hospedales

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1612.00234 2016-12-02 cs.CV 57%

Video Captioning with Multi-Faceted Attention

Xiang Long, Chuang Gan, Gerard de Melo

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏