arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6929 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6929 篇

2211.14648 2022-12-01 cs.RO cs.AI cs.LG 57%

Learning Visuo-Haptic Skewering Strategies for Robot-Assisted Feeding

Priya Sundaresan, Suneel Belkhale, Dorsa Sadigh

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.02982 2022-12-01 cs.CL 57%

Improving the Cross-Lingual Generalisation in Visual Question Answering

Farhad Nooralahzadeh, Rico Sennrich

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

Comments This work is accepted by the AAAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.08783 2022-11-17 eess.IV cs.CV cs.LG 57%

Uncertainty-Aware Multi-Parametric Magnetic Resonance Image Information Fusion for 3D Object Segmentation

Cheng Li, Yousuf Babiker M. Osman, Weijian Huang, Zhenzhen Xue, Hua Han, Hairong Zheng, Shanshan Wang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.08776 2022-11-17 cs.CV cs.IR 57%

An Efficient COarse-to-fiNE Alignment Framework @ Ego4D Natural Language Queries Challenge 2022

Zhijian Hou, Wanjun Zhong, Lei Ji, Difei Gao, Kun Yan, Wing-Kwong Chan, Chong-Wah Ngo, Zheng Shou, Nan Duan

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Technical report for ECCV 2022 Ego4D workshop, 4 pages, 2 figures, 2 tables. arXiv admin note: substantial text overlap with arXiv:2209.10918

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.03055 2022-11-16 cs.CV 57%

Learning Dual-Fused Modality-Aware Representations for RGBD Tracking

Shang Gao, Jinyu Yang, Zhe Li, Feng Zheng, Aleš Leonardis, Jingkuan Song

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.06925 2022-11-15 cs.CV cs.LG 57%

Early Diagnosis of Chronic Obstructive Pulmonary Disease from Chest X-Rays using Transfer Learning and Fusion Strategies

Ryan Wang, Li-Ching Chen, Lama Moukheiber, Mira Moukheiber, Dana Moukheiber, Zach Zaiman, Sulaiman Moukheiber, Tess Litchman, Kenneth Seastedt, Hari Trivedi, Rebecca Steinberg, Po-Chih Kuo, Judy Gichoya, Leo Anthony Celi

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.01664 2022-11-04 cs.CV 57%

PointSee: Image Enhances Point Cloud

Lipeng Gu, Xuefeng Yan, Peng Cui, Lina Gong, Haoran Xie, Fu Lee Wang, Jin Qin, Mingqiang Wei

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.17311 2022-11-01 cs.CV cs.LG 57%

Shared Manifold Learning Using a Triplet Network for Multiple Sensor Translation and Fusion with Missing Data

Aditya Dutt, Alina Zare, Paul Gader

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments 19 pages, 16 figures; Accepted to IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.00871 2022-10-28 cs.CV 57%

Dense Voxel Fusion for 3D Object Detection

Anas Mahmoud, Jordan S. K. Hu, Steven L. Waslander

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Accepted in WACV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.14530 2022-10-27 cs.CV 57%

RGB-T Semantic Segmentation with Location, Activation, and Sharpening

Gongyang Li, Yike Wang, Zhi Liu, Xinpeng Zhang, Dan Zeng

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments 12 pages, 7 figures, Accepted by IEEE Transactions on Circuits and Systems for Video Technology 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.10320 2022-10-20 cs.CL 57%

Learning from the Dictionary: Heterogeneous Knowledge Guided Fine-tuning for Chinese Spell Checking

Yinghui Li, Shirong Ma, Qingyu Zhou, Zhongli Li, Li Yangning, Shulin Huang, Ruiyang Liu, Chao Li, Yunbo Cao, Haitao Zheng

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

Comments Long paper, accepted at the Findings of EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.04397 2022-10-17 cs.CV 57%

2DPASS: 2D Priors Assisted Semantic Segmentation on LiDAR Point Clouds

Xu Yan, Jiantao Gao, Chaoda Zheng, Chao Zheng, Ruimao Zhang, Shenghui Cui, Zhen Li

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments ECCV2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.04892 2022-10-14 cs.LG cs.AI 57%

GRU-TV: Time- and velocity-aware GRU for patient representation on multivariate clinical time-series data

Ningtao Liu, Ruoxi Gao, Jing Yuan, Calire Park, Shuwei Xing, Shuiping Gou

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.04722 2022-10-11 cs.CV 57%

Semantics-Consistent Cross-domain Summarization via Optimal Transport Alignment

Jielin Qiu, Jiacheng Zhu, Mengdi Xu, Franck Dernoncourt, Trung Bui, Zhaowen Wang, Bo Li, Ding Zhao, Hailin Jin

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.01391 2022-10-05 cs.CV 57%

Bridged Transformer for Vision and Point Cloud 3D Object Detection

Yikai Wang, TengQi Ye, Lele Cao, Wenbing Huang, Fuchun Sun, Fengxiang He, Dacheng Tao

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.12412 2022-09-27 cs.LG cs.AI 57%

DEFT: Diverse Ensembles for Fast Transfer in Reinforcement Learning

Simeon Adebola, Satvik Sharma, Kaushik Shivakumar

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.09348 2022-09-21 cs.CV cs.LG 57%

Visible-Infrared Person Re-Identification Using Privileged Intermediate Information

Mahdi Alehdaghi, Arthur Josi, Rafael M. O. Cruz, Eric Granger

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.08516 2022-09-20 cs.CV cs.LG 57%

VisTaNet: Attention Guided Deep Fusion for Surface Roughness Classification

Prasanna Kumar Routray, Aditya Sanjiv Kanade, Jay Bhanushali, Manivannan Muniyandi

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.07419 2022-09-16 cs.CV 57%

FFPA-Net: Efficient Feature Fusion with Projection Awareness for 3D Object Detection

Chaokang Jiang, Guangming Wang, Jinxing Wu, Yanzi Miao, Hesheng Wang

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments 7 pages, 4 figures; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.02540 2022-09-13 cs.CV 57%

CAMO-MOT: Combined Appearance-Motion Optimization for 3D Multi-Object Tracking with Camera-LiDAR Fusion

Li Wang, Xinyu Zhang, Wenyuan Qin, Xiaoyu Li, Lei Yang, Zhiwei Li, Lei Zhu, Hong Wang, Jun Li, Huaping Liu

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Based on this work, we achieved 1st place on the nuScenes tracking leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.08608 2022-08-29 cs.CV 57%

See Finer, See More: Implicit Modality Alignment for Text-based Person Retrieval

Xiujun Shu, Wei Wen, Haoqian Wu, Keyu Chen, Yiran Song, Ruizhi Qiao, Bo Ren, Xiao Wang

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments Accepted at ECCV Workshop on Real-World Surveillance (RWS 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.14141 2022-08-25 cs.CV cs.LG 57%

Contrastive Learning Rivals Masked Image Modeling in Fine-tuning via Feature Distillation

Yixuan Wei, Han Hu, Zhenda Xie, Zheng Zhang, Yue Cao, Jianmin Bao, Dong Chen, Baining Guo

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

Comments https://github.com/SwinTransformer/Feature-Distillation

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.08338 2022-08-18 cs.CV 57%

SO(3)-Pose: SO(3)-Equivariance Learning for 6D Object Pose Estimation

Haoran Pan, Jun Zhou, Yuanpeng Liu, Xuequan Lu, Weiming Wang, Xuefeng Yan, Mingqiang Wei

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.11393 2022-08-16 cs.CV 57%

Cross Attention-guided Dense Network for Images Fusion

Zhengwen Shen, Jun Wang, Zaiyu Pan, Yulian Li, Jiangyu Wang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.02402 2022-08-08 cs.CL cs.LG 57%

Fusing Sentence Embeddings Into LSTM-based Autoregressive Language Models

Vilém Zouhar, Marius Mosbach, Dietrich Klakow

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

Comments Submitted to PBML. Code & experiment repository: https://github.com/zouharvi/sentence-embd-fusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.06793 2022-08-02 cs.AI 57%

How to Agree to Disagree: Managing Ontological Perspectives using Standpoint Logic

Lucía Gómez Álvarez, Sebastian Rudolph, Hannes Strass

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.12979 2022-08-02 cs.CV 57%

Is Geometry Enough for Matching in Visual Localization?

Qunjie Zhou, Sérgio Agostinho, Aljosa Osep, Laura Leal-Taixé

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments ECCV2022 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.01592 2022-08-02 cs.RO cs.CV 57%

Trajectory Prediction with Graph-based Dual-scale Context Fusion

Lu Zhang, Peiliang Li, Jing Chen, Shaojie Shen

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Accepted by IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2022. Code: https://github.com/HKUST-Aerial-Robotics/DSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.11312 2022-07-22 eess.AS 57%

Multitask Learning and Multistage Fusion for Dimensional Audiovisual Emotion Recognition

Bagus Tris Atmaja, Masato Akagi

专题命中 多模态训练与对齐 :multimodal(abstract);分类 eess.AS

Comments 3 figures, 3 tables, accepted at ICASSP 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.09685 2022-07-21 cs.CV 57%

BigColor: Colorization using a Generative Color Prior for Natural Images

Geonung Kim, Kyoungkook Kang, Seongtae Kim, Hwayoon Lee, Sehoon Kim, Jonghyun Kim, Seung-Hwan Baek, Sunghyun Cho

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏