arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6903 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6903 篇

2405.14213 2024-08-27 cs.CV cs.CL 62%

From Text to Pixel: Advancing Long-Context Understanding in MLLMs

Yujie Lu, Xiujun Li, Tsu-Jui Fu, Miguel Eckstein, William Yang Wang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11742 2024-08-22 cs.CV cs.AI 62%

CluMo: Cluster-based Modality Fusion Prompt for Continual Learning in Visual Question Answering

Yuliang Cai, Mohammad Rostami

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10075 2024-08-20 cs.LG cs.AI cs.CL cs.RO 62%

Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning

Sriyash Poddar, Yanming Wan, Hamish Ivison, Abhishek Gupta, Natasha Jaques

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

Comments weirdlabuw.github.io/vpl

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07539 2024-08-15 cs.CV cs.AI 62%

Cross-aware Early Fusion with Stage-divided Vision and Language Transformer Encoders for Referring Image Segmentation

Yubin Cho, Hyunwoo Yu, Suk-ju Kang

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Published in IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05618 2024-08-13 cs.CV cs.AI 62%

UrFound: Towards Universal Retinal Foundation Models via Knowledge-Guided Masked Modeling

Kai Yu, Yang Zhou, Yang Bai, Zhi Da Soh, Xinxing Xu, Rick Siow Mong Goh, Ching-Yu Cheng, Yong Liu

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02859 2024-08-07 eess.IV cs.AI cs.CV 62%

Multistain Pretraining for Slide Representation Learning in Pathology

Guillaume Jaume, Anurag Vaidya, Andrew Zhang, Andrew H. Song, Richard J. Chen, Sharifa Sahai, Dandan Mo, Emilio Madrigal, Long Phi Le, Faisal Mahmood

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

Comments ECCV'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00620 2024-08-02 cs.CV cs.CL 62%

Are Bigger Encoders Always Better in Vision Large Models?

Bozhou Li, Hao Liang, Zimo Meng, Wentao Zhang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.11331 2024-08-02 cs.CV cs.CL 62%

EVA-02: A Visual Representation for Neon Genesis

Yuxin Fang, Quan Sun, Xinggang Wang, Tiejun Huang, Xinlong Wang, Yue Cao

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV、cs.CL

Comments v2: Fix some known issues & typos. v1: To Asuka. Code & Models: https://github.com/baaivision/EVA/tree/master/EVA-02

Journal ref Image and Vision Computing. Volume 149, September 2024, 105171

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21229 2024-08-01 cs.CV cs.CL 62%

Advancing Vietnamese Visual Question Answering with Transformer and Convolutional Integration

Ngoc Son Nguyen, Van Son Nguyen, Tung Le

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted at the journal of Computers & Electrical Engineering (Received 8 March 2024, Revised 8 June 2024, Accepted 10 July 2024)

Journal ref Computers and Electrical Engineering 119 (2024) 109474

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19714 2024-07-30 cs.CV cs.AI 62%

Rethinking RGB-D Fusion for Semantic Segmentation in Surgical Datasets

Muhammad Abdullah Jamal, Omid Mohareri

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01316 2024-07-30 cs.CV cs.AI 62%

Enhancing Inertial Hand based HAR through Joint Representation of Language, Pose and Synthetic IMUs

Vitor Fortes Rey, Lala Shakti Swarup Ray, Xia Qingxin, Kaishun Wu, Paul Lukowicz

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments ISWC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15130 2024-07-24 cs.CL cs.AI 62%

DOPRA: Decoding Over-accumulation Penalization and Re-allocation in Specific Weighting Layer

Jinfeng Wei, Xiaofeng Zhang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00161 2024-07-22 cs.CV cs.AI cs.LG 62%

Region-centric Image-Language Pretraining for Open-Vocabulary Detection

Dahun Kim, Anelia Angelova, Weicheng Kuo

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV、cs.AI

Comments ECCV 2024, project page at https://github.com/google-research/google-research/tree/master/fvlm/dito

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.12206 2024-07-22 cs.LG cs.AI cs.CV eess.IV stat.ML 62%

Understanding and Improving Transfer Learning of Deep Models via Neural Collapse

Xiao Li, Sheng Liu, Jinxin Zhou, Xinyu Lu, Carlos Fernandez-Granda, Zhihui Zhu, Qing Qu

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments First two authors contributed equally. Accepted at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13111 2024-07-19 cs.MM cs.CV 62%

PG-Attack: A Precision-Guided Adversarial Attack Framework Against Vision Foundation Models for Autonomous Driving

Jiyuan Fu, Zhaoyu Chen, Kaixun Jiang, Haijing Guo, Shuyong Gao, Wenqiang Zhang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments First-Place in the CVPR 2024 Workshop Challenge: Black-box Adversarial Attacks on Vision Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00126 2024-07-19 cs.CV cs.CL 62%

Common Sense Reasoning for Deepfake Detection

Yue Zhang, Ben Colman, Xiao Guo, Ali Shahriyari, Gaurav Bharaj

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10975 2024-07-17 cs.OH cs.AI cs.CL 62%

Stream State-tying for Sign Language Recognition

Jiyong Ma, Wen Gao, Chunli Wang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16346 2024-06-25 cs.CV cs.AI 62%

Directed Domain Fine-Tuning: Tailoring Separate Modalities for Specific Training Tasks

Daniel Wen, Nafisa Hussain

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08866 2024-06-14 cs.CV cs.AI 62%

Zoom and Shift are All You Need

Jiahao Qin

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06708 2024-06-12 q-bio.GN cs.AI cs.CL 62%

LangCell: Language-Cell Pre-training for Cell Identity Understanding

Suyuan Zhao, Jiahuan Zhang, Yushuai Wu, Yizhen Luo, Zaiqing Nie

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL、cs.AI

Comments Accpeted by ICML 2024, code released

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.08889 2024-06-10 cs.CV cs.AI 62%

Dissecting Multimodality in VideoQA Transformer Models by Impairing Modality Fusion

Ishaan Singh Rawal, Alexander Matyasko, Shantanu Jaiswal, Basura Fernando, Cheston Tan

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted at ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03721 2024-06-07 cs.CV cs.AI cs.IR 62%

Attribute-Aware Implicit Modality Alignment for Text Attribute Person Search

Xin Wang, Fangfang Liu, Zheng Li, Caili Guo

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04626 2024-06-03 eess.IV cs.CL cs.CV cs.LG 62%

MedFLIP: Medical Vision-and-Language Self-supervised Fast Pre-Training with Masked Autoencoder

Lei Li, Tianfang Zhang, Xinglin Zhang, Jiaqi Liu, Bingqi Ma, Yan Luo, Tao Chen

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19335 2024-05-30 cs.CV cs.CL cs.LG 62%

X-VILA: Cross-Modality Alignment for Large Language Model

Hanrong Ye, De-An Huang, Yao Lu, Zhiding Yu, Wei Ping, Andrew Tao, Jan Kautz, Song Han, Dan Xu, Pavlo Molchanov, Hongxu Yin

专题命中 多模态训练与对齐 :any-to-any(abstract);分类 cs.CV、cs.CL

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14195 2024-05-24 cs.CV cs.AI 62%

Enhanced Object Tracking by Self-Supervised Auxiliary Depth Estimation Learning

Zhenyu Wei, Yujie He, Zhanchuan Cai

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13581 2024-05-24 cs.CV cs.AI 62%

Safety Alignment for Vision Language Models

Zhendong Liu, Yuanbi Nie, Yingshui Tan, Xiangyu Yue, Qiushi Cui, Chongjun Wang, Xiaoyong Zhu, Bo Zheng

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 23 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08086 2024-05-22 cs.LG cs.CL cs.CV 62%

Text-centric Alignment for Multi-Modality Learning

Yun-Da Tsai, Ting-Yu Yen, Pei-Fu Guo, Zhe-Yan Li, Shou-De Lin

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11618 2024-05-21 cs.CV cs.AI 62%

Transcriptomics-guided Slide Representation Learning in Computational Pathology

Guillaume Jaume, Lukas Oldenburg, Anurag Vaidya, Richard J. Chen, Drew F. K. Williamson, Thomas Peeters, Andrew H. Song, Faisal Mahmood

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

Comments CVPR'24, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.15447 2024-05-07 cs.CL cs.AI cs.CR cs.LG 62%

Are aligned neural networks adversarially aligned?

Nicholas Carlini, Milad Nasr, Christopher A. Choquette-Choo, Matthew Jagielski, Irena Gao, Anas Awadalla, Pang Wei Koh, Daphne Ippolito, Katherine Lee, Florian Tramer, Ludwig Schmidt

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.12420 2024-05-07 cs.CL cs.AI 62%

LMFlow: An Extensible Toolkit for Finetuning and Inference of Large Foundation Models

Shizhe Diao, Rui Pan, Hanze Dong, Ka Shun Shum, Jipeng Zhang, Wei Xiong, Tong Zhang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

Comments Published in NAACL 2024 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏