arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6918 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6918 篇

2504.05795 2025-04-10 cs.CV 57%

Robust Fusion Controller: Degradation-aware Image Fusion with Fine-grained Language Instructions

Hao Zhang, Yanping Zha, Qingwei Zhuang, Zhenfeng Shao, Jiayi Ma

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05748 2025-04-09 cs.CV cs.HC 57%

When Less Is More: A Sparse Facial Motion Structure For Listening Motion Learning

Tri Tung Nguyen Nguyen, Quang Tien Dam, Dinh Tuan Tran, Joo-Ho Lee

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05583 2025-04-09 cs.CV 57%

Gaze-Guided Learning: Avoiding Shortcut Bias in Visual Classification

Jiahang Li, Shibo Xue, Yong Su

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments 10 pages, 5 figures, 3 tables, URL: https://szyyjl.github.io/eye_tracking_data.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03181 2025-04-08 cs.CV 57%

MIMRS: A Survey on Masked Image Modeling in Remote Sensing

Shabnam Choudhury, Akhil Vasim, Michael Schmitt, Biplab Banerjee

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03174 2025-04-07 cs.CL 57%

Multi-lingual Multi-turn Automated Red Teaming for LLMs

Abhishek Singhania, Christophe Dupuy, Shivam Mangale, Amani Namboori

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

Comments Accepted at TrustNLP@NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02318 2025-04-04 cs.CV cs.RO 57%

X-Capture: An Open-Source Portable Device for Multi-Sensory Learning

Samuel Clarke, Suzannah Wistreich, Yanjie Ze, Jiajun Wu

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Project page: https://xcapture.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01386 2025-04-03 cs.CV 57%

DALIP: Distribution Alignment-based Language-Image Pre-Training for Domain-Specific Data

Junjie Wu, Jiangtao Xie, Zhaolin Zhang, Qilong Wang, Qinghua Hu, Peihua Li, Sen Xu

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01017 2025-04-02 cs.CV 57%

Scaling Language-Free Visual Representation Learning

David Fan, Shengbang Tong, Jiachen Zhu, Koustuv Sinha, Zhuang Liu, Xinlei Chen, Michael Rabbat, Nicolas Ballas, Yann LeCun, Amir Bar, Saining Xie

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Project page at https://davidfan.io/webssl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16872 2025-04-02 cs.LG cs.CV 57%

Lie Detector: Unified Backdoor Detection via Cross-Examination Framework

Xuan Wang, Siyuan Liang, Dongping Liao, Han Fang, Aishan Liu, Xiaochun Cao, Yu-liang Lu, Ee-Chien Chang, Xitong Gao

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12191 2025-04-02 cs.LG cs.CV cs.RO 57%

AnyTouch: Learning Unified Static-Dynamic Representation across Multiple Visuo-tactile Sensors

Ruoxuan Feng, Jiangyu Hu, Wenke Xia, Tianci Gao, Ao Shen, Yuhao Sun, Bin Fang, Di Hu

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23844 2025-04-01 cs.CV 57%

FlexiMo: A Flexible Remote Sensing Foundation Model

Xuyang Li, Chenyu Li, Pedram Ghamisi, Danfeng Hong

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23234 2025-04-01 cs.CV 57%

Z-SASLM: Zero-Shot Style-Aligned SLI Blending Latent Manipulation

Alessio Borgi, Luca Maiano, Irene Amerini

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Accepted to the CVPR 2025 Workshop AI for Creative Visual Content Generation Editing and Understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23094 2025-04-01 cs.CV 57%

FRAME: Floor-aligned Representation for Avatar Motion from Egocentric Video

Andrea Boscolo Camiletto, Jian Wang, Eduardo Alvarado, Rishabh Dabral, Thabo Beeler, Marc Habermann, Christian Theobalt

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21187 2025-04-01 cs.CV 57%

DSU-Net:An Improved U-Net Model Based on DINOv2 and SAM2 with Multi-scale Cross-model Feature Enhancement

Yimin Xu, Fan Yang, Bin Xu

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02729 2025-04-01 cs.CV 57%

Can language-guided unsupervised adaptation improve medical image classification using unpaired images and texts?

Umaima Rahman, Raza Imam, Mohammad Yaqub, Boulbaba Ben Amor, Dwarikanath Mahapatra

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments Conference paper at International Symposium on Biomedical Imaging (ISBI) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20496 2025-03-27 cs.CL 57%

Enhancing Depression Detection via Question-wise Modality Fusion

Aishik Mandal, Dana Atzil-Slonim, Thamar Solorio, Iryna Gurevych

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

Comments 18 pages, 5 figures, The 10th Workshop on Computational Linguistics and Clinical Psychology

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16627 2025-03-27 cs.RO cs.AI cs.HC cs.LG 57%

Inference-Time Policy Steering through Human Interactions

Yanwei Wang, Lirui Wang, Yilun Du, Balakumar Sundaralingam, Xuning Yang, Yu-Wei Chao, Claudia Perez-D'Arpino, Dieter Fox, Julie Shah

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

Comments ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19642 2025-03-26 cs.CL 57%

Exploring Cultural Nuances in Emotion Perception Across 15 African Languages

Ibrahim Said Ahmad, Shiran Dudy, Tadesse Destaw Belay, Idris Abdulmumin, Seid Muhie Yimam, Shamsuddeen Hassan Muhammad, Kenneth Church

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19303 2025-03-26 cs.CV 57%

BIMII-Net: Brain-Inspired Multi-Iterative Interactive Network for RGB-T Road Scene Semantic Segmentation

Hanshuo Qiu, Jie Jiang, Ruoli Yang, Lixin Zhan, Jizhao Liu

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10308 2025-03-26 cs.CV 57%

TrafficLoc: Localizing Traffic Surveillance Cameras in 3D Scenes

Yan Xia, Yunxiang Lu, Rui Song, Oussema Dhaouadi, João F. Henriques, Daniel Cremers

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18883 2025-03-25 cs.CV eess.IV 57%

MotionMap: Representing Multimodality in Human Pose Forecasting

Reyhaneh Hosseininejad, Megh Shukla, Saeed Saadatnejad, Mathieu Salzmann, Alexandre Alahi

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments CVPR 2025. We propose a new representation for learning multimodality in human pose forecasting which does not depend on generative models

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03240 2025-03-25 cs.CV 57%

Task-driven Image Fusion with Learnable Fusion Loss

Haowen Bai, Jiangshe Zhang, Zixiang Zhao, Yichen Wu, Lilun Deng, Yukun Cui, Tao Feng, Shuang Xu

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18378 2025-03-25 cs.CV 57%

Exploring State Space Model in Wavelet Domain: An Infrared and Visible Image Fusion Network via Wavelet Transform and State Space Model

Tianpei Zhang, Yiming Zhu, Jufeng Zhao, Guangmang Cui, Yuchen Zheng

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13623 2025-03-25 cs.CV 57%

Unsupervised Foundation Model-Agnostic Slide-Level Representation Learning

Tim Lenz, Peter Neidlinger, Marta Ligero, Georg Wölflein, Marko van Treeck, Jakob Nikolas Kather

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Got accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01140 2025-03-25 cs.LG cs.AI cs.CR stat.ML 57%

Privacy-Preserving Federated Learning with Differentially Private Hyperdimensional Computing

Fardin Jalil Piran, Zhiling Chen, Mohsen Imani, Farhad Imani

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

Comments 31 Pages, 14 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02764 2025-03-25 cs.CV 57%

Fus-MAE: A cross-attention-based data fusion approach for Masked Autoencoders in remote sensing

Hugo Chan-To-Hing, Bharadwaj Veeravalli

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Journal ref IGARSS 2024-2024 IEEE International Geoscience and Remote Sensing Symposium. IEEE, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17106 2025-03-24 cs.CV cs.RO 57%

GAA-TSO: Geometry-Aware Assisted Depth Completion for Transparent and Specular Objects

Yizhe Liu, Tong Jia, Da Cai, Hao Wang, Dongyue Chen

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17002 2025-03-24 cs.RO cs.AI 57%

Targetless 6DoF Calibration of LiDAR and 2D Scanning Radar Based on Cylindrical Occupancy

Weimin Wang, Yu Du, Ting Yang, Yu Liu

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16945 2025-03-24 cs.CV 57%

PE-CLIP: A Parameter-Efficient Fine-Tuning of Vision Language Models for Dynamic Facial Expression Recognition

Ibtissam Saadi, Abdenour Hadid, Douglas W. Cunningham, Abdelmalik Taleb-Ahmed, Yassin El Hillali

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16660 2025-03-24 cs.CV 57%

When Less is Enough: Adaptive Token Reduction for Efficient Image Representation

Eduard Allakhverdov, Elizaveta Goncharova, Andrey Kuznetsov

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏