arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6918 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6918 篇

2405.09818 2025-03-24 cs.CL 57%

Chameleon: Mixed-Modal Early-Fusion Foundation Models

Chameleon Team

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12369 2025-03-18 cs.CV 57%

L2COcc: Lightweight Camera-Centric Semantic Scene Completion via Distillation of LiDAR Model

Ruoyu Wang, Yukai Ma, Yi Yao, Sheng Tao, Haoang Li, Zongzhi Zhu, Yong Liu, Xingxing Zuo

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09025 2025-03-13 cs.CL 57%

Aligning to What? Limits to RLHF Based Alignment

Logan Barnhart, Reza Akbarian Bafghi, Stephen Becker, Maziar Raissi

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08529 2025-03-12 cs.CV 57%

SignRep: Enhancing Self-Supervised Sign Representations

Ryan Wong, Necati Cihan Camgoz, Richard Bowden

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08173 2025-03-12 cs.CV 57%

Towards All-in-One Medical Image Re-Identification

Yuan Tian, Kaiyuan Ji, Rongzhao Zhang, Yankai Jiang, Chunyi Li, Xiaosong Wang, Guangtao Zhai

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Accepted to CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06435 2025-03-11 cs.CV 57%

OV-SCAN: Semantically Consistent Alignment for Novel Object Discovery in Open-Vocabulary 3D Object Detection

Adrian Chow, Evelien Riddell, Yimu Wang, Sean Sedwards, Krzysztof Czarnecki

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19854 2025-03-11 cs.CV 57%

One Model for ALL: Low-Level Task Interaction Is a Key to Task-Agnostic Image Fusion

Chunyang Cheng, Tianyang Xu, Zhenhua Feng, Xiaojun Wu, ZhangyongTang, Hui Li, Zeyang Zhang, Sara Atito, Muhammad Awais, Josef Kittler

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Accepted by CVPR 2025 v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05966 2025-03-11 cs.LG cs.AI 57%

FLOPS: Forward Learning with OPtimal Sampling

Tao Ren, Zishi Zhang, Jinyang Jiang, Guanghao Li, Zeliang Zhang, Mingqian Feng, Yijie Peng

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

Comments Published in the Thirteenth International Conference on Learning Representations(ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16512 2025-03-11 cs.CV 57%

TIPS: Text-Image Pretraining with Spatial awareness

Kevis-Kokitsi Maninis, Kaifeng Chen, Soham Ghosh, Arjun Karpur, Koert Chen, Ye Xia, Bingyi Cao, Daniel Salz, Guangxing Han, Jan Dlabal, Dan Gnanapragasam, Mojtaba Seyedhosseini, Howard Zhou, Andre Araujo

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

Comments ICLR2025 camera-ready + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19225 2025-03-10 cs.CV eess.IV 57%

Completion as Enhancement: A Degradation-Aware Selective Image Guided Network for Depth Completion

Zhiqiang Yan, Zhengxue Wang, Kun Wang, Jun Li, Jian Yang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04478 2025-03-07 cs.CV 57%

Semantic Alignment of Unimodal Medical Text and Vision Representations

Maxime Di Folco, Emily Chan, Marta Hasny, Cosmin I. Bercea, Julia A. Schnabel

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04205 2025-03-07 cs.CV 57%

Learning 3D Medical Image Models From Brain Functional Connectivity Network Supervision For Mental Disorder Diagnosis

Xingcan Hu, Wei Wang, Li Xiao

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04135 2025-03-07 cs.CL 57%

Biological Sequence with Language Model Prompting: A Survey

Jiyue Jiang, Zikang Wang, Yuheng Shan, Heyan Chai, Jiayi Li, Zixian Ma, Xinrui Zhang, Yu Li

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03190 2025-03-07 cs.CV 57%

DSPNet: Dual-vision Scene Perception for Robust 3D Question Answering

Jingzhou Luo, Yang Liu, Weixing Chen, Zhen Li, Yaowei Wang, Guanbin Li, Liang Lin

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10038 2025-03-05 cs.AI 57%

POI-Enhancer: An LLM-based Semantic Enhancement Framework for POI Representation Learning

Jiawei Cheng, Jingyuan Wang, Yichuan Zhang, Jiahao Ji, Yuanshao Zhu, Zhibo Zhang, Xiangyu Zhao

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

Comments AAAI 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01785 2025-03-04 cs.CV 57%

Visual-RFT: Visual Reinforcement Fine-Tuning

Ziyu Liu, Zeyi Sun, Yuhang Zang, Xiaoyi Dong, Yuhang Cao, Haodong Duan, Dahua Lin, Jiaqi Wang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments project page: https://github.com/Liuziyu77/Visual-RFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00586 2025-03-04 eess.IV cs.CV q-bio.QM 57%

Cross-Attention Fusion of MRI and Jacobian Maps for Alzheimer's Disease Diagnosis

Shijia Zhang, Xiyu Ding, Brian Caffo, Junyu Chen, Cindy Zhang, Hadi Kharrazi, Zheyu Wang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Submitted to MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00036 2025-03-04 eess.SP cs.AI cs.LG 57%

A Novel Spatiotemporal Correlation Anomaly Detection Method Based on Time-Frequency-Domain Feature Fusion and a Dynamic Graph Neural Network in Wireless Sensor Network

Miao Ye, Zhibang Jiang, Xingsi Xue, Xingwang Li, Peng Wen, Yong Wang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00330 2025-03-04 cs.CL 57%

How Deep is Love in LLMs' Hearts? Exploring Semantic Size in Human-like Cognition

Yao Yao, Yifei Yang, Xinbei Ma, Dongjie Yang, Zhuosheng Zhang, Zuchao Li, Hai Zhao

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18411 2025-03-04 cs.CV 57%

OmniAlign-V: Towards Enhanced Alignment of MLLMs with Human Preference

Xiangyu Zhao, Shengyuan Ding, Zicheng Zhang, Haian Huang, Maosong Cao, Weiyun Wang, Jiaqi Wang, Xinyu Fang, Wenhai Wang, Guangtao Zhai, Haodong Duan, Hua Yang, Kai Chen

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21163 2025-03-03 cs.CV 57%

Adaptive Illumination-Invariant Synergistic Feature Integration in a Stratified Granular Framework for Visible-Infrared Re-Identification

Yuheng Jia, Wesley Armour

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20850 2025-03-03 cs.CV 57%

VLEER: Vision and Language Embeddings for Explainable Whole Slide Image Representation

Anh Tien Nguyen, Keunho Byeon, Kyungeun Kim, Jin Tae Kwak

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18654 2025-03-03 cs.CV 57%

Mitigating Object Hallucination in MLLMs via Data-augmented Phrase-level Alignment

Pritam Sarkar, Sayna Ebrahimi, Ali Etemad, Ahmad Beirami, Sercan Ö. Arık, Tomas Pfister

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Published in ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18083 2025-02-28 cs.CV 57%

A Fusion Model for Artwork Identification Based on Convolutional Neural Networks and Transformers

Zhenyu Wang, Heng Song

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00693 2025-02-28 cs.CV 57%

GPT4Image: Large Pre-trained Models Help Vision Models Learn Better on Perception Task

Ning Ding, Yehui Tang, Zhongqian Fu, Chao Xu, Kai Han, Yunhe Wang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments GitHub: https://github.com/huawei-noah/Efficient-Computing/tree/master/GPT4Image/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17053 2025-02-27 cs.CV 57%

PointSea: Point Cloud Completion via Self-structure Augmentation

Zhe Zhu, Honghua Chen, Xing He, Mingqiang Wei

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments Accepted by International Journal of Computer Vision (IJCV). Extension of our ICCV 2023 work: arXiv:2307.08492

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05075 2025-02-24 cs.CV 57%

DeepInteraction++: Multi-Modality Interaction for Autonomous Driving

Zeyu Yang, Nan Song, Wei Li, Xiatian Zhu, Li Zhang, Philip H. S. Torr

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Journal extension of NeurIPS 2022. arXiv admin note: text overlap with arXiv:2208.11112

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.12865 2025-02-21 cs.CV 57%

Bridging Sensor Gaps via Attention Gated Tuning for Hyperspectral Image Classification

Xizhe Xue, Haokui Zhang, Haizhao Jing, Lijie Tao, Zongwen Bai, Ying Li

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13883 2025-02-20 cs.CV 57%

Multi-view Video-Pose Pretraining for Operating Room Surgical Activity Recognition

Idris Hamoud, Vinkle Srivastav, Muhammad Abdullah Jamal, Didier Mutter, Omid Mohareri, Nicolas Padoy

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11433 2025-02-20 cs.AI cs.CE q-fin.TR 57%

FLAG-Trader: Fusion LLM-Agent with Gradient-based Reinforcement Learning for Financial Trading

Guojun Xiong, Zhiyang Deng, Keyi Wang, Yupeng Cao, Haohang Li, Yangyang Yu, Xueqing Peng, Mingquan Lin, Kaleb E Smith, Xiao-Yang Liu, Jimin Huang, Sophia Ananiadou, Qianqian Xie

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏