arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6903 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6903 篇

2503.13847 2025-03-19 cs.CV cs.AI 62%

Disentangling Fine-Tuning from Pre-Training in Visual Captioning with Hybrid Markov Logic

Monika Shah, Somdeb Sarkhel, Deepak Venugopal

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 2024 IEEE International Conference on Big Data (BigData), 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05797 2025-03-19 q-bio.BM cs.AI cs.CE cs.CL cs.LG 62%

3D-MolT5: Leveraging Discrete Structural Information for Molecule-Text Modeling

Qizhi Pei, Rui Yan, Kaiyuan Gao, Jinhua Zhu, Lijun Wu

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL、cs.AI

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10211 2025-03-14 cs.CL cs.SD eess.AS 62%

Adaptive Inner Speech-Text Alignment for LLM-based Speech Translation

Henglyu Liu, Andong Chen, Kehai Chen, Xuefeng Bai, Meizhi Zhong, Yuan Qiu, Min Zhang

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL、eess.AS

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07536 2025-03-12 cs.CL cs.AI 62%

LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL

Yingzhe Peng, Gongrui Zhang, Miaosen Zhang, Zhiyuan You, Jie Liu, Qipeng Zhu, Kai Yang, Xingzhong Xu, Xin Geng, Xu Yang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03594 2025-03-11 cs.CL cs.AI 62%

Small but Mighty: Enhancing Time Series Forecasting with Lightweight LLMs

Haoran Fan, Bin Li, Yixuan Weng, Shoujun Zhou

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL、cs.AI

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09193 2025-03-07 cs.CV cs.AI cs.LG q-bio.NC 62%

Can We Talk Models Into Seeing the World Differently?

Paul Gavrikov, Jovita Lukasik, Steffen Jung, Robert Geirhos, M. Jehanzeb Mirza, Margret Keuper, Janis Keuper

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14808 2025-03-04 cs.CV cs.AI cs.LG 62%

High-Resolution Image Synthesis via Next-Token Prediction

Dengsheng Chen, Jie Hu, Tiezhu Yue, Xiaoming Wei, Enhua Wu

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16880 2025-03-04 q-bio.QM cs.AI cs.CL 62%

Atomas: Hierarchical Alignment on Molecule-Text for Unified Molecule Understanding and Generation

Yikun Zhang, Geyan Ye, Chaohao Yuan, Bo Han, Long-Kai Huang, Jianhua Yao, Wei Liu, Yu Rong

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04149 2025-02-28 cs.CV cs.AI 62%

Frequency-Adaptive Low-Latency Object Detection Using Events and Frames

Haitian Zhang, Xiangyuan Wang, Chang Xu, Xinya Wang, Fang Xu, Huai Yu, Lei Yu, Wen Yang

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18725 2025-02-27 cs.AI cs.CL q-bio.NC 62%

Talking to the brain: Using Large Language Models as Proxies to Model Brain Semantic Representation

Xin Liu, Ziyue Zhang, Jingxin Nie

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11000 2025-02-26 cs.CL cs.AI 62%

ASGEA: Exploiting Logic Rules from Align-Subgraphs for Entity Alignment

Yangyifei Luo, Zhuo Chen, Lingbing Guo, Qian Li, Wenxuan Zeng, Zhixin Cai, Jianxin Li

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL、cs.AI

Comments Ongoing work; 16 pages, 9 Tables, 8 Figures; Code: https://github.com/lyyf2002/ASGEA

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04734 2025-02-26 cs.LG cs.CL cs.CV 62%

TLDR: Token-Level Detective Reward Model for Large Vision Language Models

Deqing Fu, Tong Xiao, Rui Wang, Wang Zhu, Pengchuan Zhang, Guan Pang, Robin Jia, Lawrence Chen

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10250 2025-02-25 cs.CL cs.CV 62%

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models

Gokul Karthik Kumar, Iheb Chaabane, Kebin Wu

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV、cs.CL

Comments Accepted at PAKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15322 2025-02-24 cs.CV cs.AI 62%

SentiFormer: Metadata Enhanced Transformer for Image Sentiment Analysis

Bin Feng, Shulan Ruan, Mingzheng Yang, Dongxuan Han, Huijie Liu, Kai Zhang, Qi Liu

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11831 2025-02-18 cs.CV cs.AI 62%

Intuitive physics understanding emerges from self-supervised pretraining on natural videos

Quentin Garrido, Nicolas Ballas, Mahmoud Assran, Adrien Bardes, Laurent Najman, Michael Rabbat, Emmanuel Dupoux, Yann LeCun

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 24 pages,14 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10724 2025-02-17 cs.CV cs.AI 62%

Segment Any Anomaly without Training via Hybrid Prompt Regularization

Yunkang Cao, Xiaohao Xu, Chen Sun, Yuqi Cheng, Zongwei Du, Liang Gao, Weiming Shen

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments The first two authors contribute equally. The code will be available on https://github.com/caoyunkang/Segment-Any-Anomaly

Journal ref IEEE Transactions on Cybernetics, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06894 2025-02-12 cs.CV cs.AI 62%

AI-Driven HSI: Multimodality, Fusion, Challenges, and the Deep Learning Revolution

David S. Bhatti, Yougin Choi, Rahman S M Wahidur, Maleeka Bakhtawar, Sumin Kim, Surin Lee, Yongtae Lee, Heung-No Lee

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 39 Pages, 22 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02618 2025-02-06 cs.CV cs.AI 62%

Deep Learning-Based Facial Expression Recognition for the Elderly: A Systematic Review

F. Xavier Gaya-Morey, Jose M. Buades-Rubio, Philippe Palanque, Raquel Lacuesta, Cristina Manresa-Yee

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00712 2025-02-04 eess.IV cs.AI cs.CV 62%

Registration-Enhanced Segmentation Method for Prostate Cancer in Ultrasound Images

Shengtian Sang, Hassan Jahanandish, Cynthia Xinran Li, Indrani Bhattachary, Jeong Hoon Lee, Lichun Zhang, Sulaiman Vesal, Pejman Ghanouni, Richard Fan, Geoffrey A. Sonn, Mirabela Rusu

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18237 2025-01-31 cs.CV cs.AI 62%

Arbitrary Data as Images: Fusion of Patient Data Across Modalities and Irregular Intervals with Vision Transformers

Malte Tölle, Mohamad Scharaf, Samantha Fischer, Christoph Reich, Silav Zeid, Christoph Dieterich, Benjamin Meder, Norbert Frey, Philipp Wild, Sandy Engelhardt

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10868 2025-01-31 cs.AI cs.CL cs.CY cs.HC 62%

From Google Gemini to OpenAI Q* (Q-Star): A Survey of Reshaping the Generative Artificial Intelligence (AI) Research Landscape

Timothy R. McIntosh, Teo Susnjak, Tong Liu, Paul Watters, Malka N. Halgamuge

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15619 2025-01-28 cs.CV cs.AI 62%

GaussianToken: An Effective Image Tokenizer with 2D Gaussian Splatting

Jiajun Dong, Chengkun Wang, Wenzhao Zheng, Lei Chen, Jiwen Lu, Yansong Tang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13787 2025-01-24 cs.CL cs.AI cs.LG 62%

Parameter-Efficient Fine-Tuning for Foundation Models

Dan Zhang, Tao Feng, Lilong Xue, Yuandong Wang, Yuxiao Dong, Jie Tang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 25 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09377 2025-01-17 cs.LG cs.AI cs.CV 62%

Evaluating alignment between humans and neural network representations in image-based learning tasks

Can Demircan, Tankred Saanum, Leonardo Pettini, Marcel Binz, Blazej M Baczkowski, Christian F Doeller, Mona M Garvert, Eric Schulz

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06710 2025-01-14 cs.CV cs.AI 62%

Multi-task Visual Grounding with Coarse-to-Fine Consistency Constraints

Ming Dai, Jian Li, Jiedong Zhuang, Xian Zhang, Wankou Yang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

Comments AAAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12359 2025-01-08 cs.CV cs.CL 62%

LLaVA Steering: Visual Instruction Tuning with 500x Fewer Parameters through Modality Linear Representation-Steering

Jinhe Bi, Yujun Wang, Haokun Chen, Xun Xiao, Artur Hecker, Volker Tresp, Yunpu Ma

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19994 2024-12-31 physics.chem-ph cs.AI cs.CL cs.LG 62%

From Generalist to Specialist: A Survey of Large Language Models for Chemistry

Yang Han, Ziping Wan, Lu Chen, Kai Yu, Xin Chen

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL、cs.AI

Comments COLING2025,We maintain an up-to-date Github repository at: https://github.com/OpenDFM/LLM4Chemistry

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11780 2024-12-19 cs.CL cs.AI 62%

SwitchCIT: Switching for Continual Instruction Tuning

Xinbo Wu, Max Hartman, Vidhata Arjun Jayaraman, Lav R. Varshney

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12841 2024-12-18 cs.CL cs.AI 62%

Black-box Model Ensembling for Textual and Visual Question Answering via Information Fusion

Yuxi Xia, Kilm Zaporojets, Benjamin Roth

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 15 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10939 2024-12-17 cs.CY cs.AI cs.CL cs.HC 62%

Human-Centric NLP or AI-Centric Illusion?: A Critical Investigation

Piyapath T Spencer

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL、cs.AI

Comments Preprint to be published in Proceedings of PACLIC38

详情

展开后加载摘要…

URL PDF HTML 收藏