arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4975 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4975 篇

2504.03607 2025-04-07 cs.CV 79%

Multimodal Diffusion Bridge with Attention-Based SAR Fusion for Satellite Image Cloud Removal

Yuyang Hu, Suhas Lohit, Ulugbek S. Kamilov, Tim K. Marks

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24165 2025-04-01 cs.LG cs.AI 79%

Predicting Targeted Therapy Resistance in Non-Small Cell Lung Cancer Using Multimodal Machine Learning

Peiying Hua, Andrea Olofson, Faraz Farhadi, Liesbeth Hondelink, Gregory Tsongalis, Konstantin Dragnev, Dagmar Hoegemann Savellano, Arief Suriawinata, Laura Tafe, Saeed Hassanpour

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08650 2025-04-01 cs.CL 79%

An End-to-End Model for Photo-Sharing Multi-modal Dialogue Generation

Peiming Guo, Sinuo Liu, Yanzhao Zhang, Dingkun Long, Pengjun Xie, Meishan Zhang, Min Zhang

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CL

Comments Accepted by ICME2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20198 2025-03-27 cs.CV 79%

Beyond Words: Advancing Long-Text Image Generation via Multimodal Autoregressive Models

Alex Jinpeng Wang, Linjie Li, Zhengyuan Yang, Lijuan Wang, Min Li

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16254 2025-03-21 cs.CV 79%

M2N2V2: Multi-Modal Unsupervised and Training-free Interactive Segmentation

Markus Karmann, Peng-Tao Jiang, Bo Li, Onay Urfalioglu

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14216 2025-03-19 cs.LG cs.AI cs.CE 79%

TFG-Flow: Training-free Guidance in Multimodal Generative Flow

Haowei Lin, Shanda Li, Haotian Ye, Yiming Yang, Stefano Ermon, Yitao Liang, Jianzhu Ma

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

Journal ref ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09901 2025-03-19 cs.CV 79%

MulSMo: Multimodal Stylized Motion Generation by Bidirectional Control Flow

Zhe Li, Yisheng He, Lei Zhong, Weichao Shen, Qi Zuo, Lingteng Qiu, Zilong Dong, Laurence Tianruo Yang, Weihao Yuan

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11073 2025-03-17 cs.CV 79%

Perceive, Understand and Restore: Real-World Image Super-Resolution with Autoregressive Multimodal Generative Models

Hongyang Wei, Shuaizheng Liu, Chun Yuan, Lei Zhang

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10604 2025-03-14 cs.CV 79%

MuDG: Taming Multi-modal Diffusion with Gaussian Splatting for Urban Scene Reconstruction

Yingshuang Zou, Yikang Ding, Chuanrui Zhang, Jiazhe Guo, Bohan Li, Xiaoyang Lyu, Feiyang Tan, Xiaojuan Qi, Haoqian Wang

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09491 2025-03-13 cs.CV eess.IV 79%

DAMM-Diffusion: Learning Divergence-Aware Multi-Modal Diffusion Model for Nanoparticles Distribution Prediction

Junjie Zhou, Shouju Wang, Yuxia Tang, Qi Zhu, Daoqiang Zhang, Wei Shao

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08156 2025-03-12 cs.CV cs.LG 79%

Towards Large-scale Chemical Reaction Image Parsing via a Multimodal Large Language Model

Yufan Chen, Ching Ting Leung, Jianwei Sun, Yong Huang, Linyan Li, Hao Chen, Hanyu Gao

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06296 2025-03-11 cs.CL cs.LG 79%

MoEMoE: Question Guided Dense and Scalable Sparse Mixture-of-Expert for Multi-source Multi-modal Answering

Vinay Kumar Verma, Shreyas Sunil Kulkarni, Happy Mittal, Deepak Gupta

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.CL

Comments To appear at NAACL Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01115 2025-03-11 cs.CV 79%

WeGen: A Unified Model for Interactive Multimodal Generation as We Chat

Zhipeng Huang, Shaobin Zhuang, Canmiao Fu, Binxin Yang, Ying Zhang, Chong Sun, Zhizheng Zhang, Yali Wang, Chen Li, Zheng-Jun Zha

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10171 2025-03-11 cs.RO cs.AI 79%

Imagine-2-Drive: Leveraging High-Fidelity World Models via Multi-Modal Diffusion Policies

Anant Garg, K Madhava Krishna

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI

Comments Submitted to IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16795 2025-03-11 cs.AI 79%

Scene-Aware Explainable Multimodal Trajectory Prediction

Pei Liu, Haipeng Liu, Xingyu Liu, Yiqun Li, Junlan Chen, Yangfan He, Jun Ma

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06142 2025-03-11 cs.CV 79%

VLForgery Face Triad: Detection, Localization and Attribution via Multimodal Large Language Models

Xinan He, Yue Zhou, Bing Fan, Bin Li, Guopu Zhu, Feng Ding

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14922 2025-03-04 cs.CV 79%

GDTS: Goal-Guided Diffusion Model with Tree Sampling for Multi-Modal Pedestrian Trajectory Prediction

Ge Sun, Sheng Wang, Lei Zhu, Ming Liu, Jun Ma

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00413 2025-03-04 cs.CV cs.LG 79%

CL-MoE: Enhancing Multimodal Large Language Model with Dual Momentum Mixture-of-Experts for Continual Visual Question Answering

Tianyu Huai, Jie Zhou, Xingjiao Wu, Qin Chen, Qingchun Bai, Ze Zhou, Liang He

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments 10 pages,4 figures,accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19293 2025-02-28 cs.CV 79%

Pathology Report Generation and Multimodal Representation Learning for Cutaneous Melanocytic Lesions

Ruben T. Lucassen, Sander P. J. Moonemans, Tijn van de Luijtgaarden, Gerben E. Breimer, Willeke A. M. Blokx, Mitko Veta

专题命中 多模态生成 :multimodal(title);cross-modal(abstract);分类 cs.CV

Comments 11 pages, 2 figures. arXiv admin note: text overlap with arXiv:2502.19285

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13452 2025-02-28 cs.CV 79%

EchoVideo: Identity-Preserving Human Video Generation by Multimodal Feature Fusion

Jiangchuan Wei, Shiyue Yan, Wenfeng Lin, Boyuan Liu, Renjie Chen, Mingyu Guo

专题命中 多模态生成 :multimodal(title);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13656 2025-02-25 cs.CV 79%

GLCF: A Global-Local Multimodal Coherence Analysis Framework for Talking Face Generation Detection

Xiaocan Chen, Qilin Yin, Jiarui Liu, Wei Lu, Xiangyang Luo, Jiantao Zhou

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11453 2025-02-18 cs.LG cs.AI 79%

Connector-S: A Survey of Connectors in Multi-modal Large Language Models

Xun Zhu, Zheng Zhang, Xi Chen, Yiming Shi, Miao Li, Ji Wu

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10458 2025-02-18 cs.LG cs.AI 79%

I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models

Zhenxing Mi, Kuan-Chieh Wang, Guocheng Qian, Hanrong Ye, Runtao Liu, Sergey Tulyakov, Kfir Aberman, Dan Xu

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

Comments Project page: https://mizhenxing.github.io/ThinkDiff, 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06823 2025-02-13 cs.LG cs.CV cs.GR cs.IR 79%

CTR-Driven Advertising Image Generation with Multimodal Large Language Models

Xingye Chen, Wei Feng, Zhenbang Du, Weizhen Wang, Yanyin Chen, Haohan Wang, Linkai Liu, Yaoyu Li, Jinyuan Zhao, Yu Li, Zheng Zhang, Jingjing Lv, Junjie Shen, Zhangang Lin, Jingping Shao, Yuanjie Shao, Xinge You, Changxin Gao, Nong Sang

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments Accepted to WWW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06474 2025-02-11 cs.CV 79%

UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths

Weijia Mao, Zhenheng Yang, Mike Zheng Shou

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18102 2025-02-11 cs.NE cs.AI 79%

Multiple Global Peaks Big Bang-Big Crunch Algorithm for Multimodal Optimization

Fabio Stroppa, Ahmet Astar

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

Comments 16 pages

Journal ref Evolutionary Intelligence, Springer, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05178 2025-02-10 cs.CV 79%

QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation

Yue Zhao, Fuzhao Xue, Scott Reed, Linxi Fan, Yuke Zhu, Jan Kautz, Zhiding Yu, Philipp Krähenbühl, De-An Huang

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments Tech report. Project page: https://nvlabs.github.io/QLIP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05150 2025-02-10 cs.CL 79%

CodeSCM: Causal Analysis for Multi-Modal Code Generation

Mukur Gupta, Noopur Bhatt, Suman Jana

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CL

Comments Accepted to NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02555 2025-02-06 eess.IV cs.CV 79%

AAD-DCE: An Aggregated Multimodal Attention Mechanism for Early and Late Dynamic Contrast Enhanced Prostate MRI Synthesis

Divya Bharti, Sriprabha Ramanarayanan, Sadhana S, Kishore Kumar M, Keerthi Ram, Harsh Agarwal, Ramesh Venkatesan, Mohanasankar Sivaprakasam

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments Accepted at ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13925 2025-01-24 cs.CV 79%

GeoPixel: Pixel Grounding Large Multimodal Model in Remote Sensing

Akashah Shabbir, Mohammed Zumri, Mohammed Bennamoun, Fahad S. Khan, Salman Khan

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏