arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4979 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4979 篇

2410.16472 2024-10-23 cs.CL 79%

DocEdit-v2: Document Structure Editing Via Multimodal LLM Grounding

Manan Suri, Puneet Mathur, Franck Dernoncourt, Rajiv Jain, Vlad I Morariu, Ramit Sawhney, Preslav Nakov, Dinesh Manocha

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

Comments EMNLP 2024 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14089 2024-10-21 cs.CV 79%

MMAD-Purify: A Precision-Optimized Framework for Efficient and Scalable Multi-Modal Attacks

Xinxin Liu, Zhongliang Guo, Siyuan Huang, Chun Pong Lau

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06738 2024-10-18 cs.CV 79%

InstructAny2Pix: Flexible Visual Editing via Multimodal Instruction Following

Shufan Li, Harkanwar Singh, Aditya Grover

专题命中 多模态生成 :multimodal(title);multi-modal(abstract);分类 cs.CV

Comments 25 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11723 2024-10-16 cs.RO cs.AI math.OC 79%

Generalizable Spacecraft Trajectory Generation via Multimodal Learning with Transformers

Davide Celestini, Amirhossein Afsharrad, Daniele Gammelli, Tommaso Guffanti, Gioele Zardini, Sanjay Lall, Elisa Capello, Simone D'Amico, Marco Pavone

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

Comments 8 pages, 6 figures, submitted to 2025 American Control Conference (ACC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05465 2024-10-15 cs.CV cs.LG 79%

HAMMR: HierArchical MultiModal React agents for generic VQA

Lluis Castrejon, Thomas Mensink, Howard Zhou, Vittorio Ferrari, Andre Araujo, Jasper Uijlings

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05143 2024-10-08 cs.CV 79%

Leveraging Multimodal Diffusion Models to Accelerate Imaging with Side Information

Timofey Efimov, Harry Dong, Megna Shah, Jeff Simmons, Sean Donegan, Yuejie Chi

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04721 2024-10-08 cs.LG cs.CV 79%

ACDC: Autoregressive Coherent Multimodal Generation using Diffusion Correction

Hyungjin Chung, Dohun Lee, Jong Chul Ye

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments 25 pages, 10 figures. Project page: https://acdc2025.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07179 2024-10-04 cs.LG cs.CL q-bio.BM 79%

3M-Diffusion: Latent Multi-Modal Diffusion for Language-Guided Molecular Structure Generation

Huaisheng Zhu, Teng Xiao, Vasant G Honavar

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10226 2024-10-02 cs.CV 79%

Towards Language-Driven Video Inpainting via Multimodal Large Language Models

Jianzong Wu, Xiangtai Li, Chenyang Si, Shangchen Zhou, Jingkang Yang, Jiangning Zhang, Yining Li, Kai Chen, Yunhai Tong, Ziwei Liu, Chen Change Loy

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments CVPR-2024. Project Page: https://jianzongwu.github.io/projects/rovi

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00265 2024-10-02 eess.IV cs.CV 79%

Adaptive Latent Diffusion Model for 3D Medical Image to Image Translation: Multi-modal Magnetic Resonance Imaging Study

Jonghun Kim, Hyunjin Park

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

Comments 8 pages, 7 figures, WACV 2024 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19862 2024-10-01 cs.LG cs.CV 79%

Learning Multimodal Latent Generative Models with Energy-Based Prior

Shiyu Yuan, Jiali Cui, Hanao Li, Tian Han

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments The 18th European Conference on Computer Vision ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19684 2024-10-01 cs.CV 79%

MedViLaM: A multimodal large language model with advanced generalizability and explainability for medical data understanding and generation

Lijian Xu, Hao Sun, Ziyu Ni, Hongsheng Li, Shaoting Zhang

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.09877 2024-10-01 cs.CV 79%

LayoutDETR: Detection Transformer Is a Good Multimodal Layout Designer

Ning Yu, Chia-Chih Chen, Zeyuan Chen, Rui Meng, Gang Wu, Paul Josel, Juan Carlos Niebles, Caiming Xiong, Ran Xu

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments Accepted to ECCV'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18127 2024-09-27 cs.CV 79%

EgoLM: Multi-Modal Language Model of Egocentric Motions

Fangzhou Hong, Vladimir Guzov, Hyo Jin Kim, Yuting Ye, Richard Newcombe, Ziwei Liu, Lingni Ma

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

Comments Project Page: https://hongfz16.github.io/projects/EgoLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16818 2024-09-26 eess.IV cs.CV 79%

Towards General Text-guided Image Synthesis for Customized Multimodal Brain MRI Generation

Yulin Wang, Honglin Xiong, Kaicong Sun, Shuwei Bai, Ling Dai, Zhongxiang Ding, Jiameng Liu, Qian Wang, Qian Liu, Dinggang Shen

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments 23 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16297 2024-09-26 cs.MM 79%

Analyzing Recursiveness in Multimodal Generative Artificial Intelligence: Stability or Divergence?

Javier Conde, Tobias Cheung, Gonzalo Martínez, Pedro Reviriego, Rik Sarkar

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14720 2024-09-24 cs.CV 79%

ControlEdit: A MultiModal Local Clothing Image Editing Method

Di Cheng, YingJie Shi, ShiXin Sun, JiaFu Zhang, WeiJing Wang, Yu Liu

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12099 2024-09-19 cs.CV 79%

Brain-Streams: fMRI-to-Image Reconstruction with Multi-modal Guidance

Jaehoon Joo, Taejin Jeong, Seongjae Hwang

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11010 2024-09-18 cs.CV 79%

MM2Latent: Text-to-facial image generation and editing in GANs with multimodal assistance

Debin Meng, Christos Tzelepis, Ioannis Patras, Georgios Tzimiropoulos

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments Accepted at ECCV 2024 AIM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09149 2024-09-17 cs.CV 79%

Adaptive Multi-Modal Control of Digital Human Hand Synthesis Using a Region-Aware Cycle Loss

Qifan Fu, Xiaohang Yang, Muhammad Asad, Changjae Oh, Shanxin Yuan, Gregory Slabaugh

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

Comments This paper has been accepted by the ECCV 2024 HANDS workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03961 2024-09-09 cs.CV 79%

Generating Faithful and Salient Text from Multimodal Data

Tahsina Hashem, Weiqing Wang, Derry Tanti Wijaya, Mohammed Eunus Ali, Yuan-Fang Li

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16889 2024-09-02 cs.CL cs.LG 79%

LLaVA-Chef: A Multi-modal Generative Model for Food Recipes

Fnu Mohbat, Mohammed J. Zaki

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06702 2024-08-30 cs.CV 79%

Fast Text-to-3D-Aware Face Generation and Manipulation via Direct Cross-modal Mapping and Geometric Regularization

Jinlu Zhang, Yiyi Zhou, Qiancheng Zheng, Xiaoxiong Du, Gen Luo, Jun Peng, Xiaoshuai Sun, Rongrong Ji

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02905 2024-08-28 cs.MM 79%

MMoFusion: Multi-modal Co-Speech Motion Generation with Diffusion Model

Sen Wang, Jiangning Zhang, Xin Tan, Zhifeng Xie, Chengjie Wang, Lizhuang Ma

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12117 2024-08-23 cs.CL 79%

The Curious Case of Nonverbal Abstract Reasoning with Multi-Modal Large Language Models

Kian Ahrabian, Zhivar Sourati, Kexuan Sun, Jiarui Zhang, Yifan Jiang, Fred Morstatter, Jay Pujara

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CL

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05455 2024-08-13 cs.CV cs.NI 79%

Multimodal generative semantic communication based on latent diffusion model

Weiqi Fu, Lianming Xu, Xin Wu, Haoyang Wei, Li Wang

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11280 2024-08-06 cs.NI cs.AI 79%

Image Generative Semantic Communication with Multi-Modal Similarity Estimation for Resource-Limited Networks

Eri Hosonuma, Taku Yamazaki, Takumi Miyoshi, Akihito Taya, Yuuki Nishiyama, Kaoru Sezaki

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI

Comments 14 pages, 15 figures, this paper has been submitted to IEICE Transactions on Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21333 2024-08-01 cs.CV 79%

Chat2Layout: Interactive 3D Furniture Layout with a Multimodal LLM

Can Wang, Hongliang Zhong, Menglei Chai, Mingming He, Dongdong Chen, Jing Liao

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments Main paper with supplemental materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19180 2024-07-30 cs.CV 79%

Data Processing Techniques for Modern Multimodal Models

Yinheng Li, Han Ding, Hang Chen

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16204 2024-07-24 cs.CV 79%

CLII: Visual-Text Inpainting via Cross-Modal Predictive Interaction

Liang Zhao, Qing Guo, Xiaoguang Li, Song Wang

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏