arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4965 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4965 篇

2306.03083 2023-06-06 cs.RO cs.AI 57%

MotionDiffuser: Controllable Multi-Agent Motion Prediction using Diffusion

Chiyu Max Jiang, Andre Cornman, Cheolho Park, Ben Sapp, Yin Zhou, Dragomir Anguelov

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments Accepted as a highlight paper in CVPR 2023. Walkthrough video: https://youtu.be/IfGTZwm1abg

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18470 2023-06-05 cs.LG cs.CE cs.CV 57%

Aligning Optimization Trajectories with Diffusion Models for Constrained Design Generation

Giorgio Giannone, Akash Srivastava, Ole Winther, Faez Ahmed

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.05662 2023-06-05 cs.CV 57%

InternGPT: Solving Vision-Centric Tasks by Interacting with ChatGPT Beyond Language

Zhaoyang Liu, Yinan He, Wenhai Wang, Weiyun Wang, Yi Wang, Shoufa Chen, Qinglong Zhang, Zeqiang Lai, Yang Yang, Qingyun Li, Jiashuo Yu, Kunchang Li, Zhe Chen, Xue Yang, Xizhou Zhu, Yali Wang, Limin Wang, Ping Luo, Jifeng Dai, Yu Qiao

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18264 2023-05-30 cs.CV 57%

Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising

Fu-Yun Wang, Wenshuo Chen, Guanglu Song, Han-Jia Ye, Yu Liu, Hongsheng Li

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments The code is available at https://github.com/G-U-N/Gen-L-Video

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17072 2023-05-29 cs.CL cs.CY 57%

Stereotypes and Smut: The (Mis)representation of Non-cisgender Identities by Text-to-Image Models

Eddie L. Ungless, Björn Ross, Anne Lauscher

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

Comments Accepted to ACL Findings 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15753 2023-05-26 cs.CV 57%

T2TD: Text-3D Generation Model based on Prior Knowledge Guidance

Weizhi Nie, Ruidong Chen, Weijie Wang, Bruno Lepri, Nicu Sebe

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11176 2023-05-25 cs.RO cs.AI 57%

Instruct2Act: Mapping Multi-modality Instructions to Robotic Actions with Large Language Model

Siyuan Huang, Zhengkai Jiang, Hao Dong, Yu Qiao, Peng Gao, Hongsheng Li

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17870 2023-05-24 cs.CV 57%

GlyphDraw: Seamlessly Rendering Text with Intricate Spatial Structures in Text-to-Image Generation

Jian Ma, Mingjun Zhao, Chen Chen, Ruichen Wang, Di Niu, Haonan Lu, Xiaodong Lin

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12358 2023-05-23 cs.CV cs.LG eess.IV 57%

AutoPaint: A Self-Inpainting Method for Unsupervised Anomaly Detection

Mehdi Astaraki, Francesca De Benetti, Yousef Yeganeh, Iuliana Toma-Dasu, Örjan Smedby, Chunliang Wang, Nassir Navab, Thomas Wendler

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments 41 pages, 15 figures, follow-up paper to conference abstract at yearly meeting of German Nuclear Medicine in 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10573 2023-05-23 cs.LG cs.AI 57%

IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies

Philippe Hansen-Estruch, Ilya Kostrikov, Michael Janner, Jakub Grudzien Kuba, Sergey Levine

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments 9 Pages, 4 Figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.04451 2023-05-09 cs.CV 57%

FashionTex: Controllable Virtual Try-on with Text and Texture

Anran Lin, Nanxuan Zhao, Shuliang Ning, Yuda Qiu, Baoyuan Wang, Xiaoguang Han

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Accepted to SIGGRAPH 2023 (Conference Proceedings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.04426 2023-05-09 cs.CV 57%

Improving 2D face recognition via fine-level facial depth generation and RGB-D complementary feature learning

Wenhao Hu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03980 2023-05-09 cs.CV cs.CR 57%

Towards Prompt-robust Face Privacy Protection via Adversarial Decoupling Augmentation Framework

Ruijia Wu, Yuhang Wang, Huafeng Shi, Zhipeng Yu, Yichao Wu, Ding Liang

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.00042 2023-05-02 eess.IV cs.CV 57%

Cycle-guided Denoising Diffusion Probability Model for 3D Cross-modality MRI Synthesis

Shaoyan Pan, Chih-Wei Chang, Junbo Peng, Jiahan Zhang, Richard L. J. Qiu, Tonghe Wang, Justin Roper, Tian Liu, Hui Mao, Xiaofeng Yang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.13722 2023-04-27 cs.CV 57%

Controllable Image Generation via Collage Representations

Arantxa Casanova, Marlène Careil, Adriana Romero-Soriano, Christopher J. Pal, Jakob Verbeek, Michal Drozdzal

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06818 2023-04-17 cs.CV 57%

Soundini: Sound-Guided Diffusion for Natural Video Editing

Seung Hyun Lee, Sieun Kim, Innfarn Yoo, Feng Yang, Donghyeon Cho, Youngseo Kim, Huiwen Chang, Jinkyu Kim, Sangpil Kim

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.04681 2023-04-11 cs.CV cs.LG 57%

Controllable Motion Synthesis and Reconstruction with Autoregressive Diffusion Models

Wenjie Yin, Ruibo Tu, Hang Yin, Danica Kragic, Hedvig Kjellström, Mårten Björkman

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.04290 2023-04-11 cs.LG cs.AI 57%

Distributed Conditional GAN (discGAN) For Synthetic Healthcare Data Generation

David Fuentes, Diana McSpadden, Sodiq Adewole

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17789 2023-04-03 cs.CV 57%

FONT: Flow-guided One-shot Talking Head Generation with Natural Head Motions

Jin Liu, Xi Wang, Xiaomeng Fu, Yesheng Chai, Cai Yu, Jiao Dai, Jizhong Han

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV

Comments Accepted by ICME2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17158 2023-03-31 cs.CV eess.IV 57%

KD-DLGAN: Data Limited Image Generation via Knowledge Distillation

Kaiwen Cui, Yingchen Yu, Fangneng Zhan, Shengcai Liao, Shijian Lu1, Eric Xing

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Journal ref CVPR2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.09516 2023-03-31 cs.CV cs.LG 57%

AutoSDF: Shape Priors for 3D Completion, Reconstruction and Generation

Paritosh Mittal, Yen-Chi Cheng, Maneesh Singh, Shubham Tulsiani

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments In CVPR 2022. The first two authors contributed equally to this work. Project: https://yccyenchicheng.github.io/AutoSDF/. Add Supp

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16105 2023-03-29 cs.CV cs.LG 57%

Variational Distribution Learning for Unsupervised Text-to-Image Generation

Minsoo Kang, Doyup Lee, Jiseob Kim, Saehoon Kim, Bohyung Han

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments Accepted at CVPR2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13714 2023-03-27 cs.CV cs.LG eess.IV 57%

High Fidelity Image Synthesis With Deep VAEs In Latent Space

Troy Luhman, Eric Luhman

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments 19 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10895 2023-03-21 cs.CV 57%

Leapfrog Diffusion Model for Stochastic Trajectory Prediction

Weibo Mao, Chenxin Xu, Qi Zhu, Siheng Chen, Yanfeng Wang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Accepted by CVPR2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10326 2023-03-21 eess.IV cs.CV 57%

Diff-UNet: A Diffusion Embedded Network for Volumetric Segmentation

Zhaohu Xing, Liang Wan, Huazhu Fu, Guang Yang, Lei Zhu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.05034 2023-03-07 cs.CV 57%

SmartBrush: Text and Shape Guided Object Inpainting with Diffusion Model

Shaoan Xie, Zhifei Zhang, Zhe Lin, Tobias Hinz, Kun Zhang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Journal ref CVPR2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02153 2023-03-06 cs.CV 57%

Unleashing Text-to-Image Diffusion Models for Visual Perception

Wenliang Zhao, Yongming Rao, Zuyan Liu, Benlin Liu, Jie Zhou, Jiwen Lu

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments project page: https://vpd.ivg-research.xyz

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.10677 2023-03-06 cs.AI cs.LG stat.ML 57%

Imitating Human Behaviour with Diffusion Models

Tim Pearce, Tabish Rashid, Anssi Kanervisto, Dave Bignell, Mingfei Sun, Raluca Georgescu, Sergio Valcarcel Macua, Shan Zheng Tan, Ida Momennejad, Katja Hofmann, Sam Devlin

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments Published in ICLR 2023

Journal ref ICLR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.01311 2023-03-03 cs.CV 57%

Zero-Shot Text-to-Parameter Translation for Game Character Auto-Creation

Rui Zhao, Wei Li, Zhipeng Hu, Lincheng Li, Zhengxia Zou, Zhenwei Shi, Changjie Fan

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Accepted in CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.14816 2023-03-01 cs.CV 57%

Monocular Depth Estimation using Diffusion Models

Saurabh Saxena, Abhishek Kar, Mohammad Norouzi, David J. Fleet

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏