arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4965 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4965 篇

2312.01904 2023-12-05 cs.CV cs.LG eess.IV 57%

Unsupervised Anomaly Detection using Aggregated Normative Diffusion

Alexander Frotscher, Jaivardhan Kapoor, Thomas Wolfers, Christian F. Baumgartner

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00783 2023-12-05 cs.CV 57%

FaceDNeRF: Semantics-Driven Face Reconstruction, Prompt Editing and Relighting with Diffusion Models

Hao Zhang, Yanbo Xu, Tianyuan Dai, Yu-Wing Tai, Chi-Keung Tang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17917 2023-11-30 cs.GR cs.CV 57%

AvatarStudio: High-fidelity and Animatable 3D Avatar Creation from Text

Jianfeng Zhang, Xuanmeng Zhang, Huichao Zhang, Jun Hao Liew, Chenxu Zhang, Yi Yang, Jiashi Feng

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Project page at http://jeff95.me/projects/avatarstudio.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.10240 2023-11-30 cs.CL 57%

Diffusion Glancing Transformer for Parallel Sequence to Sequence Learning

Lihua Qian, Mingxuan Wang, Yang Liu, Hao Zhou

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20604 2023-11-29 eess.IV cs.CV 57%

Enhanced Synthetic MRI Generation from CT Scans Using CycleGAN with Feature Extraction

Saba Nikbakhsh, Lachin Naghashyar, Morteza Valizadeh, Mehdi Chehel Amirani

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14301 2023-11-27 cs.CV cs.LG 57%

GeoViT: A Versatile Vision Transformer Architecture for Geospatial Image Analysis

Madhav Khirwar, Ankur Narang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Extended Abstract, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11818 2023-11-22 cs.CV 57%

MaGIC: Multi-modality Guided Image Completion

Yongsheng Yu, Hao Wang, Tiejian Luo, Heng Fan, Libo Zhang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments 23 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11238 2023-11-21 cs.HC cs.AI 57%

AtomXR: Streamlined XR Prototyping with Natural Language and Immersive Physical Interaction

Alice Cai, Caine Ardayfio, AnhPhu Nguyen, Tica Lin, Elena Glassman

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments 15 pages, 14 figures, in submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.12845 2023-11-10 eess.IV cs.CV 57%

Super-resolution Reconstruction of Single Image for Latent features

Xin Wang, Jing-Ke Yan, Jing-Ye Cai, Jian-Hua Deng, Qin Qin, Yao Cheng

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Journal ref Computational Visual Media,2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18840 2023-11-09 cs.CV 57%

Customizing 360-Degree Panoramas through Text-to-Image Diffusion Models

Hai Wang, Xiaoyu Xiang, Yuchen Fan, Jing-Hao Xue

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments Accepted by WACV 2024, Project Page: https://littlewhitesea.github.io/stitchdiffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04199 2023-11-08 cs.IR cs.CL 57%

Exploring Recommendation Capabilities of GPT-4V(ision): A Preliminary Case Study

Peilin Zhou, Meng Cao, You-Liang Huang, Qichen Ye, Peiyan Zhang, Junling Liu, Yueqi Xie, Yining Hua, Jaeboum Kim

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

Comments In Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03074 2023-11-07 eess.IV cs.CV 57%

A Two-Stage Generative Model with CycleGAN and Joint Diffusion for MRI-based Brain Tumor Detection

Wenxin Wang, Zhuo-Xu Cui, Guanxun Cheng, Chentao Cao, Xi Xu, Ziwei Liu, Haifeng Wang, Yulong Qi, Dong Liang, Yanjie Zhu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments 11 pages,9 figures,3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.02541 2023-11-07 cs.CV cs.GT 57%

Catch Missing Details: Image Reconstruction with Frequency Augmented Variational Autoencoder

Xinmiao Lin, Yikang Li, Jenhao Hsiao, Chiuman Ho, Yu Kong

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments Accepted by CVPR 2023, code available at https://github.com/oppo-us-research/FA-VAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00339 2023-11-02 cs.CV stat.ML 57%

Space Narrative: Generating Images and 3D Scenes of Chinese Garden from Text using Deep Learning

Jiaxi Shi1, Hao Hua1

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments 8 pages, 5 figures, xArch symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09036 2023-11-02 cs.AI cs.HC 57%

PromptMagician: Interactive Prompt Engineering for Text-to-Image Creation

Yingchaojie Feng, Xingbo Wang, Kam Kwai Wong, Sijia Wang, Yuhong Lu, Minfeng Zhu, Baicheng Wang, Wei Chen

专题命中 多模态生成 :cross-modal(abstract);分类 cs.AI

Comments Accepted full paper for IEEE VIS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16381 2023-11-02 cs.LG cs.CV 57%

DPOK: Reinforcement Learning for Fine-tuning Text-to-Image Diffusion Models

Ying Fan, Olivia Watkins, Yuqing Du, Hao Liu, Moonkyung Ryu, Craig Boutilier, Pieter Abbeel, Mohammad Ghavamzadeh, Kangwook Lee, Kimin Lee

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10855 2023-10-31 cs.CV 57%

TextDiffuser: Diffusion Models as Text Painters

Jingye Chen, Yupan Huang, Tengchao Lv, Lei Cui, Qifeng Chen, Furu Wei

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04053 2023-10-27 cs.CL 57%

Describe me an Aucklet: Generating Grounded Perceptual Category Descriptions

Bill Noble, Nikolai Ilinykh

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL

Comments To appear in Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP, Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15587 2023-10-25 cs.CL 57%

ScanDL: A Diffusion Model for Generating Synthetic Scanpaths on Texts

Lena S. Bolliger, David R. Reich, Patrick Haller, Deborah N. Jakobi, Paul Prasse, Lena A. Jäger

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15144 2023-10-24 cs.CV 57%

DEsignBench: Exploring and Benchmarking DALL-E 3 for Imagining Visual Design

Kevin Lin, Zhengyuan Yang, Linjie Li, Jianfeng Wang, Lijuan Wang

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments Project page at https://design-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14570 2023-10-24 cs.CV cs.RO 57%

DICE: Diverse Diffusion Model with Scoring for Trajectory Prediction

Younwoo Choi, Ray Coden Mercurius, Soheil Mohamad Alizadeh Shabestary, Amir Rasouli

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14312 2023-10-23 cs.CV 57%

Text-guided 3D Human Generation from 2D Collections

Tsu-Jui Fu, Wenhan Xiong, Yixin Nie, Jingyu Liu, Barlas Oğuz, William Yang Wang

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

Comments EMNLP'23 (Findings) ; Project website: https://text-3dh.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10651 2023-10-17 cs.CV cs.GR 57%

HairCLIPv2: Unifying Hair Editing via Proxy Feature Blending

Tianyi Wei, Dongdong Chen, Wenbo Zhou, Jing Liao, Weiming Zhang, Gang Hua, Nenghai Yu

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

Comments ICCV 2023, code is available at https://github.com/wty-ustc/HairCLIPv2

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10137 2023-10-17 cs.CV cs.CR cs.LG 57%

A Recipe for Watermarking Diffusion Models

Yunqing Zhao, Tianyu Pang, Chao Du, Xiao Yang, Ngai-Man Cheung, Min Lin

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15505 2023-10-13 cs.CV cs.LG 57%

Finite Scalar Quantization: VQ-VAE Made Simple

Fabian Mentzer, David Minnen, Eirikur Agustsson, Michael Tschannen

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Code: https://github.com/google-research/google-research/tree/master/fsq

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18459 2023-10-11 cs.LG cs.AI 57%

Diffusion Model is an Effective Planner and Data Synthesizer for Multi-Task Reinforcement Learning

Haoran He, Chenjia Bai, Kang Xu, Zhuoran Yang, Weinan Zhang, Dong Wang, Bin Zhao, Xuelong Li

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments Accepted by NeurIPS 2023. 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.08072 2023-10-11 eess.IV cs.CV cs.LG 57%

Two-stage MR Image Segmentation Method for Brain Tumors based on Attention Mechanism

Li Zhu, Jiawei Jiang, Lin Lu, Jin Li

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Some contributing authors are not signed

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05410 2023-10-10 cs.AI 57%

Causal Reasoning through Two Layers of Cognition for Improving Generalization in Visual Question Answering

Trang Nguyen, Naoaki Okazaki

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04929 2023-10-10 cs.CV cs.LG stat.ML 57%

DISCOVER: Making Vision Networks Interpretable via Competition and Dissection

Konstantinos P. Panousis, Sotirios Chatzis

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Accepted @ NeuIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03218 2023-10-06 cs.LG cs.AI stat.ML 57%

Learning Energy-Based Prior Model with Diffusion-Amortized MCMC

Peiyu Yu, Yaxuan Zhu, Sirui Xie, Xiaojian Ma, Ruiqi Gao, Song-Chun Zhu, Ying Nian Wu

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏