arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4965 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4965 篇

2404.04854 2024-04-09 cs.LG cs.AI cs.CR 57%

Contextual Chart Generation for Cyber Deception

David D. Nguyen, David Liebowitz, Surya Nepal, Salil S. Kanhere, Sharif Abuadbba

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

Comments 13 pages including references

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19964 2024-04-09 cs.CV cs.CY cs.LG 57%

FairRAG: Fair Human Generation via Fair Retrieval Augmentation

Robik Shrestha, Yang Zou, Qiuyu Chen, Zhiheng Li, Yusheng Xie, Siqi Deng

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01207 2024-04-09 cs.CV 57%

Towards a Simultaneous and Granular Identity-Expression Control in Personalized Face Generation

Renshuai Liu, Bowen Ma, Wei Zhang, Zhipeng Hu, Changjie Fan, Tangjie Lv, Yu Ding, Xuan Cheng

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03144 2024-04-05 cs.CV 57%

Diverse and Tailored Image Generation for Zero-shot Multi-label Classification

Kaixin Zhang, Zhixiang Yuan, Tao Huang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02527 2024-04-04 cs.CV 57%

Weakly-Supervised 3D Scene Graph Generation via Visual-Linguistic Assisted Pseudo-labeling

Xu Wang, Yifan Li, Qiudan Zhang, Wenhui Wu, Mark Junjie Li, Jianmin Jinag

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14985 2024-04-02 cs.CV 57%

UniHuman: A Unified Model for Editing Human Images in the Wild

Nannan Li, Qing Liu, Krishna Kumar Singh, Yilin Wang, Jianming Zhang, Bryan A. Plummer, Zhe Lin

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments Accepted to CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20079 2024-04-01 cs.CV 57%

SGD: Street View Synthesis with Gaussian Splatting and Diffusion Prior

Zhongrui Yu, Haoran Wang, Jinze Yang, Hanzhang Wang, Zeke Xie, Yunfeng Cai, Jiale Cao, Zhong Ji, Mingming Sun

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.05684 2024-03-29 cs.CV 57%

InterGen: Diffusion-based Multi-human Motion Generation under Complex Interactions

Han Liang, Wenqian Zhang, Wenxuan Li, Jingyi Yu, Lan Xu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments accepted by IJCV 2024

Journal ref Int J Comput Vis (2024) 1-21

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18036 2024-03-28 cs.CV 57%

Move as You Say, Interact as You Can: Language-guided Human Motion Generation with Scene Affordance

Zan Wang, Yixin Chen, Baoxiong Jia, Puhao Li, Jinlu Zhang, Jingze Zhang, Tengyu Liu, Yixin Zhu, Wei Liang, Siyuan Huang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments CVPR 2024; 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02649 2024-03-28 cs.CV 57%

Few-shot Learner Parameterization by Diffusion Time-steps

Zhongqi Yue, Pan Zhou, Richang Hong, Hanwang Zhang, Qianru Sun

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16222 2024-03-27 cs.AI 57%

Cyber-Security Knowledge Graph Generation by Hierarchical Nonnegative Matrix Factorization

Ryan Barron, Maksim E. Eren, Manish Bhattarai, Selma Wanna, Nicholas Solovyev, Kim Rasmussen, Boian S. Alexandrov, Charles Nicholas, Cynthia Matuszek

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

Comments Accepted at IEEE ISDFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15364 2024-03-25 cs.CL 57%

Towards Knowledge-Grounded Natural Language Understanding and Generation

Chenxi Whitehouse

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

Comments PhD Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15330 2024-03-25 cs.CV 57%

Selectively Informative Description can Reduce Undesired Embedding Entanglements in Text-to-Image Personalization

Jimyeong Kim, Jungwon Park, Wonjong Rhee

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Published at CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14944 2024-03-25 cs.CV 57%

CLIP-VQDiffusion : Langauge Free Training of Text To Image generation using CLIP and vector quantized diffusion model

Seungdae Han, Joohee Kim

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07214 2024-03-22 cs.CV 57%

Text-to-Image Diffusion Models are Great Sketch-Photo Matchmakers

Subhadeep Koley, Ayan Kumar Bhunia, Aneeshan Sain, Pinaki Nath Chowdhury, Tao Xiang, Yi-Zhe Song

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

Comments Accepted in CVPR 2024. Project page available at https://subhadeepkoley.github.io/DiffusionZSSBIR

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12906 2024-03-20 cs.CV 57%

TexDreamer: Towards Zero-Shot High-Fidelity 3D Human Texture Generation

Yufei Liu, Junwei Zhu, Junshu Tang, Shijie Zhang, Jiangning Zhang, Weijian Cao, Chengjie Wang, Yunsheng Wu, Dongjin Huang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Project Page: https://ggxxii.github.io/texdreamer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12037 2024-03-20 cs.CV 57%

MineDreamer: Learning to Follow Instructions via Chain-of-Imagination for Simulated-World Control

Enshen Zhou, Yiran Qin, Zhenfei Yin, Yuzhou Huang, Ruimao Zhang, Lu Sheng, Yu Qiao, Jing Shao

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Project page: https://sites.google.com/view/minedreamer/main

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16117 2024-03-20 cs.CV 57%

Predicated Diffusion: Predicate Logic-Based Attention Guidance for Text-to-Image Diffusion Models

Kota Sueyoshi, Takashi Matsubara

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments 20 pages, 16 figures, 6 tables, ~500 images, ~30MB

Journal ref The IEEE/CVF Computer Vision and Pattern Recognition Conference (CVPR) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16974 2024-03-20 cs.CV 57%

COLE: A Hierarchical Generation Framework for Multi-Layered and Editable Graphic Design

Peidong Jia, Chenxuan Li, Yuhui Yuan, Zeyu Liu, Yichao Shen, Bohan Chen, Xingru Chen, Yinglin Zheng, Dong Chen, Ji Li, Xiaodong Xie, Shanghang Zhang, Baining Guo

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Technical report. Project page: https://graphic-design-generation-github-io.vercel.app/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11643 2024-03-19 cs.CV cs.LG cs.RO 57%

Diffusion-Based Environment-Aware Trajectory Prediction

Theodor Westny, Björn Olofsson, Erik Frisk

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00390 2024-03-19 cs.CV 57%

InstructCV: Instruction-Tuned Text-to-Image Diffusion Models as Vision Generalists

Yulu Gan, Sungwoo Park, Alexander Schubert, Anthony Philippakis, Ahmed M. Alaa

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments ICLR 2024; Code is available at https://github.com/AlaaLab/InstructCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10004 2024-03-18 cs.CV 57%

ST-LDM: A Universal Framework for Text-Grounded Object Generation in Real Images

Xiangtian Xue, Jiasong Wu, Youyong Kong, Lotfi Senhadji, Huazhong Shu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17061 2024-03-15 cs.CV 57%

HumanGaussian: Text-Driven 3D Human Generation with Gaussian Splatting

Xian Liu, Xiaohang Zhan, Jiaxiang Tang, Ying Shan, Gang Zeng, Dahua Lin, Xihui Liu, Ziwei Liu

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Accepted by CVPR 2024, camera-ready version. Project Page: https://alvinliu0.github.io/projects/HumanGaussian

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.17175 2024-03-15 cs.CV 57%

TextField3D: Towards Enhancing Open-Vocabulary 3D Generation with Noisy Text Fields

Tianyu Huang, Yihan Zeng, Bowen Dong, Hang Xu, Songcen Xu, Rynson W. H. Lau, Wangmeng Zuo

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Accepted by ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17189 2024-03-13 cs.CV 57%

LayoutDiffusion: Controllable Diffusion Model for Layout-to-image Generation

Guangcong Zheng, Xianpan Zhou, Xuewei Li, Zhongang Qi, Ying Shan, Xi Li

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Accepted by CVPR2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00973 2024-03-05 cs.CV 57%

Intelligent Grimm -- Open-ended Visual Storytelling via Latent Diffusion Models

Chang Liu, Haoning Wu, Yujie Zhong, Xiaoyun Zhang, Yanfeng Wang, Weidi Xie

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments Accepted by CVPR 2024. Project Page: https://haoningwu3639.github.io/StoryGen_Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.01412 2024-03-05 cs.CV 57%

CAMANet: Class Activation Map Guided Attention Network for Radiology Report Generation

Jun Wang, Abhir Bhalerao, Terry Yin, Simon See, Yulan He

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

Comments Accepted to IEEE Journal of Biomedical and Health Informatics (IJBHI). 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00964 2024-03-01 cs.CV cs.LG 57%

Cocktail: Mixing Multi-Modality Controls for Text-Conditional Image Generation

Minghui Hu, Jianbin Zheng, Daqing Liu, Chuanxia Zheng, Chaoyue Wang, Dacheng Tao, Tat-Jen Cham

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Project Page: https://mhh0318.github.io/cocktail/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18092 2024-02-29 cs.CV 57%

Context-aware Talking Face Video Generation

Meidai Xuanyuan, Yuwang Wang, Honglei Guo, Qionghai Dai

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05572 2024-02-28 eess.IV cs.CV cs.LG 57%

A Simple and Robust Framework for Cross-Modality Medical Image Segmentation applied to Vision Transformers

Matteo Bastico, David Ryckelynck, Laurent Corté, Yannick Tillier, Etienne Decencière

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments This paper has been accepted in International Conference on Computer Vision Workshops (ICCVW) 2023

Journal ref 2023 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), Paris, France, 2023, pp. 4130-4140

详情

展开后加载摘要…

URL PDF HTML 收藏