arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3489 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3489 篇

2404.05666 2024-04-09 cs.CV 70%

YaART: Yet Another ART Rendering Technology

Sergey Kastryulin, Artem Konev, Alexander Shishenya, Eugene Lyapustin, Artem Khurshudov, Alexander Tselousov, Nikita Vinokurov, Denis Kuznedelev, Alexander Markovich, Grigoriy Livshits, Alexey Kirillov, Anastasiia Tabisheva, Liubov Chubarova, Marina Kaminskaia, Alexander Ustyuzhanin, Artemii Shvetsov, Daniil Shlenskii, Valerii Startsev, Dmitrii Kornilov, Mikhail Romanov, Artem Babenko, Sergei Ovcharenko, Valentin Khrulkov

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Prompts and additional information are available on the project page, see https://ya.ru/ai/art/paper-yaart-v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06704 2024-04-09 cs.CV 70%

SIFU: Side-view Conditioned Implicit Function for Real-world Usable Clothed Human Reconstruction

Zechuan Zhang, Zongxin Yang, Yi Yang

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by CVPR 2024; Project page https://river-zhang.github.io/SIFU-projectpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19964 2024-04-09 cs.CV cs.CY cs.LG 70%

FairRAG: Fair Human Generation via Fair Retrieval Augmentation

Robik Shrestha, Yang Zou, Qiuyu Chen, Zhiheng Li, Yusheng Xie, Siqi Deng

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12468 2024-04-03 cs.CV 70%

MaskINT: Video Editing via Interpolative Non-autoregressive Masked Transformers

Haoyu Ma, Shahin Mahdizadehaghdam, Bichen Wu, Zhipeng Fan, Yuchao Gu, Wenliang Zhao, Lior Shapira, Xiaohui Xie

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15789 2024-03-26 cs.CV 70%

In-Context Matting

He Guo, Zixuan Ye, Zhiguo Cao, Hao Lu

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to CVPR 2024. Code is available at https://github.com/tiny-smart/in-context-matting

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14966 2024-03-25 cs.CV 70%

DreamFlow: High-Quality Text-to-3D Generation by Approximating Probability Flow

Kyungmin Lee, Kihyuk Sohn, Jinwoo Shin

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12038 2024-03-25 cs.CL cs.CV 70%

Large Multilingual Models Pivot Zero-Shot Multimodal Learning across Languages

Jinyi Hu, Yuan Yao, Chongyi Wang, Shan Wang, Yinxu Pan, Qianyu Chen, Tianyu Yu, Hanghao Wu, Yue Zhao, Haoye Zhang, Xu Han, Yankai Lin, Jiao Xue, Dahai Li, Zhiyuan Liu, Maosong Sun

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments https://github.com/OpenBMB/VisCPM.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12962 2024-03-20 cs.CV 70%

FRESCO: Spatial-Temporal Correspondence for Zero-Shot Video Translation

Shuai Yang, Yifan Zhou, Ziwei Liu, Chen Change Loy

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments CVPR 24, Code: https://github.com/williamyang1991/FRESCO, Project: https://www.mmlab-ntu.com/project/fresco/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05523 2024-03-12 cs.CV 70%

Beyond Finite Data: Towards Data-free Out-of-distribution Generalization via Extrapolation

Yijiang Li, Sucheng Ren, Weipeng Deng, Yuzhi Xu, Ying Gao, Edith Ngai, Haohan Wang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Preprint. Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08882 2024-03-12 cs.CV 70%

Neural Video Fields Editing

Shuzhou Yang, Chong Mou, Jiwen Yu, Yuhan Wang, Xiandong Meng, Jian Zhang

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04575 2024-03-07 cs.CV cs.AI 70%

Let's Go Shopping (LGS) -- Web-Scale Image-Text Dataset for Visual Concept Understanding

Yatong Bai, Utsav Garg, Apaar Shanker, Haoming Zhang, Samyak Parajuli, Erhan Bas, Isidora Filipovic, Amelia N. Chu, Eugenia D Fomitcheva, Elliot Branson, Aerin Kim, Somayeh Sojoudi, Kyunghyun Cho

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05922 2024-03-04 cs.CV 70%

FLATTEN: optical FLow-guided ATTENtion for consistent text-to-video editing

Yuren Cong, Mengmeng Xu, Christian Simon, Shoufa Chen, Jiawei Ren, Yanping Xie, Juan-Manuel Perez-Rua, Bodo Rosenhahn, Tao Xiang, Sen He

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by ICLR2024. Project page: https://flatten-video-editing.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09872 2024-02-16 cs.CV 70%

Social Reward: Evaluating and Enhancing Generative AI through Million-User Feedback from an Online Creative Community

Arman Isajanyan, Artur Shatveryan, David Kocharyan, Zhangyang Wang, Humphrey Shi

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments 16 pages with 10 figures, accepted at ICLR 2024 as a spotlight, codes can be accessed at https://github.com/Picsart-AI-Research/Social-Reward

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03705 2024-02-07 cs.CV cs.CR 70%

FoolSDEdit: Deceptively Steering Your Edits Towards Targeted Attribute-aware Distribution

Qi Zhou, Dongxia Wang, Tianlin Li, Zhihong Xu, Yang Liu, Kui Ren, Wenhai Wang, Qing Guo

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14330 2024-02-07 cs.CV cs.AI cs.CL 70%

DirecT2V: Large Language Models are Frame-Level Directors for Zero-Shot Text-to-Video Generation

Susung Hong, Junyoung Seo, Heeseong Shin, Sunghwan Hong, Seungryong Kim

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments The code and demo will be available at https://github.com/KU-CVLAB/DirecT2V

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03610 2024-02-05 cs.CV cs.AI cs.CL 70%

The Role of Data Curation in Image Captioning

Wenyan Li, Jonas F. Lotz, Chen Qiu, Desmond Elliott

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07973 2024-02-02 eess.IV cs.CV 70%

M3Dsynth: A dataset of medical 3D images with AI-generated local manipulations

Giada Zingarini, Davide Cozzolino, Riccardo Corvi, Giovanni Poggi, Luisa Verdoliva

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15975 2024-01-30 cs.CV 70%

StableIdentity: Inserting Anybody into Anywhere at First Sight

Qinghe Wang, Xu Jia, Xiaomin Li, Taiqing Li, Liqian Ma, Yunzhi Zhuge, Huchuan Lu

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.08044 2024-01-22 cs.CV 70%

Benchmarking Robustness of Multimodal Image-Text Models under Distribution Shift

Jielin Qiu, Yi Zhu, Xingjian Shi, Florian Wenzel, Zhiqiang Tang, Ding Zhao, Bo Li, Mu Li

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted by Journal of Data-centric Machine Learning Research (DMLR) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09763 2024-01-19 cs.CV cs.AI 70%

CLIP Model for Images to Textual Prompts Based on Top-k Neighbors

Xin Zhang, Xin Zhang, YeMing Cai, Tianzhi Jia

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments CLIP model, KNN, image-to-prompts

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08567 2024-01-17 cs.LG cs.AI cs.CL cs.CV 70%

Connect, Collapse, Corrupt: Learning Cross-Modal Tasks with Uni-Modal Data

Yuhui Zhang, Elaine Sui, Serena Yeung-Levy

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Published at ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07727 2024-01-17 cs.CV 70%

HexaGen3D: StableDiffusion is just one step away from Fast and Diverse Text-to-3D Generation

Antoine Mercier, Ramin Nakhli, Mahesh Reddy, Rajeev Yasarla, Hong Cai, Fatih Porikli, Guillaume Berger

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 9 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.08455 2024-01-11 cs.CV 70%

Spatial Steerability of GANs via Self-Supervision from Discriminator

Jianyuan Wang, Lalit Bhagat, Ceyuan Yang, Yinghao Xu, Yujun Shen, Hongdong Li, Bolei Zhou

专题命中 文生图 :image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments This manuscript is a journal extension of our previous conference work (arXiv:2112.00718), submitted to TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02473 2024-01-08 cs.CV 70%

VASE: Object-Centric Appearance and Shape Manipulation of Real Videos

Elia Peruzzo, Vidit Goel, Dejia Xu, Xingqian Xu, Yifan Jiang, Zhangyang Wang, Humphrey Shi, Nicu Sebe

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Project Page https://helia95.github.io/vase-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12856 2023-12-21 cs.CV cs.AI cs.LG 70%

SkyScript: A Large and Semantically Diverse Vision-Language Dataset for Remote Sensing

Zhecheng Wang, Rajanie Prabha, Tianyuan Huang, Jiajun Wu, Ram Rajagopal

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted by AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10163 2023-12-19 cs.CV cs.LG 70%

Towards the Unification of Generative and Discriminative Visual Foundation Model: A Survey

Xu Liu, Tong Zhou, Yuanxin Wang, Yuping Wang, Qinjingwen Cao, Weizhi Du, Yonghuan Yang, Junjun He, Yu Qiao, Yiqing Shen

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09251 2023-12-15 cs.CV 70%

VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation

Jinguo Zhu, Xiaohan Ding, Yixiao Ge, Yuying Ge, Sijie Zhao, Hengshuang Zhao, Xiaohua Wang, Ying Shan

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08885 2023-12-15 cs.CV 70%

SceneWiz3D: Towards Text-guided 3D Scene Composition

Qihang Zhang, Chaoyang Wang, Aliaksandr Siarohin, Peiye Zhuang, Yinghao Xu, Ceyuan Yang, Dahua Lin, Bolei Zhou, Sergey Tulyakov, Hsin-Ying Lee

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Project page: https://zqh0253.github.io/SceneWiz3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08094 2023-12-14 cs.CV 70%

3DGEN: A GAN-based approach for generating novel 3D models from image data

Antoine Schnepf, Flavian Vasile, Ugo Tanielian

专题命中 文生图 :image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments Submitted to NeurIPS 2022 Machine Learning for Creativity and Design Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04780 2023-12-11 cs.CV cs.AI 70%

Fine-Tuning InstructPix2Pix for Advanced Image Colorization

Zifeng An, Zijing Xu, Eric Fan, Qi Cao

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏