arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86761 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3489 篇

2312.02963 2023-12-06 cs.CV 70%

MVHumanNet: A Large-scale Dataset of Multi-view Daily Dressing Human Captures

Zhangyang Xiong, Chenghong Li, Kenkun Liu, Hongjie Liao, Jianqiao Hu, Junyi Zhu, Shuliang Ning, Lingteng Qiu, Chongjie Wang, Shijie Wang, Shuguang Cui, Xiaoguang Han

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Project page: https://x-zhangyang.github.io/MVHumanNet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17971 2023-12-05 cs.CV 70%

GeoDream: Disentangling 2D and Geometric Priors for High-Fidelity and Consistent 3D Generation

Baorui Ma, Haoge Deng, Junsheng Zhou, Yu-Shen Liu, Tiejun Huang, Xinlong Wang

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Code and Demo: https://github.com/baaivision/GeoDream

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00375 2023-12-04 cs.CV 70%

Text-Guided 3D Face Synthesis -- From Generation to Editing

Yunjie Wu, Yapeng Meng, Zhipeng Hu, Lincheng Li, Haoqian Wu, Kun Zhou, Weiwei Xu, Xin Yu

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18654 2023-12-01 cs.CV cs.AI 70%

Detailed Human-Centric Text Description-Driven Large Scene Synthesis

Gwanghyun Kim, Dong Un Kang, Hoigi Seo, Hayeon Kim, Se Young Chun

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18064 2023-12-01 cs.CV 70%

GELDA: A generative language annotation framework to reveal visual biases in datasets

Krish Kabra, Kathleen M. Lewis, Guha Balakrishnan

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 21 pages, 15 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.01681 2023-12-01 cs.CV 70%

Dense Pixel-to-Pixel Harmonization via Continuous Image Representation

Jianqi Chen, Yilan Zhang, Zhengxia Zou, Keyan Chen, Zhenwei Shi

专题命中 文生图 :image editing(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15556 2023-11-30 cs.CV eess.IV 70%

PKU-I2IQA: An Image-to-Image Quality Assessment Database for AI Generated Images

Jiquan Yuan, Xinyan Cao, Changjin Li, Fanyi Yang, Jinlong Lin, Xixin Cao

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09084 2023-11-16 cs.CV 70%

Contrastive Transformer Learning with Proximity Data Generation for Text-Based Person Search

Hefeng Wu, Weifeng Chen, Zhibin Liu, Tianshui Chen, Zhiguang Chen, Liang Lin

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by IEEE T-CSVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14053 2023-11-14 cs.CV cs.LG 70%

Parts of Speech-Grounded Subspaces in Vision-Language Models

James Oldfield, Christos Tzelepis, Yannis Panagakis, Mihalis A. Nicolaou, Ioannis Patras

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07005 2023-11-10 cs.CV cs.CR 70%

AI-Generated Image Detection using a Cross-Attention Enhanced Dual-Stream Network

Ziyi Xi, Wenmin Huang, Kangkang Wei, Weiqi Luo, Peijia Zheng

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 8 pages, 41 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03716 2023-11-08 cs.CL cs.AI cs.CV 70%

LLM as an Art Director (LaDi): Using LLMs to improve Text-to-Media Generators

Allen Roush, Emil Zakirov, Artemiy Shirokov, Polina Lunina, Jack Gane, Alexander Duffy, Charlie Basil, Aber Whitcomb, Jim Benedetto, Chris DeWolfe

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 12 pages, System Demonstration/Industry paper. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.02541 2023-11-07 cs.CV cs.GT 70%

Catch Missing Details: Image Reconstruction with Frequency Augmented Variational Autoencoder

Xinmiao Lin, Yikang Li, Jenhao Hsiao, Chiuman Ho, Yu Kong

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted by CVPR 2023, code available at https://github.com/oppo-us-research/FA-VAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01361 2023-11-03 cs.CV cs.CL 70%

GPT-4V(ision) as a Generalist Evaluator for Vision-Language Tasks

Xinlu Zhang, Yujie Lu, Weizhi Wang, An Yan, Jun Yan, Lianke Qin, Heng Wang, Xifeng Yan, William Yang Wang, Linda Ruth Petzold

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14356 2023-11-01 cs.LG cs.CL cs.CV 70%

COCO-Counterfactuals: Automatically Constructed Counterfactual Examples for Image-Text Pairs

Tiep Le, Vasudev Lal, Phillip Howard

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2023 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15393 2023-10-31 cs.CV cs.AI 70%

LayoutGPT: Compositional Visual Planning and Generation with Large Language Models

Weixi Feng, Wanrong Zhu, Tsu-jui Fu, Varun Jampani, Arjun Akula, Xuehai He, Sugato Basu, Xin Eric Wang, William Yang Wang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16532 2023-10-26 cs.CV 70%

Learning Robust Deep Visual Representations from EEG Brain Recordings

Prajwal Singh, Dwip Dalal, Gautam Vashishtha, Krishna Miyapuram, Shanmuganathan Raman

专题命中 文生图 :image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted in WACV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16003 2023-10-25 cs.CV 70%

CVPR 2023 Text Guided Video Editing Competition

Jay Zhangjie Wu, Xiuyu Li, Difei Gao, Zhen Dong, Jinbin Bai, Aishani Singh, Xiaoyu Xiang, Youzeng Li, Zuwei Huang, Yuanxi Sun, Rui He, Feng Hu, Junhua Hu, Hai Huang, Hanyu Zhu, Xu Cheng, Jie Tang, Mike Zheng Shou, Kurt Keutzer, Forrest Iandola

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Project page: https://sites.google.com/view/loveucvpr23/track4

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13361 2023-10-23 cs.CV cs.AI cs.CL 70%

Bridging the Gap between Synthetic and Authentic Images for Multimodal Machine Translation

Wenyu Guo, Qingkai Fang, Dong Yu, Yang Feng

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted to EMNLP 2023 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04488 2023-10-17 cs.LG cs.AI cs.CV 70%

Rewarded soups: towards Pareto-optimal alignment by interpolating weights fine-tuned on diverse rewards

Alexandre Ramé, Guillaume Couairon, Mustafa Shukor, Corentin Dancette, Jean-Baptiste Gaya, Laure Soulier, Matthieu Cord

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17216 2023-10-16 cs.CL cs.CV cs.LG 70%

Generating Images with Multimodal Language Models

Jing Yu Koh, Daniel Fried, Ruslan Salakhutdinov

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments NeurIPS 2023. Project page: http://jykoh.com/gill

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06968 2023-10-12 cs.CV cs.LG 70%

ObjectComposer: Consistent Generation of Multiple Objects Without Fine-tuning

Alec Helbling, Evan Montoya, Duen Horng Chau

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02988 2023-10-05 cs.CV cs.AI 70%

Probing Intersectional Biases in Vision-Language Models with Counterfactual Examples

Phillip Howard, Avinash Madasu, Tiep Le, Gustavo Lujan Moreno, Vasudev Lal

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15564 2023-09-29 cs.LG cs.CL cs.CV 70%

Jointly Training Large Autoregressive Multimodal Models

Emanuele Aiello, Lili Yu, Yixin Nie, Armen Aghajanyan, Barlas Oguz

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.15181 2023-09-27 cs.CV 70%

DreamStone: Image as Stepping Stone for Text-Guided 3D Shape Generation

Zhengzhe Liu, Peng Dai, Ruihui Li, Xiaojuan Qi, Chi-Wing Fu

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14352 2023-09-21 cs.CV 70%

General Image-to-Image Translation with One-Shot Image Guidance

Bin Cheng, Zuhao Liu, Yunbo Peng, Yue Lin

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments accepted by ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10020 2023-09-20 cs.CV cs.CL 70%

Multimodal Foundation Models: From Specialists to General-Purpose Assistants

Chunyuan Li, Zhe Gan, Zhengyuan Yang, Jianwei Yang, Linjie Li, Lijuan Wang, Jianfeng Gao

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 119 pages, PDF file size 58MB; Tutorial website: https://vlp-tutorial.github.io/2023/

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.02190 2023-09-06 cs.CV cs.AI 70%

Exchanging-based Multimodal Fusion with Transformer

Renyu Zhu, Chengcheng Han, Yong Qian, Qiushi Sun, Xiang Li, Ming Gao, Xuezhi Cao, Yunsen Xian

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.15472 2023-08-30 cs.CV 70%

Learning Modulated Transformation in GANs

Ceyuan Yang, Qihang Zhang, Yinghao Xu, Jiapeng Zhu, Yujun Shen, Bo Dai

专题命中 文生图 :image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10718 2023-08-24 cs.CR cs.CV 70%

Backdooring Textual Inversion for Concept Censorship

Yutong Wu, Jie Zhang, Florian Kerschbaum, Tianwei Zhang

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11473 2023-08-23 cs.CV cs.AI 70%

IT3D: Improved Text-to-3D Generation with Explicit View Synthesis

Yiwen Chen, Chi Zhang, Xiaofeng Yang, Zhongang Cai, Gang Yu, Lei Yang, Guosheng Lin

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Project Page: https://github.com/buaacyw/IT3D-text-to-3D

详情

展开后加载摘要…

URL PDF HTML 收藏