arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86761 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3489 篇

2312.13663 2024-07-16 cs.CV 70%

Free-Editor: Zero-shot Text-driven 3D Scene Editing

Nazmul Karim, Hasan Iqbal, Umar Khalid, Jing Hua, Chen Chen

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09499 2024-07-16 cs.CV cs.AI cs.LG stat.ML 70%

Self-Consuming Generative Models with Curated Data Provably Optimize Human Preferences

Damien Ferbach, Quentin Bertrand, Avishek Joey Bose, Gauthier Gidel

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09622 2024-07-15 cs.CV 70%

Glyph-ByT5: A Customized Text Encoder for Accurate Visual Text Rendering

Zeyu Liu, Weicong Liang, Zhanhao Liang, Chong Luo, Ji Li, Gao Huang, Yuhui Yuan

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments ECCV 2024, 19 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10762 2024-07-12 cs.CV 70%

Deep Image Fingerprint: Towards Low Budget Synthetic Image Detection and Model Lineage Analysis

Sergey Sinitsa, Ohad Fried

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06817 2024-07-10 cs.CV 70%

AstroSpy: On detecting Fake Images in Astronomy via Joint Image-Spectral Representations

Mohammed Talha Alam, Raza Imam, Mohsen Guizani, Fakhri Karray

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12592 2024-06-19 cs.CV 70%

Unmasking the Veil: An Investigation into Concept Ablation for Privacy and Copyright Protection in Images

Shivank Garg, Manyana Tiwari

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11331 2024-06-18 cs.CV cs.IR cs.LG 70%

They're All Doctors: Synthesizing Diverse Counterfactuals to Mitigate Associative Bias

Salma Abdel Magid, Jui-Hsien Wang, Kushal Kafle, Hanspeter Pfister

专题命中 文生图 :text-to-image(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08798 2024-06-14 cs.CV 70%

FouRA: Fourier Low Rank Adaptation

Shubhankar Borse, Shreya Kadambi, Nilesh Prasad Pandey, Kartikeya Bhardwaj, Viswanath Ganapathy, Sweta Priyadarshi, Risheek Garrepalli, Rafael Esteves, Munawar Hayat, Fatih Porikli

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07699 2024-06-13 cs.CV cs.AI 70%

CUPID: Contextual Understanding of Prompt-conditioned Image Distributions

Yayan Zhao, Mingwei Li, Matthew Berger

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07502 2024-06-12 cs.CV cs.CL 70%

Image Textualization: An Automatic Framework for Creating Accurate and Detailed Image Descriptions

Renjie Pi, Jianshu Zhang, Jipeng Zhang, Rui Pan, Zhekai Chen, Tong Zhang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06352 2024-06-11 cs.CV 70%

Latent Directions: A Simple Pathway to Bias Mitigation in Generative AI

Carolina Lopez Olmos, Alexandros Neophytou, Sunando Sengupta, Dim P. Papadopoulos

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted at CVPR workshop 2024, proceedings of ReGenAI: First Workshop on Responsible Generative AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05432 2024-06-11 cs.CV 70%

Regularized Training with Generated Datasets for Name-Only Transfer of Vision-Language Models

Minho Park, Sunghyun Park, Jooyeol Yun, Jaegul Choo

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07750 2024-06-10 cs.CV cs.AI 70%

Synth$^2$: Boosting Visual-Language Models with Synthetic Captions and Image Embeddings

Sahand Sharifzadeh, Christos Kaplanis, Shreya Pathak, Dharshan Kumaran, Anastasija Ilic, Jovana Mitrovic, Charles Blundell, Andrea Banino

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16277 2024-06-04 cs.CL cs.AI cs.CV cs.LG 70%

Picturing Ambiguity: A Visual Twist on the Winograd Schema Challenge

Brendan Park, Madeline Janecek, Naser Ezzati-Jivan, Yifeng Li, Ali Emami

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 9 pages (excluding references), accepted to ACL 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20364 2024-06-03 cs.CV cs.AI cs.RO 70%

Learning 3D Robotics Perception using Inductive Priors

Muhammad Zubair Irshad

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Georgia Tech Ph.D. Thesis, December 2023. For more details: https://zubairirshad.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16501 2024-05-28 cs.CV 70%

User-Friendly Customized Generation with Multi-Modal Prompts

Linhao Zhong, Yan Hong, Wentao Chen, Binglin Zhou, Yiyi Zhang, Jianfu Zhang, Liqing Zhang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12852 2024-05-27 eess.IV cs.CV 70%

Generative Enhancement for 3D Medical Images

Lingting Zhu, Noel Codella, Dongdong Chen, Zhenchao Jin, Lu Yuan, Lequan Yu

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12425 2024-05-24 cs.CV cs.CL cs.LG 70%

The Neglected Tails in Vision-Language Models

Shubham Parashar, Zhiqiu Lin, Tian Liu, Xiangjue Dong, Yanan Li, Deva Ramanan, James Caverlee, Shu Kong

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Project Page: https://shubhamprshr27.github.io/neglected-tails-of-vlms/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12742 2024-05-22 cs.CV 70%

Multi-Subject Personalization

Arushi Jain, Shubham Paliwal, Monika Sharma, Vikram Jamwal, Lovekesh Vig

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 2023 Conference on Neural Information Processing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.13696 2024-05-17 cs.CV cs.AI eess.IV 70%

What Does DALL-E 2 Know About Radiology?

Lisa C. Adams, Felix Busch, Daniel Truhn, Marcus R. Makowski, Hugo JWL. Aerts, Keno K. Bressem

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 4 Figures

Journal ref J Med Internet Res 2023;25:e43110

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05222 2024-05-09 cs.CV 70%

Emu: Generative Pretraining in Multimodality

Quan Sun, Qiying Yu, Yufeng Cui, Fan Zhang, Xiaosong Zhang, Yueze Wang, Hongcheng Gao, Jingjing Liu, Tiejun Huang, Xinlong Wang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted to ICLR 2024. Code and Models: https://github.com/baaivision/Emu

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01434 2024-05-03 cs.CV 70%

StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation

Yupeng Zhou, Daquan Zhou, Ming-Ming Cheng, Jiashi Feng, Qibin Hou

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00791 2024-05-03 cs.CV cs.AI 70%

Obtaining Favorable Layouts for Multiple Object Generation

Barak Battash, Amit Rozner, Lior Wolf, Ofir Lindenbaum

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19753 2024-05-01 cs.CV cs.AI cs.CL cs.LG 70%

DOCCI: Descriptions of Connected and Contrasting Images

Yasumasa Onoe, Sunayana Rane, Zachary Berger, Yonatan Bitton, Jaemin Cho, Roopal Garg, Alexander Ku, Zarana Parekh, Jordi Pont-Tuset, Garrett Tanzer, Su Wang, Jason Baldridge

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.08832 2024-04-26 cs.CV 70%

Contrasting Intra-Modal and Ranking Cross-Modal Hard Negatives to Enhance Visio-Linguistic Compositional Understanding

Le Zhang, Rabiul Awal, Aishwarya Agrawal

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10874 2024-04-25 cs.CV 70%

Swap Attention in Spatiotemporal Diffusions for Text-to-Video Generation

Wenjing Wang, Huan Yang, Zixi Tuo, Huiguo He, Junchen Zhu, Jianlong Fu, Jiaying Liu

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16388 2024-04-19 cs.CV 70%

Exposing Image Splicing Traces in Scientific Publications via Uncertainty-guided Refinement

Xun Lin, Wenzhong Tang, Haoran Wang, Yizhong Liu, Yakun Ju, Shuai Wang, Zitong Yu

专题命中 文生图 :inpainting(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00094 2024-04-16 cs.CV 70%

Generating Enhanced Negatives for Training Language-Based Object Detectors

Shiyu Zhao, Long Zhao, Vijay Kumar B. G, Yumin Suh, Dimitris N. Metaxas, Manmohan Chandraker, Samuel Schulter

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to CVPR 2024. The supplementary document included

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17205 2024-04-15 cs.CV 70%

EFHQ: Multi-purpose ExtremePose-Face-HQ dataset

Trung Tuan Dao, Duc Hong Vu, Cuong Pham, Anh Tran

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Project Page: https://bomcon123456.github.io/efhq/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00825 2024-04-11 cs.CV cs.AI 70%

SocialCounterfactuals: Probing and Mitigating Intersectional Social Biases in Vision-Language Models with Counterfactual Examples

Phillip Howard, Avinash Madasu, Tiep Le, Gustavo Lujan Moreno, Anahita Bhiwandiwalla, Vasudev Lal

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to CVPR 2024. arXiv admin note: text overlap with arXiv:2310.02988

详情

展开后加载摘要…

URL PDF HTML 收藏