arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86761 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3489 篇

2501.01156 2025-03-12 cs.CV cs.AI cs.LG 70%

TexAVi: Generating Stereoscopic VR Video Clips from Text Descriptions

Vriksha Srihari, R. Bhavya, Shruti Jayaraman, V. Mary Anita Rajam

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Co-authors do not consent to publishing on Arxiv

Journal ref TexAVi: Generating Stereoscopic VR Video Clips from Text Descriptions, 2024 IEEE International Conference on Computer Vision and Machine Intelligence (CVMI), Prayagraj, India, 2024, pp. 1-6

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07209 2025-03-11 cs.CV cs.LG 70%

Synthetic Lung X-ray Generation through Cross-Attention and Affinity Transformation

Ruochen Pi, Lianlei Shan

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06956 2025-03-11 cs.CV 70%

LatexBlend: Scaling Multi-concept Customized Generation with Latent Textual Blending

Jian Jin, Zhenbo Yu, Yang Shen, Zhenyong Fu, Jian Yang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments cvpr2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05665 2025-03-10 cs.CV cs.LG 70%

AIM-Fair: Advancing Algorithmic Fairness via Selectively Fine-Tuning Biased Models with Contextual Synthetic Data

Zengqun Zhao, Ziquan Liu, Yu Cao, Shaogang Gong, Ioannis Patras

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted at CVPR 2025. Github: https://github.com/zengqunzhao/AIM-Fair. Project page: https://zengqunzhao.github.io/AIMFair

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00962 2025-03-10 cs.CV cs.CY cs.LG 70%

OASIS Uncovers: High-Quality T2I Models, Same Old Stereotypes

Sepehr Dehdashtian, Gautam Sreekumar, Vishnu Naresh Boddeti

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted as a Spotlight paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03236 2025-03-06 cs.HC cs.CV 70%

GenColor: Generative Color-Concept Association in Visual Design

Yihan Hou, Xingchen Zeng, Yusong Wang, Manling Yang, Xiaojiao Chen, Wei Zeng

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 19 pages, 16 figures. Accepted at CHI Conference on Human Factors in Computing Systems (CHI'25), April 26-May 1, 2025, Yokohama, Japan

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03204 2025-03-06 cs.CV 70%

Find Matching Faces Based On Face Parameters

Setu A. Bhatt, Harshadkumar B. Prajapati, Vipul K. Dabhi, Ankush Tyagi

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00811 2025-03-04 cs.CV 70%

Evaluating and Predicting Distorted Human Body Parts for Generated Images

Lu Ma, Kaibo Cao, Hao Liang, Jiaxin Lin, Zhuang Li, Yuhong Liu, Jihong Zhang, Wentao Zhang, Bin Cui

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19842 2025-03-04 cs.CV 70%

CLIP Under the Microscope: A Fine-Grained Analysis of Multi-Object Representation

Reza Abbasi, Ali Nazari, Aminreza Sefid, Mohammadali Banayeeanzade, Mohammad Hossein Rohban, Mahdieh Soleymani Baghshah

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10781 2025-02-28 cs.CV cs.LG 70%

Bag of Design Choices for Inference of High-Resolution Masked Generative Transformer

Shitong Shao, Zikai Zhou, Tian Ye, Lichen Bai, Zhiqiang Xu, Zeke Xie

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06723 2025-02-28 cs.CV cs.AI cs.LG 70%

Graph-Based Captioning: Enhancing Visual Descriptions by Interconnecting Region Captions

Yu-Guan Hsieh, Cheng-Yu Hsieh, Shih-Ying Yeh, Louis Béthune, Hadi Pour Ansari, Pavan Kumar Anasosalu Vasu, Chun-Liang Li, Ranjay Krishna, Oncel Tuzel, Marco Cuturi

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 59 pages, 42 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03200 2025-02-28 cs.LG cs.CV 70%

Future-Proofing Class-Incremental Learning

Quentin Jodelet, Xin Liu, Yin Jun Phua, Tsuyoshi Murata

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments The version of record of this article, first published in "Machine Vision and Applications", is available online at Publisher's website: https://doi.org/10.1007/s00138-024-01635-y

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16915 2025-02-25 cs.CV 70%

Multi-Dimensional Quality Assessment for Text-to-3D Assets: Dataset and Model

Kang Fu, Huiyu Duan, Zicheng Zhang, Xiaohong Liu, Xiongkuo Min, Jia Wang, Guangtao Zhai

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03631 2025-02-21 cs.CV 70%

Robust Concept Erasure Using Task Vectors

Minh Pham, Kelly O. Marshall, Chinmay Hegde, Niv Cohen

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13855 2025-02-20 cs.CV 70%

MagicGeo: Training-Free Text-Guided Geometric Diagram Generation

Junxiao Wang, Ting Zhang, Heng Yu, Jingdong Wang, Hua Huang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07516 2025-02-17 eess.IV cs.AI cs.CV cs.LG 70%

The Devil is in the Prompts: De-Identification Traces Enhance Memorization Risks in Synthetic Chest X-Ray Generation

Raman Dutt

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09611 2025-02-14 cs.LG cs.CV 70%

Designing a Conditional Prior Distribution for Flow-Based Generative Models

Noam Issachar, Mohammad Salama, Raanan Fattal, Sagie Benaim

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04896 2025-02-11 cs.CV 70%

Goku: Flow Based Video Generative Foundation Models

Shoufa Chen, Chongjian Ge, Yuqi Zhang, Yida Zhang, Fengda Zhu, Hao Yang, Hongxiang Hao, Hui Wu, Zhichao Lai, Yifei Hu, Ting-Che Lin, Shilong Zhang, Fu Li, Chuan Li, Xing Wang, Yanghua Peng, Peize Sun, Ping Luo, Yi Jiang, Zehuan Yuan, Bingyue Peng, Xiaobing Liu

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Demo: https://saiyan-world.github.io/goku/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02555 2025-02-06 eess.IV cs.CV 70%

AAD-DCE: An Aggregated Multimodal Attention Mechanism for Early and Late Dynamic Contrast Enhanced Prostate MRI Synthesis

Divya Bharti, Sriprabha Ramanarayanan, Sadhana S, Kishore Kumar M, Keerthi Ram, Harsh Agarwal, Ramesh Venkatesan, Mohanasankar Sivaprakasam

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted at ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17811 2025-01-30 cs.AI cs.CL cs.CV 70%

Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling

Xiaokang Chen, Zhiyu Wu, Xingchao Liu, Zizheng Pan, Wen Liu, Zhenda Xie, Xingkai Yu, Chong Ruan

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Research paper. arXiv admin note: text overlap with arXiv:2410.13848

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16612 2025-01-29 cs.CV 70%

CascadeV: An Implementation of Wurstchen Architecture for Video Generation

Wenfeng Lin, Jiangchuan Wei, Boyuan Liu, Yichen Zhang, Shiyue Yan, Mingyu Guo

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13040 2025-01-23 cs.CV cs.LG 70%

Analysis of Classifier-Free Guidance Weight Schedulers

Xi Wang, Nicolas Dufour, Nefeli Andreou, Marie-Paule Cani, Victoria Fernandez Abrevaya, David Picard, Vicky Kalogeiton

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Journal ref Transactions on Machine Learning Research, 2835-8856, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12381 2025-01-22 cs.CV cs.LG 70%

Parallel Sequence Modeling via Generalized Spatial Propagation Network

Hongjun Wang, Wonmin Byeon, Jiarui Xu, Jinwei Gu, Ka Chun Cheung, Xiaolong Wang, Kai Han, Jan Kautz, Sifei Liu

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Project page: http://whj363636.github.io/GSPN/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04884 2025-01-22 cs.CV cs.AI 70%

Patch is Enough: Naturalistic Adversarial Patch against Vision-Language Pre-training Models

Dehong Kong, Siyuan Liang, Xiaopeng Zhu, Yuansheng Zhong, Wenqi Ren

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments accepted by Visual Intelligence

Journal ref Visual Intelligence, 2024, Vol 2, article no.17

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05184 2025-01-03 cs.CV 70%

The Unmet Promise of Synthetic Training Images: Using Retrieved Real Images Performs Better

Scott Geng, Cheng-Yu Hsieh, Vivek Ramanujan, Matthew Wallingford, Chun-Liang Li, Pang Wei Koh, Ranjay Krishna

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Correspondence to sgeng at cs dot washington dot edu. RK and PWK equally advised the project

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19978 2024-12-31 cs.CV 70%

MAKIMA: Tuning-free Multi-Attribute Open-domain Video Editing via Mask-Guided Attention Modulation

Haoyu Zheng, Wenqiao Zhang, Zheqi Lv, Yu Zhong, Yang Dai, Jianxiang An, Yongliang Shen, Juncheng Li, Dongping Zhang, Siliang Tang, Yueting Zhuang

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17251 2024-12-31 cs.CV cs.CL 70%

Altogether: Image Captioning via Re-aligning Alt-text

Hu Xu, Po-Yao Huang, Xiaoqing Ellen Tan, Ching-Feng Yeh, Jacob Kahn, Christine Jou, Gargi Ghosh, Omer Levy, Luke Zettlemoyer, Wen-tau Yih, Shang-Wen Li, Saining Xie, Christoph Feichtenhofer

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments accepted by EMNLP 2024; Meta CLIP 1.2 Data Engine

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18653 2024-12-30 cs.CV cs.AI cs.LG 70%

1.58-bit FLUX

Chenglin Yang, Celong Liu, Xueqing Deng, Dongwon Kim, Xing Mei, Xiaohui Shen, Liang-Chieh Chen

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18404 2024-12-25 cs.CV cs.LG 70%

Extract Free Dense Misalignment from CLIP

JeongYeon Nam, Jinbae Im, Wonjae Kim, Taeho Kil

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 16 pages, 14 figures, AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16207 2024-12-24 cs.CV cs.CY 70%

Skull-to-Face: Anatomy-Guided 3D Facial Reconstruction and Editing

Yongqing Liang, Congyi Zhang, Junli Zhao, Wenping Wang, Xin Li

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments This paper was accepted by IEEE Transactions on Visualization and Computer Graphics. Project page: https://xmlyqing00.github.io/skull-to-face-page

详情

展开后加载摘要…

URL PDF HTML 收藏