arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-10-28 至 2025-10-28 共收录 10 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 10 篇

2411.16503 2025-10-28 cs.CV 90%

Noise Diffusion for Enhancing Semantic Faithfulness in Text-to-Image Synthesis

Boming Miao, Chunxiao Li, Xiaoxiao Wang, Andi Zhang, Rui Sun, Zizhe Wang, Yao Zhu

机构 * Beijing Normal University(北京师范大学) University of Chinese Academy of Sciences(中国科学院大学) University of Manchester(曼彻斯特大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

专题命中 文生图 :diffusion(title,abstract);text-to-image(title);image synthesis(title);分类 cs.CV

Comments Updated author formatting; no substantive changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23574 2025-10-28 cs.CV 89%

More Than Generation: Unifying Generation and Depth Estimation via Text-to-Image Diffusion Models

Hongkai Lin, Dingkang Liang, Mingyang Du, Xin Zhou, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025. The code will be made available at https://github.com/H-EmbodVis/MERGE

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22194 2025-10-28 cs.CV cs.LG 88%

ORIGEN: Zero-Shot 3D Orientation Grounding in Text-to-Image Generation

Yunhong Min, Daehyeon Choi, Kyeongmin Yeo, Jihyun Lee, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

Comments Project Page: https://origen2025.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21821 2025-10-28 cs.CV cs.AI 79%

Prompt fidelity of ChatGPT4o / Dall-E3 text-to-image visualisations

Dirk HR Spennemann

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22970 2025-10-28 cs.CV 70%

VALA: Learning Latent Anchors for Training-Free and Temporally Consistent

Zhangkai Wu, Xuhui Fan, Zhongyuan Xie, Kaize Shi, Longbing Cao

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22004 2025-10-28 cs.CV 70%

LiteDiff

Ruchir Namjoshi, Nagasai Thadishetty, Vignesh Kumar, Hemanth Venkateshwara

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10776 2025-10-28 cs.CR cs.AI 67%

ME: Trigger Element Combination Backdoor Attack on Copyright Infringement

Feiyu Yang, Siyuan Liang, Aishan Liu, Dacheng Tao

专题命中 文生图 :text-to-image(abstract);diffusion(abstract)

Comments Finding unfinished issue in this work , still refining

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07555 2025-10-28 cs.CV cs.AI 57%

Synthesize Privacy-Preserving High-Resolution Images via Private Textual Intermediaries

Haoxiang Wang, Zinan Lin, Da Yu, Huishuai Zhang

机构 * Peking University(北京大学) Microsoft Research(微软研究院) Google Research(谷歌研究院) Wangxuan Institute of Computer Technology, Peking University(计算机技术研究院,北京大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09744 2025-10-28 cs.CV 57%

RealCustom++: Representing Images as Real Textual Word for Real-Time Customization

Zhendong Mao, Mengqi Huang, Fei Ding, Mingcong Liu, Qian He, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) ByteDance Inc(字节跳动公司)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments 18 pages

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08010 2025-10-28 cs.CV cs.AI 57%

Vision Transformers Don't Need Trained Registers

Nick Jiang, Amil Dravid, Alexei Efros, Yossi Gandelsman

机构 * UC Berkeley(伯克利大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Project page and code: https://avdravid.github.io/test-time-registers. Accepted to NeurIPS '25 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏