arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-16 至 2025-12-16 共收录 9 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 9 篇

2512.12501 2025-12-16 cs.AI 89%

SafeGen: Embedding Ethical Safeguards in Text-to-Image Generation

SafeGen: 在文本到图像生成中嵌入伦理保障

Dang Phuong Nam, Nguyen Kieu, Pham Thanh Hieu

机构 * Posts and Telecommunications Institute of Technology(电信技术研究所)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract)

AI总结 SafeGen通过整合BGE-M3和Hyper-SD,实现文本到图像生成中的伦理保障,有效过滤有害提示并生成高质量图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19791 2025-12-16 cs.CV 87%

Color Bind: Exploring Color Perception in Text-to-Image Models

Color Bind: 探索文本到图像模型中的颜色感知

Shay Shomer-Chai, Wenxuan Peng, Bharath Hariharan, Hadar Averbuch-Elor

机构 * Tel Aviv University(特拉维夫大学) Cornell University(康奈尔大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);image editing(abstract)

AI总结 本文提出了一种专门的图像编辑技术,用于解决多对象提示中颜色属性的语义对齐问题,并在多种指标上提升了性能。

Comments Project webpage: https://tau-vailab.github.io/color-edit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16763 2025-12-16 cs.CV 86%

Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation

自奖励的大型视觉-语言模型用于优化文本到图像生成中的提示

Hongji Yang, Yucheng Zhou, Wencheng Han, Jianbing Shen

机构 * University of Macau(澳门大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 本文提出了一种自奖励的大型视觉-语言模型框架,用于优化文本到图像生成中的提示,通过统一求解器和奖励模型实现自我改进,实验表明其优于其他方法。

Comments Accepted by ACL2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19534 2025-12-16 cs.CV cs.LG 83%

QUOTA: Quantifying Objects with Text-to-Image Models for Any Domain

QUOTA: 通过文本到图像模型对任意领域的对象进行量化

Wenfang Sun, Yingjun Du, Gaowen Liu, Yefeng Zheng, Cees G. M. Snoek

机构 * University of Amsterdam(阿姆斯特丹大学) Cisco Research(思科研究) Westlake University(西湖大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 QUOTA通过双循环元学习策略,实现无需重新训练即可在任意领域中高效量化对象数量。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13427 2025-12-16 cs.CV cs.LG 79%

MineTheGap: Automatic Mining of Biases in Text-to-Image Models

MineTheGap: 自动挖掘文本到图像模型中的偏见

Noa Cohen, Nurit Spingarn-Eliezer, Inbar Huberman-Spiegelglas, Tomer Michaeli

机构 * Technion – Israel Institute of Technology(技术学院–以色列理工学院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 MineTheGap通过遗传算法自动挖掘文本到图像模型中导致偏见的提示,利用偏见评分评估并优化提示池以暴露偏见。

Comments Code and examples are available on the project's webpage at https://noa-cohen.github.io/MineTheGap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12800 2025-12-16 cs.CV 77%

Learning Common and Salient Generative Factors Between Two Image Datasets

学习两个图像数据集之间的共同和显著生成因素

Yunlong He, Gwilherm Lesné, Ziqian Liu, Michaël Soumm, Pietro Gori

机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎理工学院)

专题命中 文生图 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出了一种新的对比分析框架,用于学习两个图像数据集之间的共同和显著生成因素,适用于GAN和扩散模型,提升了生成质量与分离能力。

Comments This is the author's version of a work submitted to IEEE for possible publication. The final version may differ from this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12465 2025-12-16 cs.LG cs.AI 67%

Exploring the Design Space of Transition Matching

探索过渡匹配的设计空间

Uriel Singer, Yaron Lipman

机构 * FAIR at Meta(Meta 的 FAIR)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract)

AI总结 本文研究了过渡匹配中头部模块的设计,发现MLP头部结合特定时间加权和高频采样器在生成质量、训练和推理效率上达到最佳效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07219 2025-12-16 cs.CR 67%

Approximate Gaussian Mapping for Generative Image Steganography

近似高斯映射用于生成性图像隐写术

Yuhua Xu, Wei Sun, Chengpei Tang, Jiaxing Lu, Jingying Zhou, Chen Gu

专题命中 文生图 :diffusion(abstract);image synthesis(abstract)

AI总结 本文提出近似高斯映射用于生成性图像隐写术,通过调节噪声尺度和方差嵌入秘密信息,并通过两阶段解耦优化策略提升鲁棒性和安全性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25387 2025-12-16 cs.CV 57%

Instance-Level Composed Image Retrieval

实例级组合图像检索

Bill Psomas, George Retsinas, Nikos Efthymiadis, Panagiotis Filntisis, Yannis Avrithis, Petros Maragos, Ondrej Chum, Giorgos Tolias

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 BASIC通过无训练方法利用预训练视觉-语言模型,在实例级组合图像检索中实现了新的状态。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏