arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-11-24 至 2025-11-24 共收录 8 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 8 篇

2507.20973 2025-11-24 cs.LG cs.CV 89%

Model-Agnostic Gender Bias Control for Text-to-Image Generation via Sparse Autoencoder

面向文本到图像生成的模型无关性别偏见控制:通过稀疏自编码器

Chao Wu, Zhenyi Wang, Kangxian Xie, Naresh Kumar Devulapally, Vishnu Suresh Lokhande, Mingchen Gao

机构 * University at Buffalo, USA(美国布法罗大学) University of Maryland, College Park, USA(马里兰大学 College Park 分校)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出SAE Debias,通过稀疏自编码器在文本到图像生成中减轻性别偏见,提供可解释且模型无关的去偏方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17282 2025-11-24 cs.CV cs.AI cs.CY 86%

Where Culture Fades: Revealing the Cultural Gap in Text-to-Image Generation

文化消逝之处:揭示文本到图像生成中的文化差距

Chuancheng Shi, Shangze Li, Shiming Guo, Simiao Xie, Wenhua Wu, Jingtong Dou, Chao Wu, Canran Xiao, Cong Wang, Zifeng Cheng, Fei Shen, Tat-Seng Chua

机构 * The University of Sydney(悉尼大学) Nanjing University of Science and Technology(南京理工大学) Central South University(中南大学) Nanjing University(南京大学) National University of Singapore(新加坡国立大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 本文提出了一种解决多语言文本到图像生成中文化一致性问题的方法,通过局部化文化敏感信号并改进模型对文化相关层的激活,提升生成图像的文化一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16917 2025-11-24 cs.CV 81%

UniModel: A Visual-Only Framework for Unified Multimodal Understanding and Generation

UniModel: 一种仅依赖视觉的统一多模态理解和生成框架

Chi Zhang, Jiepeng Wang, Youming Wang, Yuanzhi Liang, Xiaoyan Yang, Zuoxin Li, Haibin Huang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究所)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 UniModel通过统一模型、任务和表示,在单一视觉空间中实现多模态理解和生成的统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16965 2025-11-24 cs.CV cs.LG 79%

Real-Time Cooked Food Image Synthesis and Visual Cooking Progress Monitoring on Edge Devices

边缘设备上的实时烹饪食品图像合成与视觉烹饪进程监控

Jigyasa Gupta, Soumya Goyal, Anil Kumar, Ishan Jindal

机构 * Samsung R&D Institute India(三星印度研发院)

专题命中 文生图 :image synthesis(title);image generation(abstract);分类 cs.CV

AI总结 本文提出了一种边缘高效的生成模型,通过引入基于烤箱的烹饪进程数据集和领域特定的CIS度量标准,实现了在边缘设备上实时合成逼真烹饪食品图像并监控烹饪进程。

Comments 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22300 2025-11-24 cs.CR cs.AI cs.CV 79%

T2I-RiskyPrompt: A Benchmark for Safety Evaluation, Attack, and Defense on Text-to-Image Model

T2I-RiskyPrompt:用于评估、攻击和防御文本到图像模型安全性的基准

Chenyu Zhang, Tairen Zhang, Lanjun Wang, Ruidong Chen, Wenhui Li, Anan Liu

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 T2I-RiskyPrompt提出了一种用于评估文本到图像模型安全性的综合基准,通过层次化风险分类和原因驱动的检测方法,全面评估了多种模型和防御策略的安全性能。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17987 2025-11-24 cs.CR cs.AI cs.CV 79%

Reason2Attack: Jailbreaking Text-to-Image Models via LLM Reasoning

通过LLM推理进行文本到图像模型的劫持:Reason2Attack

Chenyu Zhang, Lanjun Wang, Yiwen Ma, Wenhui Li, An-An Liu

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 Reason2Attack通过将劫持攻击融入LLM后训练过程,提升生成对抗性提示的推理能力,实现更高效的文本到图像模型攻击

Comments Noted that This paper includes model-generated content that may contain offensive or distressing material

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17255 2025-11-24 cs.CV cs.IR 74%

A Little More Like This: Text-to-Image Retrieval with Vision-Language Models Using Relevance Feedback

略多一些像这个:利用视觉语言模型进行文本到图像检索的相关反馈

Bulat Khaertdinov, Mirela Popa, Nava Tintarev

机构 * Maastricht University(马斯特里赫特大学)

专题命中 文生图 :text-to-image(title);分类 cs.CV

AI总结 本文提出基于相关反馈机制提升视觉语言模型文本到图像检索性能的方法,通过四种反馈策略在Flickr30k和COCO数据集上验证,提升了检索效果并增强了多轮检索的鲁棒性。

Comments Accepted to WACV'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17358 2025-11-24 cs.CL 50%

Don't Learn, Ground: A Case for Natural Language Inference with Visual Grounding

不要学习,而是依托:自然语言推理与视觉依托的案例

Daniil Ignatev, Ayman Santeer, Albert Gatt, Denis Paperno

机构 * Utrecht University(乌特勒支大学)

专题命中 文生图 :text-to-image(abstract)

AI总结 本文提出了一种基于视觉依托的零样本自然语言推理方法,通过生成视觉表示并比较与假设的相似度,实现高精度推理,展示了对文本偏见的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏