arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-04 至 2025-12-04 共收录 9 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 9 篇

2512.03844 2025-12-04 cs.CV 88%

CoDA: From Text-to-Image Diffusion Models to Training-Free Dataset Distillation

CoDA:从文本到图像扩散模型到无训练数据集蒸馏

Letian Zhou, Songhua Liu, Xinchao Wang

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 CoDA通过核心分布对齐技术,利用现成文本到图像模型实现无训练数据集蒸馏,提升目标语义与通用生成先验的对齐,取得ImageNet-1K的高准确率。

Comments 34 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03749 2025-12-04 cs.CV 88%

Fully Unsupervised Self-debiasing of Text-to-Image Diffusion Models

文本到图像扩散模型的完全无监督自去偏

Korada Sri Vardhana, Shrikrishna Lolla, Soma Biswas

机构 * Indian Institute of Science(印度科学研究院)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 SelfDebias是一种完全无监督的文本到图像扩散模型去偏方法,通过识别语义聚类来减少生成图像中的偏见,同时保持视觉真实性。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03996 2025-12-04 cs.CV cs.AI 83%

Highly Efficient Test-Time Scaling for T2I Diffusion Models with Text Embedding Perturbation

面向T2I扩散模型的高效测试时缩放方法:文本嵌入扰动

Hang Xu, Linjiang Huang, Feng Zhao

机构 * MoE Key Lab of BIPC, USTC(信息与通信前沿技术联合实验室,中国科学技术大学) Beihang University(北京航空航天大学)

专题命中 文生图 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出文本嵌入扰动方法,通过结合频率引导的噪声调度与空间噪声扰动,提升T2I扩散模型生成质量与多样性,无需额外计算资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21209 2025-12-04 cs.CV cs.AI 77%

BitMark: Watermarking Bitwise Autoregressive Image Generative Models

BitMark: 图像生成模型中位级水印技术

Louis Kerner, Michel Meintz, Bihe Zhao, Franziska Boenisch, Adam Dziedzic

机构 * CISPA Helmholtz Center for Information Security(CISPA 河岸信息安全中心)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 BitMark通过位级水印技术防止图像生成模型中的模型崩溃,确保生成内容可检测。

Comments Accepted as a Conference Paper at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03905 2025-12-04 cs.CV 70%

Zero-Shot Video Translation and Editing with Frame Spatial-Temporal Correspondence

无监督视频翻译与编辑中的帧空间-时间对应

Shuai Yang, Junxin Lin, Yifan Zhou, Ziwei Liu, Chen Change Loy

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 FRESCO通过整合帧内与帧间对应关系,提升视频翻译与编辑的空间-时间一致性,实现高质量、一致的视频生成。

Comments Code: https://github.com/Sunnycookies/FRESCO-v2, Project: https://williamyang1991.github.io/projects/FRESCOv2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03463 2025-12-04 cs.CV cs.AI cs.CL 70%

Text-Printed Image: Bridging the Image-Text Modality Gap for Text-centric Training of Large Vision-Language Models

文本打印图像:为以文本为中心的大型视觉-语言模型训练弥合图像-文本模态差距

Shojiro Yamabe, Futa Waseda, Daiki Shiono, Tsubasa Takahashi

机构 * Turing Inc.(图灵公司) Institute of Science Tokyo(东京科学研究院) The University of Tokyo(东京大学) Tohoku University(东北大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本研究提出文本打印图像(TPI)技术,通过生成合成图像弥合图像-文本模态差距,提升以文本为中心的大型视觉-语言模型训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05127 2025-12-04 eess.IV cs.CV q-bio.QM 70%

PixCell: A generative foundation model for digital histopathology images

PixCell:数字病理图像的生成基础模型

Srikar Yellapragada, Alexandros Graikos, Zilinghan Li, Kostas Triaridis, Varun Belagali, Tarak Nath Nandi, Karen Bai, Beatrice S. Knudsen, Tahsin Kurc, Rajarsi R. Gupta, Prateek Prasanna, Ravi K Madduri, Joel Saltz, Dimitris Samaras

机构 * Stony Brook University(石溪大学) Argonne National Laboratory(阿贡国家实验室) The University of Chicago(芝加哥大学) University of Utah(犹他大学)

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 PixCell是首个针对数字病理图像的生成基础模型,通过扩散模型在大规模数据集上训练,实现隐私保护的数据生成和虚拟染色任务,提升病理学研究效率。

Comments Project page - https://histodiffusion.github.io/docs/projects/pixcell

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03052 2025-12-04 cs.GR cs.CV 62%

LATTICE: Democratize High-Fidelity 3D Generation at Scale

LATTICE:大规模实现高保真3D生成

Zeqiang Lai, Yunfei Zhao, Zibo Zhao, Haolin Liu, Qingxiang Lin, Jingwei Huang, Chunchao Guo, Xiangyu Yue

机构 * MMLab, CUHK(CUHK人工智能实验室) Tencent Hunyuan(腾讯文言)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV、cs.GR

AI总结 LATTICE通过VoxSet半结构化表示实现高效高保真3D生成,支持任意分辨率解码和灵活推理,达到最先进的性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03534 2025-12-04 cs.CV cs.AI 57%

Rethinking Prompt Design for Inference-time Scaling in Text-to-Visual Generation

重新思考推理时的提示设计以实现文本到视觉生成的扩展

Subin Kim, Sangwoo Mo, Mamshad Nayeem Rizve, Yiran Xu, Difan Liu, Jinwoo Shin, Tobias Hinz

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 PRIS通过自适应修改提示以实现文本到视觉生成的推理时扩展,提高生成质量并解决提示固定导致的质量停滞问题。

Comments Visualizations are available at the website: https://subin-kim-cv.github.io/PRIS

详情

展开后加载摘要…

URL PDF HTML 收藏