arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-06 至 2026-01-06 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2508.10710 2026-01-06 cs.CV 89%

CountCluster: Training-Free Object Quantity Guidance with Cross-Attention Map Clustering for Text-to-Image Generation

CountCluster: 无训练对象数量引导与跨注意力图聚类用于文本到图像生成

Joohyeon Lee, Jin-Seop Lee, Jee-Hyong Lee

机构 * Sungkyunkwan University(釜山大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 CountCluster通过无训练的跨注意力图聚类方法提升文本到图像生成中对象数量的准确性与控制性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01441 2026-01-06 physics.app-ph cs.CV 83%

Image Synthesis Using Spintronic Deep Convolutional Generative Adversarial Network

利用自旋电子深度卷积生成对抗网络进行图像合成

Saumya Gupta, Abhinandan, Venkatesh vadde, Bhaskaran Muralidharan, Abhishek Sharma

机构 * Department of Electrical Engineering, IIT Bombay(印度比哈尔理工学院电气工程系) Department of Electrical Engineering, IIT Ropar(印度罗帕尔理工学院电气工程系) School of Computing and Electrical Engineering (SCEE), IIT Mandi(印度曼迪理工学院计算与电气工程学院)

专题命中 文生图 :image synthesis(title);image generation(abstract);generative vision(abstract);分类 cs.CV

AI总结 本文提出了一种混合CMOS-自旋电子深度卷积生成对抗网络,通过自旋电子硬件实现高效图像合成,降低了能耗并提升了性能。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12595 2026-01-06 cs.CV 83%

Vision-Enhanced Large Language Models for High-Resolution Image Synthesis and Multimodal Data Interpretation

增强视觉能力的大型语言模型用于高分辨率图像合成和多模态数据解释

Karthikeya KV

专题命中 文生图 :image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本研究提出了一种增强视觉能力的大型语言模型,通过整合修正流机制和混合序列建模方法,实现高分辨率图像合成和多模态数据解释的高效生成与高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02219 2026-01-06 eess.SP 67%

Beam-Brainstorm: A Generative Site-Specific Beamforming Approach

Beam-Brainstorm: 一种生成式特定地点波束成形方法

Zihao Zhou, Zhaolin Wang, Yuanwei Liu

专题命中 文生图 :diffusion(abstract);image synthesis(abstract)

AI总结 本文提出了一种生成式特定地点波束成形方法,通过联合结构建模和自定义扩散模型,实现高效且高质量的用户特定波束生成。

详情

展开后加载摘要…

URL PDF HTML 收藏