arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-02 至 2025-12-02 共收录 3 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 3 篇

2503.10125 2025-12-02 cs.CV cs.MM 86%

Proxy-Tuning: Tailoring Multimodal Autoregressive Models for Subject-Driven Image Generation

代理调优:为以主题驱动的图像生成定制多模态自回归模型

Yi Wu, Shengju Qian, Lingting Zhu, Lei Liu, Wandi Qiao, Ziqiang Li, Lequan Yu, Bin Li

机构 * University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 个性化与一致性 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出代理调优方法,通过扩散模型增强AR模型在主题驱动图像生成中的能力,揭示了弱到强泛化现象,提升了多主题组合和上下文理解的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00413 2025-12-02 cs.CV cs.GR 62%

SplatFont3D: Structure-Aware Text-to-3D Artistic Font Generation with Part-Level Style Control

SplatFont3D: 基于结构的文本到3D艺术字体生成与部分级风格控制

Ji Gan, Lingxu Chen, Jiaxu Leng, Xinbo Gao

机构 * Chongqing University of Posts and Telecommunications(重庆邮电大学) Xidian University(西安电子科技大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 SplatFont3D通过3D高斯溅射技术实现基于结构的文本到3D艺术字体生成,提供精确的部分级风格控制,提升渲染效率和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01895 2025-12-02 cs.CV 57%

StyleYourSmile: Cross-Domain Face Retargeting Without Paired Multi-Style Data

StyleYourSmile: 跨域人脸重定向无需配对多风格数据

Avirup Dey, Vinay Namboodiri

机构 * University of Bath(巴斯大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 StyleYourSmile通过双编码器框架和高效数据增强策略,实现无需多风格配对数据的跨域人脸重定向,提升身份保持与重定向保真度。

Comments 15 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏