Seeing What You Say: Expressive Image Generation from Speech
机构 * Ewha Womans University(东亚大学) ; Princeton University(普林斯顿大学) ; NAVER CLOUD
专题命中 可控生成 :image generation(title);分类 cs.CV、cs.MM
Comments In progress
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
机构 * Ewha Womans University(东亚大学) ; Princeton University(普林斯顿大学) ; NAVER CLOUD
专题命中 可控生成 :image generation(title);分类 cs.CV、cs.MM
Comments In progress
机构 * Skolkovo Institute of Science and Technology(斯克洛夫诺科学与技术研究所) ; Peachnote GmbH(Peachnote公司)
专题命中 可控生成 :inpainting(abstract);分类 cs.MM
Comments ACM Multimedia 2025. Extended version with supplementary material
Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (MM '25), October 27-31, 2025, Dublin, Ireland, pp. 10699-10708
专题命中 可控生成 :diffusion(abstract)
机构 * HKUST(香港科技大学) ; Alibaba Group(阿里巴巴集团) ; Zhejiang University(浙江大学) ; ByteDance Inc.(字节跳动公司)
专题命中 可控生成 :diffusion(abstract)
Comments ACM Multimedia 2025