SeeingSounds: Learning Audio-to-Visual Alignment via Text
机构 * University of Catania(卡塔尼亚大学)
专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV、cs.MM
Comments accepted to ACM Multimedia Asia 2025
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
机构 * University of Catania(卡塔尼亚大学)
专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV、cs.MM
Comments accepted to ACM Multimedia Asia 2025
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
专题命中 可控生成 :diffusion(abstract)