Combining Markov Random Fields and Convolutional Neural Networks for Image Synthesis
专题命中 文生图 :image synthesis(title);分类 cs.CV
Comments 9 pages, 9 figures
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 文生图 :image synthesis(title);分类 cs.CV
Comments 9 pages, 9 figures
专题命中 文生图 :image synthesis(title,journal_ref)
Comments 11 pages, 13 figures
Journal ref M. Cárcamo, P.E. Román, S. Casassus, V. Moral, F.R. Rannou, Multi-GPU maximum entropy image synthesis for radio astronomy, Astronomy and Computing, Volume 22, 2018, Pages 16-27, ISSN 2213-1337
通过LoRAs的权重基来跨越视觉类比空间
专题命中 文生图 :text-to-image(abstract);image editing(abstract);分类 cs.CV、cs.GR
AI总结 本文提出LoRWeB,通过在单次推理中为每个类比任务专门化模型,动态组合学习的变换原语,以提升视觉类比学习的泛化能力。
Comments Accepted to ECCV 2026; Code and data are in https://research.nvidia.com/labs/par/lorweb
Echo-Memory:动作世界模型中记忆的受控研究
机构 * Joy Future Academy(京东探索研究院)
专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV、cs.GR
AI总结 提出Echo-Memory框架,通过控制变量法研究动作条件世界模型中的记忆机制,发现原始上下文容量和块状状态空间递归对开放域返回任务至关重要。
Comments 9 figures and 28 pages, Code at \href{https://github.com/Echo-Team-Joy-Future-Academy-JD/Echo-Memory}{this URL}
JavisDiT++:联合音频视频生成的统一建模与优化
机构 * Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; University of Toronto(多伦多大学) ; HiThink Research(HiThink研究) ; University of Rochester(罗切斯特大学) ; Nanyang Technological University(南洋理工大学)
专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM
AI总结 JavisDiT++通过统一建模与优化方法,在联合音频视频生成任务中实现高质量的同步与语义对齐。
Comments Accepted by ICLR 2026. Homepage: https://JavisVerse.github.io/JavisDiT2-page
VIVAT: 通过抑制伪影改进VAE训练
专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM
AI总结 VIVAT通过抑制VAE训练中的常见伪影,提升图像重建和生成质量,实现更优的PSNR、SSIM和CLIP分数表现。
协同强化学习用于统一多模态理解和生成
机构 * Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学)
专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM
AI总结 本文提出CoRL框架,通过协同强化学习提升多模态大语言模型在生成与理解任务上的性能。
Comments NeurIPS 2025
专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM
Comments Accepted by AAAI 2026. 13 pages, 6 figures. Code: https://github.com/wangbing1416/RETSIMD
专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM
Journal ref Machine Intelligence Research, 2025
机构 * Brown University(布朗大学) ; Stanford University(斯坦福大学)
专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR
专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR
Comments Accepted by AAAI 2025. Code: https://github.com/SparklingH/BloomScene
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; College of Information Science and Engineering, Ritsumeikan University(立命馆大学信息科学与工程学院)
专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM
机构 * Department of Information Technology, Indian Institute of Information Technology, Allahabad, U.P.(信息科技系,印度信息技术研究所,阿勒普尔,乌塔兰邦) ; KTH Royal Institute of Technology(皇家理工学院) ; Department of Computer Science and Engineering, Vignan University, Guntur, Andhra Pradesh(计算机科学与工程系,维加恩大学,古特尔,安得拉邦)
专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV、cs.GR
Comments This paper is currently under review for publication in an IEEE Transactions. If accepted, the copyright will be transferred to IEEE
机构 * Inria(法国国家信息与自动化技术研究所) ; Adobe Research(Adobe研究院)
专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR
Comments Accepted to EGSR, journal track to appear in Computer Graphics Forum
专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM
专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.MM
Comments Accepted to NeurIPS 2024. Project site: https://ificl.github.io/images-that-sound/
专题命中 文生图 :text-to-image(abstract);image editing(abstract);分类 cs.CV、cs.MM
Comments Carmera-ready version. To appear in ACM MM 2024
专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR
Comments Homepage: https://zhouhyocean.github.io/holodreamer
专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR
Comments CVPR 2024 (18 pages, 11 figures, https://graphdreamer.github.io/)
专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.MM
Comments ACM Transactions on Multimedia Computing, Communications and Applications (2024)
专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM
Comments Published at CVPR 2024. Project site: https://llm-can-optimize-vlm.github.io/
专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR
Comments SIGGRAPH Asia 2023. Project page: at: https://omriavrahami.com/break-a-scene/ Video: https://www.youtube.com/watch?v=-9EA-BhizgM
专题命中 文生图 :text-to-image(abstract);inpainting(abstract);分类 cs.GR、cs.MM
Comments Accepted for NeurIPS 2023 Workshop on Machine Learning for Creativity and Design
专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR
专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR
Comments Project: https://huangyangyi.github.io/TeCH, Code: https://github.com/huangyangyi/TeCH
专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV、cs.MM
Comments 9 pages, 6 figures
专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV、cs.GR
专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.GR
Comments Project Page: https://icon-shop.github.io/
专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM
Comments Accepted by GCV @CVPR2023
专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.MM