arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-22 至 2026-01-22 共收录 9 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 9 篇

2601.14741 2026-01-22 cs.CV 88%

Enhancing Text-to-Image Generation via End-Edge Collaborative Hybrid Super-Resolution

通过端边协作混合超分辨率增强文本到图像生成

Chongbin Yi, Yuxin Liang, Ziqi Zhou, Peng Yang

机构 * School of Electronic Information and Communications(电子信息与通讯学院)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出端边协作混合超分辨率框架,通过结合扩散模型和轻量级模型提升文本到图像生成的分辨率与效率,实验显示延迟降低33%且图像质量保持竞争力。

Comments Accpeted by ICC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14602 2026-01-22 cs.CV 88%

3D Space as a Scratchpad for Editable Text-to-Image Generation

3D空间作为可编辑的文本到图像生成的草稿纸

Oindrila Saha, Vojtech Krs, Radomir Mech, Subhransu Maji, Matheus Gadelha, Kevin Blackburn-Matzen

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Adobe Research(Adobe研究)

专题命中 文生图 :image generation(title,abstract);text-to-image(title);image synthesis(abstract);分类 cs.CV

AI总结 本文提出一种基于3D空间推理的文本到图像生成方法,通过可编辑的3D网格实现空间一致性,提升图像生成的精度和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20362 2026-01-22 cs.CV 88%

CRAFT: Continuous Reasoning and Agentic Feedback Tuning for Multimodal Text-to-Image Generation

CRAFT:连续推理与代理反馈调优用于多模态文本到图像生成

V. Kovalev, A. Kuvshinov, A. Buzovkin, D. Pokidov, D. Timonin

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 CRAFT通过显式推理和反馈调优提升多模态生成模型的可靠性,实现可控且高效的文本到图像生成。

Comments 37 pages, 42 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06837 2026-01-22 cs.CR 88%

Towards Effective Prompt Stealing Attack against Text-to-Image Diffusion Models

面向文本到图像扩散模型的有效提示窃取攻击

Shiqian Zhao, Chong Wang, Yiming Li, Yihao Huang, Wenjie Qu, Siew-Kei Lam, Yi Xie, Kangjie Chen, Jie Zhang, Tianwei Zhang

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract)

AI总结 Prometheus通过动态修饰符和上下文匹配算法,实现无需训练的提示窃取攻击,有效提升对多种扩散模型的攻击成功率。

Comments This paper proposes an effective training-free, proxy-in-the-loop, and search-based prompt-stealing scheme against T2I models

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15286 2026-01-22 cs.CV cs.AI cs.LG cs.RO 83%

Iterative Refinement Improves Compositional Image Generation

迭代细化改进组合图像生成

Shantanu Jaiswal, Mihir Prabhudesai, Nikash Bhardwaj, Zheyang Qin, Amir Zadeh, Chuan Li, Katerina Fragkiadaki, Deepak Pathak

机构 * Carnegie Mellon University(卡内基梅隆大学) Lambda AI

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种迭代细化策略,通过视觉-语言模型反馈提升组合图像生成质量,实验显示在多个基准上均优于并行采样方法。

Comments Project webpage: https://iterative-img-gen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14951 2026-01-22 cs.CV cs.AI cs.CL 83%

TempViz: On the Evaluation of Temporal Knowledge in Text-to-Image Models

TempViz: 关于文本到图像模型中时间知识的评估

Carolin Holtermann, Nina Krebs, Anne Lauscher

机构 * Trustworthy AI Lab, University of Hamburg(汉堡大学可信人工智能实验室) University of St. Gallen(圣加尔登大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 TempViz通过首个全面评估时间知识的数据集,揭示了文本到图像模型在时间推理上的不足,并指出需进一步研究

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04339 2026-01-22 cs.CV cs.AI 83%

Unified Text-Image Generation with Weakness-Targeted Post-Training

通过弱项针对性后训练实现统一的文本图像生成

Jiahui Chen, Philippe Hansen-Estruch, Xiaochuang Han, Yushi Hu, Emily Dinan, Amita Kamath, Michal Drozdzal, Reyhane Askari-Hemmat, Luke Zettlemoyer, Marjan Ghazvininejad

机构 * FAIR at Meta(Meta旗下的FAIR) University of Texas, Austin(德克萨斯大学奥斯汀分校) University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出通过针对性后训练实现统一文本图像生成,提升多模态生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15071 2026-01-22 cs.CV 70%

The Pictorial Cortex: Zero-Shot Cross-Subject fMRI-to-Image Reconstruction via Compositional Latent Modeling

皮层:通过组合潜在建模实现零样本跨主体fMRI到图像重建

Jingyang Huo, Yikai Wang, Yanwei Fu, Jianfeng Feng

机构 * Institute of Science and Technology for Brain-inspired Intelligence (ISTBI), Fudan University(脑启发智能科学与技术研究院,复旦大学) School of Data Science, Fudan University(复旦大学数据科学学院) Fudan ISTBI–ZJNU Algorithm Centre for Brain-Inspired Intelligence, Zhejiang Normal University(复旦ISTBI-浙师大脑启发智能算法中心,浙江师范大学) Shanghai Innovation Institute(上海创新研究院) Nanyang Technological University(南洋理工大学)

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出PictorialCortex模型,通过组合潜在建模和多数据集训练,实现零样本跨主体fMRI到图像重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10096 2026-01-22 cs.LG 67%

Multilingual-To-Multimodal (M2M): Unlocking New Languages with Monolingual Text

多语言到多模态(M2M):通过单语文本解锁新语言

Piyush Singh Pasi

机构 * Amazon(亚马逊)

专题命中 文生图 :image generation(abstract);text-to-image(abstract)

AI总结 M2M通过单语文本学习多语言多模态对齐,实现多语言文本到图像检索的零样本迁移

Comments EACL 2026 Findings accepted. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏