arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-13 至 2026-01-13 共收录 8 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 8 篇

2601.00827 2026-01-13 eess.AS cs.AI cs.MM 85%

Speak the Art: A Direct Speech to Image Generation Framework

Speak the Art: 一种直接语音到图像生成框架

Mariam Saeed, Manar Amr, Farida Adel, Nada Hassan, Nour Walid, Eman Mohamed, Mohamed Hussein, Marwan Torki

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.MM

AI总结 本文提出Speak the Art框架,通过改进语音嵌入和使用扩散模型,实现更稳定和多样化的语音到图像生成,并验证了多语言扩展的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07141 2026-01-13 cs.CR 78%

MacPrompt: Maraconic-guided Jailbreak against Text-to-Image Models

MacPrompt:基于马卡罗尼的文本到图像模型对抗攻击

Xi Ye, Yiwen Liu, Lina Wang, Run Wang, Geying Yang, Yufei Hou, Jiayi Yu

专题命中 文生图 :text-to-image(title,abstract)

AI总结 MacPrompt通过跨语言字符级重组有害术语,实现对文本到图像模型的安全机制的高效对抗,突破现有防御体系。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06574 2026-01-13 cs.CV 77%

APEX: Learning Adaptive Priorities for Multi-Objective Alignment in Vision-Language Generation

APEX: 为视觉-语言生成中的多目标对齐学习自适应优先级

Dongliang Chen, Xinlin Zhuang, Junjie Xu, Luojian Xie, Zehui Wang, Jiaxi Zhuang, Haolin Yang, Liang Dou, Xiao He, Xingjiao Wu, Ying Qian

机构 * East China Normal University(东华师范大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 APEX通过双阶段自适应归一化和P^3自适应优先级,提升视觉-语言生成中多目标对齐的稳定性与性能平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11720 2026-01-13 cs.LG cs.AI 75%

RPO: Fine-Tuning Visual Generative Models via Rich Vision-Language Preferences

RPO:通过丰富的视觉-语言偏好进行视觉生成模型微调

Hanyang Zhao, Haoxian Chen, Yucheng Guo, Genta Indra Winata, Tingting Ou, Ziyu Huang, David D. Yao, Wenpin Tang

机构 * Columbia University(哥伦比亚大学) Amazon(亚马逊) Princeton University(普林斯顿大学) Capital One

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image editing(abstract)

AI总结 RPO通过利用视觉语言模型的丰富反馈信号,改进偏好对的编纂,从而提升视觉生成模型的微调效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06368 2026-01-13 cs.CR cs.CV 74%

From Easy to Hard++: Promoting Differentially Private Image Synthesis Through Spatial-Frequency Curriculum

从易到难++:通过空间-频率课程促进差分隐私图像合成

Chen Gong, Kecen Li, Zinan Lin, Tianhao Wang

机构 * University of Virginia(弗吉尼亚大学) Microsoft Research(微软研究院)

专题命中 文生图 :image synthesis(title);分类 cs.CV

AI总结 FETA-Pro通过引入频率特征作为训练捷径,提升差分隐私图像合成的保真度和实用性。

Comments Accepted at Usenix Security 2026; code available at https://github.com/2019ChenGong/Feta-Pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07293 2026-01-13 cs.CV 70%

Inference-Time Scaling for Visual AutoRegressive modeling by Searching Representative Samples

推理时的缩放用于视觉自回归建模通过搜索代表性样本

Weidong Tang, Xinyan Wan, Siyu Li, Xiumei Wang

机构 * School of Electronic Engineering, Xidian University, Xi'an, China(西安电子科技大学电子工程学院)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出VAR-Scaling框架,通过搜索代表性样本解决VQ视觉自回归建模中的离散潜在空间问题,提升推理过程的生成质量。

Comments Accepted to PRCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06169 2026-01-13 cs.CV 70%

Think Bright, Diffuse Nice: Enhancing T2I-ICL via Inductive-Bias Hint Instruction and Query Contrastive Decoding

Think Bright, Diffuse Nice: 通过归纳偏置提示指令和查询对比解码增强T2I-ICL

Zhiyong Ma, Zhenpeng Li, Yuanjie Shi, Zhengping Li, Jiahao Chen, Qingyuan Chuai

机构 * Cao Tu Li (Guangzhou) Technology Co., Ltd(曹图利(广州)科技有限公司) South China University of Technology(华南理工大学) Washington State University(华盛顿州立大学) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 TBDN通过引入归纳偏置提示指令和查询对比解码,有效解决T2I-ICL中的合规性失败和先验主导幻觉问题,实现高效可靠的图像生成。

Comments Submitted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06642 2026-01-13 cs.CV cs.AI 57%

Boosting Overlapping Organoid Instance Segmentation Using Pseudo-Label Unmixing and Synthesis-Assisted Learning

通过伪标签解混和合成辅助学习提升重叠类器官实例分割

Gui Huang, Kangyuan Zheng, Xuan Cai, Jiaqi Wang, Jianjia Zhang, Kaida Ning, Wenbo Wei, Yujuan Zhu, Jiong Zhang, Mengting Liu

机构 * School of Biomedical Engineering, Sun Yat-sen University(中山大学生物医学工程学院) Peng Cheng Laboratory(鹏城实验室) The First Affiliated Hospital of Shenzhen University, Shenzhen Second People's Hospital(深圳大学第一附属医院、深圳第二人民医院) The Research Center of Clinical Medicine, Affiliated Hospital of Nantong University, Medical School of Nantong University(临床医学研究中心、南通大学附属医院、南通大学医学院) Cixi Institute of Biomedical Engineering, Ningbo Institute of Materials Technology and Engineering, Chinese Academy of Sciences(慈溪生物医学工程研究所、宁波材料技术与工程研究所、中国科学院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出通过伪标签解混和合成辅助学习提升类器官实例分割,解决重叠问题,实现高效率的标注数据利用。

详情

展开后加载摘要…

URL PDF HTML 收藏