Dual Attention GANs for Semantic Image Synthesis
专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV、cs.MM
Comments Accepted to ACM MM 2020, camera ready (9 pages) + supplementary (10 pages)
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV、cs.MM
Comments Accepted to ACM MM 2020, camera ready (9 pages) + supplementary (10 pages)
专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV、cs.GR
Comments To appear in International Journal of Computer Vision (IJCV). arXiv admin note: text overlap with arXiv:1811.12373
专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV、cs.GR
Comments Video: https://youtu.be/z-pVip6WeyY SIGGRAPH 2019
专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV、cs.GR
Comments v2: CVPR camera ready, adding more results for edge-to-photo examples
专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV、cs.GR
Comments Published at the Conference on Computer Vision and Pattern Recognition (CVPR 2018)
专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV、cs.GR
Comments CVPR 2018 spotlight
专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV、cs.GR
Comments Project Page: http://www.cs.cmu.edu/~aayushb/pixelNN/
低努力对抗攻击针对文本到图像安全过滤器
机构 * University of Nottingham(诺丁汉大学) ; Xi’an Jiaotong-Liverpool University(西交利物浦大学) ; Xiamen University(厦门大学)
专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV
AI总结 研究揭示文本到图像模型易受低努力对抗攻击影响,通过提示策略绕过安全过滤,展示多种视觉对抗技术,揭示表面提示过滤与深层语义理解的差距,攻击成功率高达74.47%。
Comments Text-to-Image version of the Anyone can Jailbreak paper. Accepted in CVPR-W AIMS 2026
专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV
Comments A Watermarking Framework for Detecting Art Theft Mimicry in Text-to-Image Models
专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV
Comments Accepted to NeurIPS2021. We proposed ShadeGAN, which could perform shape-accurate 3D-aware image synthesis by modeling shading in generative implicit models
专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV
Comments A new database for text-to-image ReID is provided. Code will be released
机构 * University of South-Eastern Norway(南欧挪威大学) ; Norwegian Research Centre(挪威研究中心) ; Simula Laboratory Research(Simula实验室研究) ; University of Warsaw(华沙大学) ; Warsaw University of Technology(华沙理工大学) ; University of Oslo(奥斯陆大学)
专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)
Comments Accepted at AAMAS2025 International Conference on Autonomous Agents and Multiagent Systems
专题命中 文生图 :image generation(abstract);text-to-image(abstract);inpainting(abstract);image synthesis(abstract)
Comments Accepted at the 37th ACM/SIGAPP Symposium on Applied Computing (SAC '22)
DefaultShift:审计加速文本到图像模型中的语义默认偏移
专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV
AI总结 本研究提出DefaultShift审计方法检测文本到图像模型加速时的语义默认偏移,还提出DefaultShift-Select校准方法降低偏移,提升模型语义保护能力。
Comments 21 pages, 12 figures, 25 tables
在像素之间阅读:一种针对文本到图像模型的 inscription 性 jailbreak 攻击
专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV
AI总结 本文提出 Etch 框架,通过分解对抗提示为语义伪装、视觉空间锚定和字形编码三层,实现对文本到图像模型的 inscription 性 jailbreak 攻击,验证了现有安全机制的不足。
FermatSyn: 基于改进双向Mamba的多模态医学图像合成方法
机构 * USTC(中国科学技术大学) ; SII(上海信息研究所)
专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV
AI总结 FermatSyn通过改进的双向Mamba结合Fermat螺旋扫描策略,解决多模态医学图像合成中全局一致性与局部细节的平衡问题,提升合成图像质量与临床应用价值。
Comments MICCAI 2026
基于图像-描述提示的前沿文本到图像模型基准测试
机构 * Perle(珀尔)
专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV
AI总结 该研究针对组合要求高的图像-描述提示,评估了四个前沿文本到图像模型的性能,发现 Gemini 3 Pro Image 表现最优,领先系统的主要问题是对象计数错误和几何伪影。
TangPoetryBench:面向诗歌到图像生成的多维度基准与基于评分规则的评估器
专题命中 文生图 :image generation(title);text-to-image(abstract);分类 cs.CV
AI总结 该研究推出TangPoetryBench多维度基准与PAE评估器,解决T2I模型生成诗歌插图的评估难题,PAE性能接近Claude且可泛化,相关资源已公开。
文本到图像模型能否从正确的参考框架中生成图像?
专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV
AI总结 该研究引入FoR-T2I基准,发现现有22个T2I模型在参考框架提示下的布局理解准确率远低于相机视图提示,还提出VLM门控重写方法提升了参考框架下的生成准确率。
Comments 9 pages, 3 figures
EmergencyBias:文本到图像模型在应急场景下的偏差
专题命中 文生图 :text-to-image(title,abstract);分类 cs.MM
AI总结 本文定义了T2I模型在应急场景下的EmergencyBias,构建评估框架发现其存在人口统计学与行为偏差,提出ActionAlign方法可减少行为差异并保留图像质量。
Comments 15 pages, 5 figures, 7 tables
CXR-Retrieve:胸部X线摄影中的组合式文本到图像检索
机构 * Technion – Israel Institute of Technology(以色列理工学院) ; Ben-Gurion University of the Negev(内盖夫本-古里安大学)
专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV
AI总结 针对胸部X线检索的目标不匹配问题,提出CXR-Retrieve基准与标签感知对比微调方法,在双病理组合和否定查询的Precision@5上较CXR-CLIP分别提升8.5和22.0个百分点。
TreeAdapter:用于细粒度物种图像生成的分层分类法引导适配器组合
专题命中 文生图 :image generation(title);text-to-image(abstract);分类 cs.CV
AI总结 针对通用文本到图像模型在生成稀有生物物种图像时性能下降的问题,提出TreeAdapter框架,利用分层分类数据,通过在分类树节点附加轻量级适配器及两阶段训练范式,实现准确的细粒度图像生成,性能优于基线。
NAMESAKES: 探究文本到图像模型中的身份记忆
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Tel Aviv University(特拉维夫大学) ; Cornell University(康奈尔大学)
专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV
AI总结 提出一种黑盒行为探针,无需参考照片或训练数据,即可区分文本到图像模型生成的图像是记忆还是虚构,并在NAMESAKES数据集上验证其有效性。
Comments Project page: https://namesakes-web.github.io
TMI:文本到图像与图像到图像结合用于互补数据合成以促进长尾实例分割
机构 * LG Electronics(LG电子)
专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV
AI总结 研究针对大词汇量实例分割受长尾分布和类间模糊性限制的问题,提出结合文本到图像生成与上下文感知图像到图像编辑的混合管道,引入VRAIN编辑器,在LVIS基准测试中超越基线,有效提升分割性能。
Comments Accepted to ECCV 2026. The first two authors contributed equally to this work
文本到图像模型是归纳主义的火鸡吗?一个用于因果推理的反事实基准
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV
AI总结 提出反事实基准CF-World,通过三个递进层级测试T2I模型在违反现实先验规则下的图像生成能力,发现所有模型在反事实设置下性能急剧下降,原因是模型将世界知识与视觉外观编码为紧密耦合的模式。
Comments 10 pages, 7 figures. Project page: https://github.com/jylei16/CF-World.github.io
跨分辨率语义迁移用于低分辨率监控下的鲁棒文本-图像检索
机构 * School of Computer Science and Technology, Wuhan University of Science and Technology(武汉科技大学计算机科学与技术学院) ; School of Computer Science, National Engineering Research Center for Multimedia Software, Wuhan University(武汉大学计算机学院,国家多媒体软件工程技术研究中心) ; Hubei Province Key Laboratory of Intelligent Information Processing and Real-time Industrial System, Wuhan University of Science and Technology(湖北省智能信息处理与实时工业系统重点实验室,武汉科技大学)
专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV
AI总结 针对低分辨率监控场景中文本-图像检索的可靠性崩溃和排序漂移问题,提出CLIP框架CRST,通过分辨率条件推理、文本引导精炼和跨分辨率邻域迁移,在三个数据集上平均提升超低分辨率Rank-1和mAP分别5.7%和5.3%。
Comments 10 pages,8 figures,conference
InterPartAbility: 基于文本引导的部分匹配用于可解释的人员重识别
机构 * LIVIA, Dept. of Systems Engineering, ETS Montreal, Canada(LIVIA系统工程系,蒙特利尔ÉTS学院,加拿大) ; Genetec Inc.(Genetec公司)
专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV
AI总结 本文提出InterPartAbility,通过显式部分匹配和短语-区域绑定提升TI-ReID的可解释性,引入PPIM模块实现概念级指导,生成 grounded 解释图谱,实验表明在CUHK-PEDES等基准上达到SOTA可解释性性能。
图像合成检测的极简预处理方法
机构 * University of Science, VNU-HCM(胡志明市国立大学理科大学) ; Vietnam National University, Ho Chi Minh City(胡志明市国立大学)
专题命中 文生图 :image synthesis(title);image generation(abstract);分类 cs.CV
AI总结 提出一种基于梯度计算相邻像素波动的轻量级预处理方法,作为高通滤波器突出关键特征,在低端设备上实现与先进技术相当的检测精度。
Comments SOICT 2024
通过生成式AI图像合成改进流成像显微镜下的亚可见粒子分类
机构 * Center for Biosystems and Biotech Data Science(生物系统与生物技术数据科学中心) ; Ghent University Global Campus(根特大学全球校区) ; Department of Electronics and Information Systems(电子与信息系统系) ; Faculty of Pharmaceutical Sciences(药学系) ; Biopharmaceutical Technology, TUM School of Life Sciences(生物制药技术,技术大学生命科学学院) ; Department of Mathematics, Computer Science and Statistics(数学、计算机科学与统计学系)
专题命中 文生图 :image synthesis(title);diffusion(abstract);分类 cs.CV
AI总结 本文提出基于生成式AI的图像合成方法,解决流成像显微镜下亚可见粒子分类中的数据不平衡问题,通过生成高保真图像提升多类分类性能,公开模型和工具促进研究复现。
GeoFidelity-Bench:评估文本到图像街景生成中的片段级地理保真度
机构 * Heinz College of Information Systems and Public Policy(信息系统与公共政策学院)
专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV
AI总结 提出GeoFidelity-Bench基准,通过参考面板排名测试文本到图像模型能否生成特定道路片段而非通用城市街景,发现添加街道和社区名称可提升检索准确率,但目标与最近邻片段间相似度差距近乎为零。