arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-25 至 2026-08-25 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 6 篇

2608.21748 2026-08-25 cs.CV 新提交 86%

Calibrate What You SHIP: Post-Selection Risk Control for Verifier-Guided Text-to-Image Generation

校准你所发布的内容:验证器引导的文本到图像生成的后选择风险控制

Xuanhua Yin, Shunqi Mao, Wei Guo, Chuanzhi Xu, Weidong Cai

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 该研究针对验证器引导的文本到图像生成的后选择风险控制问题,提出 SHIP 方法,通过策略级校准降低发布输出风险,在 GenEval2 数据集上使发布风险从 0.310 降至 0.162。

Comments 17 pages, 9 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21713 2026-08-25 cs.CV cs.CL cs.LG 新提交 86%

The Plan, Not the Decoder: Diagnosing and Repairing Compositional Failure in Reasoning-Augmented Text-to-Image Generation

计划而非解码器:诊断与修复推理增强型文本到图像生成中的组合式失败

Ashritha Gonuguntla

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 该研究针对推理增强型文本到图像生成的组合式失败,发现问题源于规划器而非解码器,通过编辑计划(如重写几何结构)可显著提升生成质量,还发布了相关评估协议及数据。

Comments 15 pages, 7 figures. Accepted at ECCV 2026 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21784 2026-08-25 cs.CV 新提交 79%

DefaultShift: Auditing Semantic Default Shift in Accelerated Text-to-Image Models

DefaultShift:审计加速文本到图像模型中的语义默认偏移

Xuanhua Yin, Chuanzhi Xu, Shunqi Mao, Wei Guo, Weidong Cai

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本研究提出DefaultShift审计方法检测文本到图像模型加速时的语义默认偏移,还提出DefaultShift-Select校准方法降低偏移,提升模型语义保护能力。

Comments 21 pages, 12 figures, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05150 2026-08-25 cs.CR 版本更新 78%

$PC^2$: Politically Controversial Content Generation via Jailbreaking Attacks on GPT-based Text-to-Image Models

$PC^2$:通过基于GPT的文本到图像模型的越狱攻击生成政治争议内容

Wonwoo Choi, Minjae Seo, Minkyoo Song, Hwanjo Heo, Seungwon Shin, Myoungsung You

专题命中 文生图 :text-to-image(title,abstract)

AI总结 提出首个黑盒政治越狱框架$PC^2$,利用身份保留描述映射和地缘政治远距离翻译绕过安全过滤器,在GPT系列模型上实现高达86%的攻击成功率。

Comments To appear in the 33rd ACM Conference on Computer and Communications Security (CCS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21869 2026-08-25 cs.CV cs.AI 新提交 77%

GuardPaint:SpeculativeSafetyDecodingforText-to-ImageGeneration

GuardPaint:文本到图像生成的推测性安全解码

Shreyash Dhoot, Paras Dhiman, Arsh Abbas Naqvi, Aranbi Dutta, Aman Chadha, Vinija Jain, Amitava Das

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 GuardPaint是一种无需修改基础模型的文本到图像生成安全防护框架,可在扩散轨迹内干预,通过轻量级审计器定位并修复不安全区域,在多类越狱提示词和主流T2I模型上显著降低有害内容生成且对图像质量影响极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08724 2026-08-25 cs.CV 版本更新 57%

SynerMedGen: Synergizing Medical Multimodal Understanding with Generation via Task Alignment

SynerMedGen:通过任务对齐协同医疗多模态理解与生成

Weiren Zhao, Yi Dong, Cheng Chen

机构 * The University of Hong Kong, Hong Kong, China(香港大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 SynerMedGen通过任务对齐实现医疗多模态理解与生成的协同,提出生成对齐理解任务和两阶段训练策略,实现零样本性能和跨数据集泛化,释放大规模数据集支持进一步研究。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏