arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-09-01 至 2026-09-01 共收录 8 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 8 篇

2608.28909 2026-09-01 cs.CV 新提交 83%

Coarse to Fine: Iterative Adversarial Neural Cellular Automata for Medical Image Synthesis

从粗到细:用于医学图像合成的迭代对抗神经细胞自动机

Anh Thi Luu, Nick Lemke, Anirban Mukhopadhyay

机构 * Technical University of Darmstadt(达姆施塔特工业大学) ImFusion GmbH(ImFusion 有限公司)

专题命中 文生图 :image synthesis(title);image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 该研究提出首个基于NCA的轻量通用生成对抗网络StyleGANCA,在BloodMNIST和PathMNIST上以仅61.7万参数实现有竞争力的图像质量,支持多分类器训练,解决医学影像数据共享的隐私问题

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03468 2026-09-01 cs.CV 版本更新 83%

Understanding Reward Hacking in Text-to-Image Reinforcement Learning

理解文本到图像强化学习中的奖励黑客行为

Yunqi Hong, Kuei-Chun Kao, Hengguang Zhou, Cho-Jui Hsieh

机构 * Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出了一种轻量的伪影奖励模型,用于缓解文本到图像强化学习中的奖励黑客问题,通过提高图像真实性和减少低质量生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29210 2026-09-01 cs.AI 新提交 82%

Imag-Eval: a language-grounded framework for interpretable Text-to-Image instruction following evaluation

Imag-Eval:一种基于语言的可解释文本到图像指令遵循评估框架

Ibrahim Mohamed Serouis, David Jaramillo Duque

机构 * Talan Research and Innovation Center(塔兰研究与创新中心)

专题命中 文生图 :text-to-image(title,abstract)

AI总结 针对现有T2I模型评估的局限,提出Imag-Eval基准,通过独立调整实例数与规则组合区分语言复杂性与组合难度,经实验表明结构化技能的组合难度由规则数及绑定方式决定。

Comments Accepted to the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31073 2026-09-01 cs.CV eess.IV 新提交 79%

LISynSeg: Data-Centric Label-to-Image Synthesis for Cross-Modality Whole-Heart Segmentation

LISynSeg:以数据为中心的标签到图像合成用于跨模态全心分割

Jiacheng Wang, Ivana Isgum, Ipek Oguz

机构 * Vanderbilt University(范德堡大学) Mayo Clinic(梅奥诊所)

专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV

AI总结 该研究提出以数据为中心的LISynSeg方法,通过标签到图像合成结合真实图像训练,在不改变nnU-Net架构的情况下改善跨模态全心分割,对MRI的提升更显著。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29589 2026-09-01 cs.AI 新提交 78%

Not Safe for All: Auditing the Dialect Penalty in Text-to-Image Safety Pipelines

并非对所有人安全:审计文本到图像安全流程中的方言惩罚

Minkyu Kim, Juhwan Choi, YoungBin Kim

机构 * Chung-Ang University(中央大学)

专题命中 文生图 :text-to-image(title,abstract)

AI总结 该研究发现文本到图像安全流程存在方言惩罚问题,五种英语方言的23080对提示实验显示,不同安全过滤器对不同方言的检测偏差显著,可通过组平衡重训练缓解。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13155 2026-09-01 cs.CV 版本更新 70%

Pareto-Guided Optimal Transport for Multi-Reward Alignment

基于帕累托前沿的多奖励对齐最优传输

Ying Ba, Tianyu Zhang, Mohan Zhou, Yalong Bai, Wenyi Mo, Guiwei Zhang, Bing Su, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院) Beijing Key Laboratory of Research on Large Models(北京大模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索与推荐工程技术研究中心) Rutgers University(罗格斯大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出帕累托前沿引导的最优传输框架,通过构建任务特定的帕累托前沿并利用分布感知最优传输将支配样本映射到前沿,结合在线和离线优化策略,引入联合支配率和联合坍塌率作为评估指标,实验显示在多奖励协同和对抗攻击中优于基线方法。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28773 2026-09-01 eess.IV cs.CV 新提交 57%

Medical Foundation Model Features as Perceptual Loss for Brain MRI Contrast Dose Simulation

医学基础模型特征作为感知损失用于脑部MRI对比度剂量模拟

Changsheng Fang, Dayang Wang, T. Campbell Arnold, Enhao Gong, Srivathsa Pasumarthi

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 该研究提出用医学基础模型RadImageNet的特征替代自然图像骨干网络,作为感知损失用于脑部MRI对比度剂量模拟,相关指标略有提升,视觉效果更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26861 2026-09-01 cs.IR cs.CL 版本更新 50%

Evaluating Perspectival Biases in Cross-Modal Retrieval

评估跨模态检索中的视角偏差

Teerapol Saengsukhiran, Peerawat Chomphooyod, Narabodee Rodjananant, Chompakorn Chaksangchaichot, Patawee Prakrankamanant, Witthawin Sripheanpol, Pak Lovichit, Sarana Nutanong, Ekapol Chuangsuwanich

机构 * Department of Computer Engineering, Chulalongkorn University(楚莱隆坤大学计算机工程系) School of Information Science and Technology, VISTEC(信息科学与技术学院,VISTEC)

专题命中 文生图 :text-to-image(abstract)

AI总结 本文提出3XCM基准,揭示跨模态检索中语言和文化偏见的影响,强调需通过解耦策略实现公平检索。

详情

展开后加载摘要…

URL PDF HTML 收藏