arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3486 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3486 篇

2507.17853 2026-06-23 cs.CV cs.AI 版本更新 79%

Detail++: Training-Free Detail Enhancer for T2I Diffusion Models

Detail++: 文本到图像扩散模型的免训练细节增强器

Lifeng Chen, Jiner Wang, Zihao Pan, Beier Zhu, Xiaofeng Yang, Chi Zhang

机构 * AGI Lab, Westlake University(AGI实验室,西lake大学) Nanyang Technological University(南洋理工大学)

专题命中 文生图 :diffusion(title);text-to-image(abstract);分类 cs.CV

AI总结 提出免训练框架Detail++,通过渐进式细节注入策略分解复杂提示词,利用自注意力布局控制与交叉注意力质心对齐损失,提升多主体复杂提示下的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18555 2026-06-18 cs.CV 新提交 79%

Rethinking Text-to-Image as Semantic-Aware Data Augmentation for Indoor Scene Recognition

重新思考文本到图像作为室内场景识别的语义感知数据增强

Trong-Vu Hoang, Quang-Binh Nguyen, Dinh-Khoi Vo, Hoai-Danh Vo, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM, Vietnam(越南国立大学胡志明市理科大学) Vietnam National University, Ho Chi Minh City, Vietnam(越南国立大学胡志明市分校)

专题命中 文生图 :text-to-image(title);diffusion(abstract);分类 cs.CV

AI总结 针对室内图像数据不足,提出利用稳定扩散生成合成图像进行数据增强,并通过扩散重建误差防止滥用,在MIT室内场景数据集上验证了有效性。

Comments MAPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14657 2026-06-15 cs.CV 新提交 79%

HPSv3++: Scaling Reward Models Across the Full Spectrum of Diffusion Model Capabilities

HPSv3++:跨扩散模型能力全谱系扩展奖励模型

Yijun Liu, Jie Huang, Zeyue Xue, Yuming Li, Ruizhe He, Haoran Li, Shijia Ge, Siming Fu

机构 * Tsinghua University(清华大学) JD Explore Academy(京东探索研究院) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 文生图 :diffusion(title);text-to-image(abstract);分类 cs.CV

AI总结 提出HPSv3++奖励模型框架,通过双维度偏好数据集HPDv3++和两阶段训练(正交梯度投影+无监督引导),提升对各类T2I模型及RL迭代的偏好预测能力,在多个基准上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14351 2026-06-15 cs.CV 新提交 79%

ForceForget: Reinforcement Concept Removal for Enhancing Safety in Text-to-Image Models

ForceForget: 通过强化概念移除增强文本到图像模型的安全性

Dong Han, Yong Li

机构 * Dong Han(董汉) Yong Li(李勇)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 针对文本到图像模型生成不安全内容的问题,提出基于强化学习优化概念擦除奖励的方法,通过安全适配器调节文本嵌入,在消除不安全内容的同时保持模型对安全语义的生成能力。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05478 2026-06-05 cs.CV cs.LG 79%

Can We Predict The Human Preference For Text-to-Image Content Prior To Generation And Is It Even Useful To Do So?

我们能否在生成之前预测文生图内容的人类偏好,以及这样做是否有用?

Joong Ho Kim, Keith G. Mills

机构 * LSU ATHENA Lab(LSU ATHENA实验室)

专题命中 文生图 :text-to-image(title);diffusion(abstract);分类 cs.CV

AI总结 研究在扩散模型生成图像前预测人类偏好评分(HPM)的可行性,并利用该预测提升生成质量,同时评估不同HPM的适用性。

Comments Code is available at https://github.com/LSU-ATHENA/HPM-Predict

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01651 2026-06-02 cs.CV 79%

Restoring Initial Noise Sensitivity in Text-to-Image Distillation via Geometric Alignment

通过几何对齐恢复文本到图像蒸馏中的初始噪声敏感性

Huayang Huang, Ruoyu Wang, Jinhui Zhao, Wei Deng, Daiguo Zhou, Jian Luan, Yu Wu, Ye Zhu

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 提出几何感知蒸馏(GAD)框架,通过匹配雅可比-向量积来对齐教师和学生模型的局部功能行为,从而恢复文本到图像蒸馏中丢失的初始噪声敏感性,提升下游噪声驱动控制任务的性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00204 2026-06-02 cs.CV 79%

APE: Agentic Prompt Enhancer for Image Generation and Editing

APE: 用于图像生成与编辑的智能提示增强器

Zijian Huang, Jay Zhangjie Wu, Zian Wang, Tianshi Cao, Jiasi Chen, Sanja Fidler, Huan Ling, Xuanchi Ren

机构 * NVIDIA University of Michigan(密歇根大学)

专题命中 文生图 :image generation(title,abstract);分类 cs.CV

AI总结 提出APE框架,通过后训练小型语言模型作为提示增强代理,以单代理或多代理方式改进文本到图像生成与编辑中的提示质量,无需修改下游视觉模型。

Comments Project Page: https://research.nvidia.com/labs/sil/projects/ape/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28137 2026-05-28 cs.CV cs.LG 79%

No Safe Dose: How Training Data Drives Unsafe Image Generation

无安全剂量:训练数据如何驱动不安全图像生成

Felix Friedrich, Lukas Helff, Niharika Hegde, Patrick Schramowski, Kristian Kersting

机构 * Black Forest Labs(黑森林实验室) TU Darmstadt & hessian.AI(图腾达姆施塔特大学 & heessian.AI) DFKI(德意志联邦鹰嘴豆研究所) Lab1141(Lab1141实验室)

专题命中 文生图 :image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 通过控制训练数据中不安全图像的比例(0%至9.6%),发现输出不安全率随比例单调上升,且比例而非绝对数量是关键因素,同时文本编码器(如SafeCLIP)可降低基线风险,但剂量效应持续存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22827 2026-05-26 cs.CV cs.LG 79%

FairJudge: Abstention-Aware Multimodal Judges for Fairness and Alignment Evaluation in Text-to-Image Models

FairJudge: 文本到图像模型中公平性与对齐评估的弃权感知多模态裁判

Zahraa Al Sahili, Maimuna Nowaz, Maryam Fetanat, Ioannis Patras, Matthew Purver

机构 * Queen Mary University of London(伦敦玛丽女王大学) Institut Jožef Stefan(乔泽夫·斯蒂芬研究所) Imperial College London(伦敦帝国学院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 提出FairJudge协议,利用多模态大语言模型作为结构化裁判,通过封闭标签、弃权机制和证据报告,在文本到图像模型中实现社会属性预测、职业定位和提示-图像对齐的公平性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19855 2026-05-20 cs.CV cs.AI 79%

A Framework for Evaluating Zero-Shot Image Generation in Concept-based Explainability

基于概念的可解释性人工智能的零样本图像生成评估框架

Giacomo Astolfi, Matteo Bianchi, Riccardo Campi, Antonio De Santis, Marco Brambilla

机构 * Politecnico di Milano, DEIB(米兰理工大学,DEIB)

专题命中 文生图 :image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种基于概念的可解释性人工智能的零样本图像生成评估框架,通过生成合成概念数据集来评估概念基于的XAI方法,探讨了零样本文本到图像生成模型在模型分析中的挑战和开放性问题。

Comments G. Astolfi, M. Bianchi, and R. Campi contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19111 2026-05-20 cs.CV cs.AI 79%

FAGER: Factually Grounded Evaluation and Refinement of Text-to-Image Models

FAGER:基于事实的文本到图像模型评估与改进

Youngsun Lim, Cusuh Ham, Pin-Yu Chen, Deepti Ghadiyaram

机构 * Boston University(波士顿大学) Adobe(Adobe公司) IBM Research(IBM研究院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出FAGER框架,用于评估和改进文本到图像模型的事实准确性,通过结合LLM生成事实和参考引导的视觉事实提取与验证,构建结构化事实评估标准,并通过VLM进行评估,验证FAGER在事实性测试中优于现有方法,并能无训练改进T2I输出。

Comments It was accepted for an oral presentation at the 2nd Workshop on the Evaluation of Generative Foundation Models (EVGENFM2026) at CVPR 2026. Total 8 pages (1 page for references). 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12650 2026-05-14 cs.CV 79%

CRAFT: Clinical Reward-Aligned Finetuning for Medical Image Synthesis

CRAFT:面向医学图像合成的临床对齐微调

Yunsung Chung, Alex El Darzi, Carlo El Khoury, Han Feng, Nassir Marrouche, Jihun Hamm

机构 * Department of Computer Science, Tulane University(路易斯安那大学计算机科学系) School of Medicine, Tulane University(路易斯安那大学医学院)

专题命中 文生图 :image synthesis(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出CRAFT框架,通过临床对齐评分和奖励优化提升医学图像生成质量,减少幻觉生成,提升分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16769 2026-05-13 cs.LG cs.CL cs.CR cs.CV 79%

Red-Teaming Text-to-Image Models via In-Context Experience Replay and Semantic-Preserving Prompt Rewriting

通过上下文经验回放和语义保留提示重写对文本到图像模型进行红队测试

Zhi-Yi Chin, Pin-Yu Chen, Wei-Chen Chiu, Mario Fritz

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心) IBM Research(IBM 研究院) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出ICER框架,通过提示重写和上下文经验回放生成流畅的对抗性提示,有效提升图像生成模型的安全性测试能力,实验表明其在多个安全机制上优于现有方法。

Comments The source code is available at https://github.com/zhiyichin/ICER

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10937 2026-05-12 cs.CV 79%

Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping

文本到图像模型的强化后训练与超线性优势塑造

Haoyuan Sun, Jing Wang, Yuxin Song, Yu Lu, Bo Fang, Yifu Luo, Jun Yin, Pengyu Zeng, Miao Zhang, Tiantian Zhang, Xueqian Wang, Shijian Lu

机构 * Nanyang Technological University(南洋理工大学) Baidu Inc.(百度公司) Zhejiang University(浙江大学) City University of Hong Kong(香港城市大学) Tsinghua University(清华大学) Jimei University(集美大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出超线性优势塑造方法,通过信息几何视角优化文本到图像模型的后训练过程,提升训练效率和生成质量,减少奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16836 2026-05-12 cs.CV cs.CL 79%

ColorConceptBench: A Benchmark for Probabilistic Color-Concept Understanding in Text-to-Image Models

ColorConceptBench:一种用于文本到图像模型中概率颜色-概念理解的基准

Chenxi Ruan, Yihan Hou, Yu Xiao, Guosheng Hu, Wei Zeng

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) China Academy of Art(中国美术学院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出ColorConceptBench,通过概率颜色分布系统评估颜色-概念关联,研究文本到图像模型对隐含概念如情感和视觉状态的理解能力,发现模型在抽象语义上的敏感性不足。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06170 2026-05-08 cs.CV 79%

DynT2I-Eval: A Dynamic Evaluation Framework for Text-to-Image Models

DynT2I-Eval: 一种用于文本到图像模型的动态评估框架

Juntong Wang, Jiarui Wang, Huiyu Duan, Lewei Li, Guangtao Zhai, Xiongkuo Min

机构 * Institute of Image Communication and Network Engineering(图像通信与网络工程研究所)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出DynT2I-Eval框架,通过动态生成提示以提升文本到图像模型的评估鲁棒性,减少过拟合和基准污染影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06012 2026-05-08 cs.CV cs.AI 79%

T2I-VeRW: Part-level Fine-grained Perception for Text-to-Image Vehicle Retrieval

T2I-VeRW: 基于部件级细粒度感知的文本到图像车辆检索

Xiao Wang, Ziwen Wang, Weizhe Kong, Wentao Wu, Yuehang Li, Aihua Zheng, Chenglong Li, Jin Tang

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出PFCVR模型,通过部件级局部对齐和双向掩码恢复模块实现文本到图像的车辆检索,构建了新的大规模数据集T2I-VeRW,实验结果显示PFCVR在两个基准数据集上均取得优异的检索准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20291 2026-04-28 cs.CV cs.CL 79%

VisRet: Visualization Improves Knowledge-Intensive Text-to-Image Retrieval

VisRet:可视化改进知识密集型文本到图像检索

Di Wu, Yixin Wan, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 VisRet通过将文本查询投影到图像模态,提升跨模态检索效果,优于传统方法,在四个基准测试中提升nDCG@30,并提高下游问答准确性。

Comments ACL 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12652 2026-04-23 cs.CV cs.AI 79%

PromptEcho: Annotation-Free Reward from Vision-Language Models for Text-to-Image Reinforcement Learning

PromptEcho:基于视觉语言模型的无标注奖励用于文本到图像强化学习

Jinlong Liu, Wanggui He, Peng Zhang, Mushui Liu, Hao Jiang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 PromptEcho通过冻结的视觉语言模型计算token级交叉熵损失,无需标注或训练奖励模型,提升文本到图像模型的提示跟随能力,实验显示在多个基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18376 2026-04-21 cs.CV 79%

Towards Robust Text-to-Image Person Retrieval: Multi-View Reformulation for Semantic Compensation

面向鲁棒的文本到图像人物检索:多视图重新公式化用于语义补偿

Chao Yuan, Yujian Zhao, Haoxuan Xu, Guanglin Niu

机构 * Beihang University(北航)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出基于大语言模型的语义补偿框架,通过多视图语义重新公式化和特征补偿提升跨模态表示一致性,解决文本到图像检索中的表达漂移问题,实验表明其在三个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16363 2026-04-21 cs.CR cs.AI cs.CV 79%

CSF: Black-box Fingerprinting via Compositional Semantics for Text-to-Image Models

CSF:通过组合语义进行文本到图像模型的黑盒指纹识别

Junhoo Lee, Mijin Koo, Nojun Kwak

机构 * Seoul National University(首尔国立大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出CSF,一种基于组合语义的黑盒指纹识别方法,用于在不接触模型内部的情况下,通过查询访问确定文本到图像模型的版权归属。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12632 2026-04-16 eess.IV cs.CV 79%

Cyclic 2.5D Perceptual Loss for Cross-Modal 3D Medical Image Synthesis: T1w MRI to Tau PET

循环2.5D感知损失用于跨模态3D医学图像合成:T1加权MRI到tau PET

Junho Moon, Symac Kim, Haejun Chung, Ikbeom Jang

机构 * Department of Artificial Intelligence, Hanyang University, Seoul, South Korea(人工智能系,翰阳大学,首尔,韩国) Department of Electronic Engineering, Hanyang University, Seoul, South Korea(电子工程系,翰阳大学,首尔,韩国) Division of Computer Engineering, Hankuk University of Foreign Studies, Yongin, South Korea(计算机工程系,韩国外语大学, Yongin,韩国) Division of AI Data Convergence, Hankuk University of Foreign Studies, Yongin, South Korea(AI数据融合系,韩国外语大学, Yongin,韩国) Division of Language & AI, Hankuk University of Foreign Studies, Seoul, South Korea(语言与AI系,韩国外语大学,首尔,韩国)

专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV

AI总结 本文提出循环2.5D感知损失用于从T1加权MRI生成tau PET,通过交替优化不同切面提升体积一致性,并标准化SUVR以提高准确性。

Comments Published in Human Brain Mapping, available at https://doi.org/10.1002/hbm.70508

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03765 2026-04-14 cs.CV 79%

ITIScore: An Image-to-Text-to-Image Rating Framework for the Image Captioning Ability of MLLMs

ITIScore: 一种图像到文本到图像评分框架,用于评估多模态大语言模型的图像描述能力

Zitong Xu, Huiyu Duan, Shengyao Qin, Guangyu Yang, Guangji Ma, Xiongkuo Min, Ke Gu, Guangtao Zhai, Patrick Le Callet

机构 * Shanghai Jiao Tong University(上海交通大学) University of Electronic and Science Technology of China(电子科技大学) Beijing University of Technology(北京工业大学) Institut Universitaire de France (IUF), University of Nantes(法国大学研究院(IUF),南特大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出ICBenchmark图像描述基准,包含12类内容和2K图像生成的40K短长描述,提出ITIScore自动评估指标,通过图像到文本到图像框架衡量描述质量,实验显示其与人类判断一致且具有强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06313 2026-04-14 cs.CV cs.CY 79%

Text-to-Image Models and Their Representation of People from Different Nationalities Engaging in Activities

文本到图像模型及其对不同民族参与活动的人的表示

Abdulkareem Alsudais

机构 * Prince Sattam bin Abdulaziz University(沙特王子萨塔姆·本·阿卜杜勒阿齐兹大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 研究分析了DALL-E 3和Gemini 3 Pro Preview在生成日常活动图像时对206个民族的表示,发现传统服饰在某些活动中不适用,且与地区和收入组相关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02355 2026-04-06 cs.LG cs.CV 79%

From Broad Exploration to Stable Synthesis: Entropy-Guided Optimization for Autoregressive Image Generation

从广泛探索到稳定合成:基于熵的优化用于自回归图像生成

Han Song, Yucheng Zhou, Jianbing Shen, Yu Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) University of Macau(澳门大学)

专题命中 文生图 :image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 本文提出基于熵的优化方法EG-GRPO,通过调整不确定性分配提升文本到图像生成的稳定性与质量,实验显示其在标准基准上达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13129 2026-04-02 cs.CV cs.AI cs.LG 79%

Science-T2I: Addressing Scientific Illusions in Image Synthesis

Science-T2I: 解决图像合成中的科学幻觉

Jialuo Li, Wenhao Chai, Xingyu Fu, Haiyang Xu, Saining Xie

机构 * New York University(纽约大学) University of Washington(华盛顿大学) University of Pennsylvania(宾夕法尼亚大学) University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 文生图 :image synthesis(title);image generation(abstract);分类 cs.CV

AI总结 本文提出ScienceT2I数据集,评估18种图像生成模型,发现科学提示能显著提升生成效果,提出SciScore奖励模型和两阶段对齐框架提升科学推理能力。

Comments Accepted to CVPR 2025. Code, docs, weight, benchmark and training data are all avaliable at https://jialuo-li.github.io/Science-T2I-Web

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26328 2026-03-30 cs.CV 79%

Verify Claimed Text-to-Image Models via Boundary-Aware Prompt Optimization

通过边界感知提示优化验证声称的文本到图像模型

Zidong Zhao, Yihao Huang, Qing Guo, Tianlin Li, Anran Li, Kailong Wang, Jin Song Dong, Geguang Pu

机构 * Zhejiang University(浙江大学) East China Normal University(华东师范大学) Nankai University(南开大学) Beihang University(北京航空航天大学) University of Science and Technology of China(中国科学技术大学) Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出边界感知提示优化方法,通过识别模型特定的边界相邻提示来验证文本到图像模型的真实性,实验显示其验证准确率优越。

Comments Accepted to CVPR 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25819 2026-03-30 cs.CV 79%

Geo$^\textbf{2}$: Geometry-Guided Cross-view Geo-Localization and Image Synthesis

Geo²:基于几何的跨视角地理定位与图像合成

Yancheng Zhang, Xiaohan Zhang, Guangyu Sun, Zonglin Lyu, Safwan Wshah, Chen Chen

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所) University of Vermont(佛蒙特大学)

专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV

AI总结 本文提出Geo²框架,利用几何先验知识联合完成跨视角地理定位和双向图像合成,通过共享3D感知潜在空间和GeoFlow模型提升性能。

Journal ref 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10766 2026-03-25 cs.CR cs.AI cs.CV 79%

Metaphor-based Jailbreak Attacks on Text-to-Image Models

基于隐喻的文本到图像模型劫持攻击

Chenyu Zhang, Lanjun Wang, Yiwen Ma, Wenhui Li, Yi Tu, An-An Liu

机构 * Huawei Technologies Co Ltd.(华为技术有限公司)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出基于隐喻的劫持攻击方法,通过生成隐喻对抗提示绕过未知或多样化的防御机制,实验表明其在攻击性能和查询效率方面优于基线方法。

Comments Code is available in \url{https://github.com/datar001/metaphor-based-jailbreaking-attack}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21213 2026-03-24 cs.CV cs.AI 79%

Positional Segmentor-Guided Counterfactual Fine-Tuning for Spatially Localized Image Synthesis

基于位置分割器的反事实微调用于空间局部化图像合成

Tian Xia, Matthew Sinclair, Andreas Schuh, Fabio De Sousa Ribeiro, Raghav Mehta, Rajat Rasal, Esther Puyol-Antón, Samuel Gerber, Kersten Petersen, Michiel Schaap, Ben Glocker

机构 * Department of Computing, Imperial College London, UK(帝国理工学院 computing 部,英国) HeartFlow, Inc., Mountain View, CA, USA(HeartFlow 公司,美国加州山景城)

专题命中 文生图 :image synthesis(title);image generation(abstract);分类 cs.CV

AI总结 本文提出Positional Seg-CFT,通过将每个结构细分为区域并独立测量每个区域,实现空间局部化的反事实生成,提升冠状动脉CT血管造影中疾病建模的精细空间控制。

详情

展开后加载摘要…

URL PDF HTML 收藏