MIRAGE: Protecting against Malicious Image Editing via False Moderation
MIRAGE: 通过虚假审核保护图像免受恶意编辑
专题命中 图像编辑 :image editing(title,abstract)
AI总结 提出MIRAGE方法,通过对抗性扰动使审核分类器将图像标记为违规,从而阻止AI图像编辑,无需模型权重或提示,在商业API上成功率超88%。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
MIRAGE: 通过虚假审核保护图像免受恶意编辑
专题命中 图像编辑 :image editing(title,abstract)
AI总结 提出MIRAGE方法,通过对抗性扰动使审核分类器将图像标记为违规,从而阻止AI图像编辑,无需模型权重或提示,在商业API上成功率超88%。
PRIVATEDIT:面向面部生成图像编辑的隐私保护流程
机构 * Elmore Family School of Electrical and Computer Engineering, Purdue University(帕克大学埃尔莫尔工程学院) ; National Institute of Standards and Technology(国家标准与技术研究院) ; Rice University(里奇大学) ; Department of Physics, Colorado State University(科罗拉多州立大学物理系) ; Electrical Engineering Department, University of Colorado(科罗拉多大学电气工程系)
专题命中 图像编辑 :image editing(title,abstract)
AI总结 PRIVATEDIT提出了一种隐私保护的面部生成图像编辑流程,通过设备端分割和遮罩技术实现用户对生物特征数据的控制,无需修改第三方模型,确保隐私安全。
Comments Accepted to IEEE Transactions on Artificial Intelligence, Feb 2026
风格迁移作为偏见缓解:用于阿拉伯语合成心理健康文本的扩散模型
机构 * School of Engineering and Applied Science(工程与应用科学学院) ; George Washington University(乔治·华盛顿大学)
专题命中 图像编辑 :diffusion(title,abstract)
AI总结 本文提出基于扩散模型的风格迁移方法,用于生成阿拉伯语心理健康文本,以缓解性别偏见问题。
机构 * RPTU Kaiserslautern-Landau(凯斯莱特大学) ; Fraunhofer ITWM(弗劳恩霍夫研究所) ; TU Munich(慕尼黑技术大学) ; University of California(加州大学)
专题命中 图像编辑 :diffusion(title,abstract)
专题命中 图像编辑 :image editing(title,abstract)
Comments We identified issues in the experimental results and want to withdraw the paper. We plan to submit an updated version once these issues have been resolved
专题命中 图像编辑 :diffusion(title,abstract)
专题命中 图像编辑 :image editing(title,abstract)
Comments ASSETS 2024
专题命中 图像编辑 :diffusion(title,abstract)
Comments 8 pages, 6 figures, ICMC 2023
Journal ref International Computer Music Conference (ICMC 2023) pp. 40-47, October 2023
专题命中 图像编辑 :diffusion(title,abstract)
专题命中 图像编辑 :diffusion(title,abstract)
Comments 7 pages, 4 figures, AAAI 2024
专题命中 图像编辑 :image editing(title,abstract)
专题命中 图像编辑 :diffusion(title,abstract)
Comments Accepted at Repl4NLP workshop at ACL 2023
专题命中 图像编辑 :diffusion(title,abstract)
Comments Preprint. Work in progress
专题命中 图像编辑 :image editing(title,abstract)
Comments Accepted at 2nd Conversational AI Workshop at NeurIPS 2018
专题命中 图像编辑 :image editing(title,abstract)
TransAnyText:通过结构化视觉生成实现电商图像中任意文本的翻译
专题命中 图像编辑 :diffusion(abstract);image editing(abstract);inpainting(abstract);分类 cs.CV
AI总结 本文提出TransAnyText框架,将电商图像文本翻译转化为生成可渲染HTML补丁,经三阶段后训练优化,在多基准上表现优于对比方法,为跨境电商图像翻译提供有效可控的解决方案。
UniSpace:统一视觉表示与可扩展多模态建模
机构 * Meituan(美团)
专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV
AI总结 本文提出 UniSpace,通过 Patch Reparameterization 改进语义 ViT,构建 80 亿参数的 Transformer 专家混合模型,实现同一视觉空间内的理解、生成与编辑,提升重建效果,支持文本到图像生成和指令式图像编辑。
VETO:面向保护图像免受前沿AI编辑的侵害
专题命中 图像编辑 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV
AI总结 针对前沿AI图像编辑模型的滥用问题,提出抗编辑伪装VETO,引入评估基准VetoBench,实验显示其在保护与保真度权衡上优于现有防御。
DisciplineGen-1M:用于多学科视觉生成与编辑的大规模数据集
机构 * Shanghai Jiao Tong University(上海交通大学) ; South China University of Technology(华南理工大学) ; Xiamen University(厦门大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV
AI总结 提出百万级多学科数据集DisciplineGen-1M,涵盖10个学科,通过可扩展框架构建,并基于此开发学科感知推理生成模型,在学科和通用推理基准上显著提升。
统一多模态自回归建模:共享上下文-视觉分词器是实现统一的关键
机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身AI研究院,复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Qwen Team, Alibaba Inc.(通义实验室,阿里公司)
专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 提出UniAR框架,通过单一离散视觉分词器桥接视觉理解与生成,采用并行位预测和扩散解码,在图像生成和编辑上达到最优,同时保持多模态理解竞争力。
Comments ICML2026. Project page https://sharelab-sii.github.io/uniar-web
FireRed-Image-Edit-1.0 技术报告
机构 * Super Intelligence Team(超级智能团队) ; Xiaohongshu Inc.(小红书公司)
专题命中 图像编辑 :text-to-image(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 提出FireRed-Image-Edit扩散变换器,通过数据整理、多阶段训练和评估优化,在指令图像编辑上达到最先进性能,并开源代码、模型和基准。
SIGMA: 基于语义差异的指令引导掩码标注器用于文本驱动图像操作定位
机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; Guangdong Provincial Key Laboratory of Intelligent Information Processing and Shenzhen Key Laboratory of Media Security(广东省智能信息处理重点实验室和深圳媒体安全重点实验室) ; Shenzhen University of Advanced Technology and Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术大学和深圳先进技术研究所,中国科学院) ; Alibaba Group(阿里巴巴集团) ; Shenzhen MSU-BIT University(深圳MSU-BIT大学)
专题命中 图像编辑 :diffusion(abstract);image editing(abstract);inpainting(abstract);分类 cs.CV
AI总结 提出SIGMA方法,通过视觉基础模型中的语义特征差异和指令引导的空间先验,自动从公开编辑数据集中生成像素级掩码,用于训练图像操作定位模型,在五个基准上F1提升12.20%,并生成约110万训练集使六个检测器平均F1提升18.34%。
Qwen-Image-2.0 技术报告
机构 * Qwen Team(通义实验室)
专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 Qwen-Image-2.0 通过多模态扩散变换器和定制化训练流程,统一高保真生成与精确图像编辑,提升多语言文本精度、高分辨率逼真度及复杂指令遵循能力。
OmniGen2:面向指令对齐的多模态生成
机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; University of Science and Technology of China(中国科学技术大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Zhejiang University(浙江大学)
专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV
AI总结 OmniGen2通过双解码路径和解耦图像分词器,实现文本和图像生成的统一解决方案,提升多模态生成任务的性能与一致性,同时提供开源模型和数据集支持。
基于视觉指令的编辑器:VIBE
机构 * R&D Department, SALUTEDEV(SALUTEDEV 研发部)
专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 VIBE提出一种轻量级基于指令的图像编辑方法,使用2B参数模型和1.6B参数扩散模型,在保持高质量的同时实现低推理成本和源一致性。
Qwen-Image-Layered: 通过层分解实现内在可编辑性
机构 * HKUST(GZ)(香港科技大学(广州)) ; Alibaba(阿里巴巴)
专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 Qwen-Image-Layered通过层分解实现图像的内在可编辑性,提出端到端扩散模型及多阶段训练策略,提升图像分解质量与编辑一致性。
Comments 12 pages, 8 figures
双关注引导的对抗恶意编辑防御
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ; University of China Academy of Sciences(中国科学院大学) ; School of Computer Science, China University of Geosciences(中国地质大学(武汉)计算机学院)
专题命中 图像编辑 :text-to-image(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 本文提出双关注引导的噪声扰动方法,通过干扰模型的注意力和噪声预测机制,有效防御恶意编辑攻击。
Comments 11 pages, 7 figures
机构 * Department of Artificial Intelligence, University of Hanyang, Seoul, Korea(人工智能系,翰阳大学,韩国首尔) ; Department of Computer Science, University of Hanyang, Seoul, Korea(计算机科学系,翰阳大学,韩国首尔)
专题命中 图像编辑 :text-to-image(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV
Comments ICML 2025
机构 * EECE, UCAS(UCAS电子工程系) ; UCAS Beijing China(UCAS北京) ; IIP, ICT, CAS(中国科学院信息工程研究所) ; SCST, UCAS(UCAS软件学院) ; ICT, CAS Beijing China(中国科学院信息工程研究所)
专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV
机构 * MIT LIDS(麻省理工学院LIDS) ; MIT CSAIL(麻省理工学院CSAIL) ; Meta FAIR
专题命中 图像编辑 :image generation(abstract);image editing(abstract);inpainting(abstract);分类 cs.CV
Comments Main manuscript: 9 pages, 7 figures. Appendix: 8 pages, 9 figures. To appear in the Proceedings of the 42nd International Conference on Machine Learning