MIEScore: Human-Aligned Evaluation for Multi-Source Image Editing
MIEScore:面向多源图像编辑的人类对齐评估方法
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.MM
AI总结 针对多源图像编辑(MIE)缺乏人类对齐评估基准的问题,研究构建了首个MIE基准MIE-Bench,并提出基于MLLM的评估模型MIEScore,其对齐人类偏好性能最优且泛化性良好。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
MIEScore:面向多源图像编辑的人类对齐评估方法
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.MM
AI总结 针对多源图像编辑(MIE)缺乏人类对齐评估基准的问题,研究构建了首个MIE基准MIE-Bench,并提出基于MLLM的评估模型MIEScore,其对齐人类偏好性能最优且泛化性良好。
ResEdit:用于精确生成式图像编辑的残差嵌入
机构 * Adobe Research(Adobe研究院) ; University of Cambridge(剑桥大学)
专题命中 图像编辑 :image editing(title);diffusion(abstract);分类 cs.CV、cs.GR
AI总结 提出残差图像编码作为额外条件,结合梯度反转优化策略,在保持图像身份和全局一致性的同时实现高保真精确编辑。
Comments Accepted to the EGSR 2026 journal track
Journal ref Computer Graphics Forum 45(4), e70551 (2026)
HandEdit:用于自我中心视角下人类到机器人灵巧手图像编辑的统一基准
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 HandEdit是含2亿+实例、覆盖26种URDF的统一具身感知图像编辑基准,用于弥合人类与机器人数据差异,可评估11种图像编辑基线,助力具身人工智能发展。
Comments Technical Report. Project Page: https://handedit.github.io/
SI-Edit:面向草图-指令引导的像素级精度局部图像编辑
机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) ; City University of Macau(澳门城市大学) ; Meitu Inc(美图公司)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 针对基于草图的图像编辑缺乏像素级精度及对应数据集、评估指标的问题,提出SI-Edit框架,构建SI-Data数据集并建立评估指标,实现更可靠的结构控制与像素级局部编辑效果。
Comments accepted by ACM MM 2026
JoyAI-Video-Edit:基于自回归扩散的实时开放式视频编辑
专题命中 图像编辑 :diffusion(title,abstract);分类 cs.CV
AI总结 研究针对实时视频编辑的低延迟、时序一致等需求,提出160亿参数的JoyAI-Video-Edit自回归扩散框架,结合多种蒸馏技术,在单张Nvidia B200 GPU上实现约30 FPS的720p视频编辑,性能优于现有流式编辑器且与离线系统相当。
Comments Code: https://github.com/jd-opensource/JoyAI-Video-Edit
RIDGE:用于图像编辑的基于内部动态引导的重加噪方法
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 该研究针对无反转图像编辑中等位移构造的缺陷,提出RIDGE方法,通过重加噪与内部动态引导优化编辑,在多基准实验中实现了源保留、目标对齐与感知质量的良好权衡。
MDTD-ArtIR:针对纹理叠加退化的艺术图像修复的图像编辑与修复模型基准测试
机构 * Durham University(杜伦大学)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 本研究构建MDTD-Art基准及MDTD-Art数据集,对比各类模型,发现图像编辑模型在艺术图像修复中优于专用修复架构,结构化提示可放大其性能优势。
Comments 15 pages, 6 figures, 6 tables. Preprint submitted to Elsevier Journal of Visual Communication and Image Representation
面向电商图像生成的元素感知组学习
专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV
AI总结 针对电商图像生成中GRPO仅在完整提示层面分配信用的缺陷,提出EAGLE-GRPO,通过分解奖励并推导闭式解实现元素级信用分配,提升提示质量与生成图像性能。
RS-RIE-Bench:推理引导的遥感图像编辑基准测试
机构 * Huawei(华为)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 该研究针对遥感图像编辑,引入RS-RIE-Bench基准,将任务分类,通过特定评估协议和方法评估模型,经实验发现当前模型在推理引导的遥感编辑中有局限,为未来模型提供了基准和研究方向。
为了融入,首先解耦:通过上下文解耦表示重新思考伪装图像生成
机构 * Beihang University(北京航空航天大学) ; Geely Automobile Research Institute (Ningbo) Co., Ltd(吉利汽车研究院(宁波)有限公司)
专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV
AI总结 研究伪装图像生成问题,提出上下文解耦生成范式CamoDreamer,通过设计对比感知上下文桥等方法,将潜在伪装特征解耦为物体和背景控制流,实验证明其显著优于现有方法且设计轻量。
Comments 14 pages, 11 figures, ACMMM 2026
在对话式图像编辑中明确隐式保留意图
机构 * Sogang University(西江大学) ; Korea University(高丽大学) ; Chung-Ang University(中央大学)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 研究对话式图像编辑中隐式保留意图的问题,提出无需训练的ReSpec框架,通过配对恢复感知指令与历史视觉参考使隐式保留明确化,实验显示该框架提升了恢复保真度和时间一致性。
小波引导的语义信号补偿用于无反转图像编辑
机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 针对无反转图像编辑中全局属性编辑不足的问题,提出基于小波的频率感知语义补偿策略,在生成早期增强有效信号,提升全局编辑能力同时保持背景保真度。
Comments Accepted to ECCV 2026
SpatialFlow-GRPO:空间信用驱动图像编辑
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Kuaishou Technology(快手科技)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 提出SpatialFlow-GRPO框架,通过引入空间细粒度奖励反馈,将区域感知奖励转化为语义区域级优化信号,解决图像编辑中空间均匀性假设问题,显著提升编辑质量。
PhyEditBench: 一个用于物理感知图像编辑的真实世界多阶段基准
机构 * Nanjing University(南京大学) ; SDU(山东大学) ; HRBEU(哈尔滨工程大学) ; SDUTCM(山东中医药大学) ; USTC(中国科学技术大学)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 提出PhyEditBench基准,通过分层分类和真实/反物理实例评估编辑模型的物理理解能力,并引入训练无关基线PhyWorld利用视频生成推理。
Comments 19 pages, 6 figures, 2 tables. Accepted to ECCV 2026
BoxCtrl: 面向几何图像编辑的3D感知视觉提示
机构 * City University of Hong Kong(香港城市大学) ; Tencent(腾讯)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 提出BoxCtrl框架,通过投影到2D的RGB 3D边界框作为视觉提示,结合监督微调与强化学习两阶段训练,实现精确的3D几何编辑(平移、旋转、缩放等),达到最先进性能。
Comments Accepted by SIGGRAPH 2026
RS-Gen:用于推理和搜索增强图像生成的多阶段智能体框架
机构 * MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)
专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV
AI总结 提出RS-Gen,一种即插即用、无需训练的多阶段图像智能体框架,通过“提问-解决”闭环机制进行逻辑推理和知识补全,显著提升基础图像生成与编辑模型在模糊意图和分布外知识场景下的性能。
ImageWAM:世界动作模型真的需要视频生成,还是只需要图像编辑?
机构 * Shanghai Jiao Tong University(上海交通大学) ; Eastern Institute of Technology(东方理工学院) ; Tencent Robotics X(腾讯机器人X) ; Tsinghua University(清华大学) ; Zhongguancun Academy(中关村学院)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 提出ImageWAM框架,利用预训练图像编辑模型替代视频生成进行机器人动作预测,通过编辑去噪的KV缓存作为世界动作上下文,在多个模拟和真实实验中优于基线,计算量降至1/6,延迟降至1/4。
Comments Project Page: https://zhangwenyao1.github.io/ImageWAM/
ProductConsistency:通过SFT和RL改进基于指令的图像编辑中的产品身份保持
机构 * Fractal Analytics
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 针对基于指令的图像编辑中产品特征保持不足的问题,提出ProductConsistency数据集和循环一致性奖励,结合监督微调与强化学习,显著提升产品一致性、文本渲染和视觉质量。
Comments CVPR HiGen 2026
文本-视觉协同指导的图像编辑
机构 * The Hong Kong Polytechnic University(香港理工大学) ; OPPO Research Institute(OPPO研究院)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 提出TV-Edit框架,联合文本指令的语义表达与稀疏视觉指令的空间引导,实现精确且忠实于意图的图像编辑,显著优于现有方法。
SceneCraft: 基于场景图的交互式图像编辑系统
机构 * University of Science, Ho Chi Minh, Vietnam(胡志明市理科大学) ; Vietnam National University, Ho Chi Minh, Vietnam(越南国家大学胡志明市) ; University of Dayton, Dayton, Ohio, USA(代顿大学)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 提出SceneCraft框架,通过场景图表示图像,用户直接操作图结构进行复杂编辑,自动生成精确提示,降低语言歧义,提升编辑质量和用户控制。
注意差距:诊断图像内文本编辑中的约束发现失败
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 通过图像内文本编辑的受控诊断,研究多模态模型在发现未明确指定的视觉依赖约束时的失败,发现模型仅能自行发现46%的约束,而明确提供时可达94%。
单轮与多轮指令式图像编辑的广泛基准
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) ; National University of Singapore(新加坡国立大学)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 提出I2EBench2.0基准,通过16个单轮和7个多轮维度评估指令式图像编辑模型,结合用户研究确保与人类判断一致,并基于八种模型分析提供研究指导。
Comments Accepted by International Journal of Computer Vision (IJCV), 2026
自适应推理时间缩放:基于早期步骤潜在验证的图像编辑
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; Microsoft Research Asia(微软亚洲研究院) ; Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 提出VeriLatent框架,通过早期步骤潜在空间编辑激活图验证初始噪声,实现自适应推理时间缩放,提升图像编辑质量和效率。
通过ChordEdit重新思考一步图像编辑:复现、简化与新见解
机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 本文通过复现、消融和简化ChordEdit,揭示其机制:和弦窗口作为时间步偏移,和弦传输执行低频语义编辑,近端对齐补充高频细节,从而将编辑分解为粗低频传输和细高频对齐两个阶段,为自适应编辑提供新路径。
Comments 9 pages
IEA:通过三阶段多任务对齐的业余友好型对话式图像编辑代理
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institution(上海创新研究院) ; Huawei Technologies Ltd.(华为技术有限公司) ; Nanyang Technological University(南洋理工大学) ; Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 提出IEA对话式图像编辑代理,通过三阶段多任务训练学习操作参数化工具,实现可解释编辑轨迹,在像素距离和ROUGE-L指标上优于基线,用户研究中指令跟随和感知质量表现最佳。
Comments [CVPR 2026 Findings] Our data and code are released at https://github.com/OpenDFM/Image_Edit_Agent
MIRAGE: 通过虚假审核保护图像免受恶意编辑
专题命中 图像编辑 :image editing(title,abstract)
AI总结 提出MIRAGE方法,通过对抗性扰动使审核分类器将图像标记为违规,从而阻止AI图像编辑,无需模型权重或提示,在商业API上成功率超88%。
TransAnyText:通过结构化视觉生成实现电商图像中任意文本的翻译
专题命中 图像编辑 :diffusion(abstract);image editing(abstract);inpainting(abstract);分类 cs.CV
AI总结 本文提出TransAnyText框架,将电商图像文本翻译转化为生成可渲染HTML补丁,经三阶段后训练优化,在多基准上表现优于对比方法,为跨境电商图像翻译提供有效可控的解决方案。
UniSpace:统一视觉表示与可扩展多模态建模
机构 * Meituan(美团)
专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV
AI总结 本文提出 UniSpace,通过 Patch Reparameterization 改进语义 ViT,构建 80 亿参数的 Transformer 专家混合模型,实现同一视觉空间内的理解、生成与编辑,提升重建效果,支持文本到图像生成和指令式图像编辑。
VETO:面向保护图像免受前沿AI编辑的侵害
专题命中 图像编辑 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV
AI总结 针对前沿AI图像编辑模型的滥用问题,提出抗编辑伪装VETO,引入评估基准VetoBench,实验显示其在保护与保真度权衡上优于现有防御。
DisciplineGen-1M:用于多学科视觉生成与编辑的大规模数据集
机构 * Shanghai Jiao Tong University(上海交通大学) ; South China University of Technology(华南理工大学) ; Xiamen University(厦门大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV
AI总结 提出百万级多学科数据集DisciplineGen-1M,涵盖10个学科,通过可扩展框架构建,并基于此开发学科感知推理生成模型,在学科和通用推理基准上显著提升。